Thinking Machines, 상호작용 모델 공개
Fully Realtime Interaction Models
·2026.05.14 11:25
Thinking Machines가 오디오·비디오·텍스트를 실시간으로 다루는 연구 프리뷰를 공개했다.
Thinking Machines가 Interaction Models 연구 프리뷰를 공개했다.
- 모델은 audio, video, text를 동시에 받아 실시간으로 응답하고, 필요하면 즉시 개입하는 상호작용을 목표로 한다.
- 핵심 설계는 200ms micro-turn 단위로 입력과 출력을 이어 붙이는 시간 정렬 방식이다.
- 별도 하네스 대신 모델 내부에서 대화 흐름, 중단, 동시 발화, 시각 신호를 직접 처리한다.
- 백그라운드 모델이 장기 추론과 툴 사용을 맡고, 상호작용 모델은 그 결과를 대화에 계속 반영한다.
- 공개한 TML-Interaction-Small은 276B MoE이며 활성 파라미터는 12B라고 밝혔다.
- FD-bench v1.5와 Audio MultiChallenge를 통해 상호작용성과 지능을 함께 평가했으며, turn-taking latency 0.40초를 제시했다.
- 회사는 향후 몇 달 내 제한적 연구 프리뷰를 열고, 연내 더 큰 모델과 더 넓은 공개를 예고했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.