inclusionAI, 실시간 멀티모달 대화 모델 공개
inclusionAI/Realtime-Venus · Hugging Face
·2026.09.19 00:27
핵심 내용
inclusionAI가 영상과 음성을 실시간으로 처리하는 9B 규모 멀티모달 대화 모델 Realtime-Venus를 공개했다.
자세히 보기
inclusionAI가 Hugging Face를 통해 실시간 멀티모달 대화 시스템 Realtime-Venus의 체크포인트 2종을 공개했다. 이 모델은 MiniCPM-o 4.5를 기반으로 개발되었으며, 사용자가 프롬프트를 입력하지 않아도 상황을 파악하고 먼저 반응하는 능동적 상호작용(proactive interaction) 기능을 지원한다.
주요 특징
- 네이티브 풀듀플렉스 대화: 말하는 중에도 주변을 계속 인식하며, 사용자의 백채널(backchannels), 중단, 수정 등을 구분하여 자연스럽게 대응한다.
- 능동적 상호작용: 시간적으로 정렬된 영상과 오디오를 지속적으로 처리하여, 응답이 필요한 이벤트 발생 시 사용자 입력 대기 없이 먼저 대화를 시작한다.
- 학습 없는 장기 영상 메모리: 중요한 시각적 정보를 저장하고 쿼리와 관련된 비중복 자료를 검색하여 컨텍스트를 재구성하는 방식으로, 추가 학습 없이 긴 영상 내용을 이해한다.
- 비동기 위임(Delegation): 대화 흐름을 방해하지 않도록 외부 백엔드 작업을 스트림 내에서 요청하고 결과를 비동기적으로 처리한다.
모델 구성
공개된 모델은 두 가지 버전으로 제공된다.
- Realtime-Venus-Omni: 9B 규모의 오디오-비주얼 상호작용 모델로, 텍스트와 음성 출력을 동시에 생성한다.
- Realtime-Venus-Audio: 오디오 처리에 특화된 모델로, 오디오 기반 대화와 텍스트/음성 출력을 지원한다.
두 모델 모두 Hugging Face에서 다운로드 가능하며, 외부 도구 연동을 위한 런타임인 Realtime-Venus-Harness는 GitHub 저장소에서 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.