SeedRealtime, 전이중 AI 공개
SeedRealtime: ByteDance Seed의 보면서 듣고 말하는 전이중(Full-Duplex) 모델
·2026.08.08 09:30
핵심 내용
ByteDance Seed가 오디오·영상을 실시간 처리하는 전이중 모델 SeedRealtime을 Doubao에 배포했다.
자세히 보기
ByteDance Seed가 오디오와 영상을 동시에 이해하고, 사용자의 발화 중에도 듣고 보며 스스로 말할 시점을 판단하는 전이중(Full-Duplex) 모델 SeedRealtime을 공개했다.
기존 음성 AI는 VAD가 사용자의 발화 종료를 감지한 뒤 응답하는 반이중 구조가 일반적이었다. SeedRealtime은 오디오·영상 입력과 대화 타이밍 판단, 음성 출력을 하나의 종단간 모델로 통합해 다음 기능을 겨냥한다.
- 화면 정보를 활용한 오디오·비주얼 결합 이해
- 장면 변화나 상황에 따른 능동적 상호작용
- 배경 소음과 잡담을 구분하며 끼어들거나 기다리는 자연스러운 대화 타이밍
ByteDance Seed는 자체 사람 평가에서 캐스케이드 방식 대비 발화 끊김, 응답 지연, 배경 소음 오인 반응 등 대화 타이밍 문제가 절반으로 감소했다고 밝혔다. 다만 가중치, 기술 보고서, 공개 API는 제공되지 않았으며, 모델은 ByteDance의 Doubao 앱에 배포된 서비스 형태로 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.