마이크로소프트 리서치, AI 멀티턴 대화의 '놀라운 실패'와 개선 방안 공개
·2026.10.07 01:19
핵심 내용
마이크로소프트 리서치, AI가 멀티턴 대화에서 성능이 저하되는 현상을 분석하고 개선 방안을 제시했다.
1 / 3
자세히 보기
멀티턴 대화의 '놀라운 실패'
마이크로소프트 리서치의 제니퍼 네빌(Jennifer Neville) 파트너 리서치 매니저와 채드 아탈라(Chad Atalla) 수석 응용 과학자는 기존 벤치마크를 넘어선 AI 시스템의 한계를 논의했다. 네빌의 AI 상호작용 및 학습 팀은 실제 업무 환경에서의 AI 행동을 연구한다.
핵심 발견은 모델이 단일 턴 벤치마크에서는 높은 성능을 보이지만, 사용자가 요구사항을 점진적으로 명확히 하는 멀티턴 시나리오에서는 성능이 급격히 저하된다는 점이다. 이러한 '놀라운 실패'는 대화가 진행됨에 따라 모델이 맥락과 의도를 잃어버리기 때문에 발생한다.
해결 방안 및 사용자 전략
- 팀은 멀티턴 행동을 개선하기 위해 강화 학습 방법을 개발 중이다.
- 혼란이 발생할 경우 채팅을 초기화하거나, 완전히 지정된 단일 턴 프롬프트를 제공하는 것이 권장된다.
- 연구는 프라이버시를 보호하는 방식으로 마이크로소프트 제품의 소비자 로그를 분석하여, 원시 데이터 접근 없이 성공과 실패의 고수준 패턴을 추출한다.
장기 워크플로우와 아키텍처 한계
반복적인 문서 편집 등 장기 워크플로우에서는 에이전트가 상태를 유지하고 사용자 의도를 추적하는 데 어려움을 겪는다. 네빌은 인간에게 쉬운 작업이 AI, 특히 Transformer 아키텍처에게는 반드시 쉽지만은 않다고 지적한다. 현재는 에이전틱 하네스와 백엔드 추론을 사용해 이러한 한계를 완화하고 있다.
네빌은 AI를 100% 정확도를 기대하는 존재가 아니라, 인간의 감독과 검증을 필요로 하는 생산성 도구로 취급할 것을 조언한다. 또한 향후 모델 개선을 위해 상세한 피드백을 제공할 것을 권장했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.