AI Briefing

마이크로소프트 리서치, AI 멀티턴 대화의 '놀라운 실패'와 개선 방안 공개

·2026.10.07 01:19

핵심 내용

마이크로소프트 리서치, AI가 멀티턴 대화에서 성능이 저하되는 현상을 분석하고 개선 방안을 제시했다.

1 / 3

자세히 보기

멀티턴 대화의 '놀라운 실패'

마이크로소프트 리서치의 제니퍼 네빌(Jennifer Neville) 파트너 리서치 매니저와 채드 아탈라(Chad Atalla) 수석 응용 과학자는 기존 벤치마크를 넘어선 AI 시스템의 한계를 논의했다. 네빌의 AI 상호작용 및 학습 팀은 실제 업무 환경에서의 AI 행동을 연구한다.

핵심 발견은 모델이 단일 턴 벤치마크에서는 높은 성능을 보이지만, 사용자가 요구사항을 점진적으로 명확히 하는 멀티턴 시나리오에서는 성능이 급격히 저하된다는 점이다. 이러한 '놀라운 실패'는 대화가 진행됨에 따라 모델이 맥락과 의도를 잃어버리기 때문에 발생한다.

해결 방안 및 사용자 전략

  • 팀은 멀티턴 행동을 개선하기 위해 강화 학습 방법을 개발 중이다.
  • 혼란이 발생할 경우 채팅을 초기화하거나, 완전히 지정된 단일 턴 프롬프트를 제공하는 것이 권장된다.
  • 연구는 프라이버시를 보호하는 방식으로 마이크로소프트 제품의 소비자 로그를 분석하여, 원시 데이터 접근 없이 성공과 실패의 고수준 패턴을 추출한다.

장기 워크플로우와 아키텍처 한계

반복적인 문서 편집 등 장기 워크플로우에서는 에이전트가 상태를 유지하고 사용자 의도를 추적하는 데 어려움을 겪는다. 네빌은 인간에게 쉬운 작업이 AI, 특히 Transformer 아키텍처에게는 반드시 쉽지만은 않다고 지적한다. 현재는 에이전틱 하네스와 백엔드 추론을 사용해 이러한 한계를 완화하고 있다.

네빌은 AI를 100% 정확도를 기대하는 존재가 아니라, 인간의 감독과 검증을 필요로 하는 생산성 도구로 취급할 것을 조언한다. 또한 향후 모델 개선을 위해 상세한 피드백을 제공할 것을 권장했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.