AlphaGo 공동 개발자 Graepel, LLM의 진정한 추론 부재 주장하며 감사 가능한 인식 상태 아키텍처 제안
핵심 내용
AlphaGo 공동 개발자 Thore Graepel이 LLM의 한계를 지적하며 감사 가능한 인식 상태 아키텍처를 제안했다.
자세히 보기
University College London의 기계학습 교수이자 AlphaGo 팀의 핵심 멤버였던 Thore Graepel은 현재 대규모 언어 모델(LLM)이 진정한 추론 능력을 갖추지 못했다고 주장한다. 그는 LLM을 AlphaGo와 비교하며, AlphaGo가 신경망 직관(System 1)과 명시적인 탐색 메커니즘(System 2)을 결합해 미래 결과를 평가했다고 설명했다. AlphaGo의 정책 네트워크는 빠른 직관을 제공했지만, 탐색 메커니즘은 가능한 미래의 게임 트리를 구성하고 저울질하여 느리고 신중한 평가를 수행했다.
Chain-of-Thought의 한계
Graepel은 LLM의 chain of thought 같은 기술이 동일한 다음 토큰 예측 프로세스를 더 오래 반복할 뿐이므로 불충분하다고 주장한다. 그는 LLM이 진정한 추론자로 간주될 수 없는 세 가지 구체적인 결함을 지적한다:
- 지속적인 인식 상태의 부재: LLM은 가설, 신뢰도 수준, 미해결 질문을 명시적이고 검사 가능한 장부로 유지하며 체계적으로 수정하지 못한다.
- 지식과 추론의 혼재: 신경망에서는 지식과 추론 논리가 가중치 내에서 분리 불가능하며, 독립적으로 명시적으로 표현된 믿음의 집합이 없다.
- 사후 합리화: 연구에 따르면 LLM은 종종 답에 도달한 후 추론 체인을 생성하며, 실제 결론 도출 과정과 일치하지 않는 경로를 보고한다.
감사 가능한 추론의 필요성
저자는 의료 및 과학 연구와 같은 고위험 분야에서 결론 자체만큼이나 결론에 도달하는 과정이 중요하다고 강조한다. 신뢰할 수 있는 AI를 달성하기 위해 Graepel은 AlphaGo의 게임 트리에서 영감을 받은 새로운 아키텍처를 제안한다. 이 시스템은 확정된 사실, 의심, 미해결 질문을 나타내는 epistemic state를 유지한다. 추론은 불확실성을 줄이기 위해 이 상태를 업데이트하는 일련의 움직임으로 정의되며, 독립적인 평가자가 믿음의 변화가 증거에 의해 뒷받침되는지 확인한다.
Graepel은 최근 이 접근법을 추구하기 위해 Google DeepMind에서의 직책을 떠났다. 그는 현재 LLM의 규모 확장이 신중한 추론 능력 없이 직관만 날카롭게 할 뿐이라고 주장한다. 그는 미래 시스템이 복잡하고 개방적인 세계 영역에서 새로운 통찰력을 생성하기 위해 증거와 추론의 감사 가능한 시퀀스를 산출해야 한다고 단언한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.