지능은 파라미터 수가 아니라 시간이다
핵심 내용
LLM의 지능은 규모보다 추론 시간과 학습된 알고리즘 구조에 달려 있다.
자세히 보기
LLM은 단순히 다음 토큰을 맞히는 모델이 아니라, chain-of-thought를 통해 문제를 풀어내는 계산 기계에 가깝다. 핵심은 그 능력이 단순한 inductive generalization이 아니라, 주어진 데이터와 기억을 함께 활용해 새 문제를 푸는 transductive inference에 있다는 점이다.
저자들은 이를 system-1과 system-2의 대비로 설명한다. 빠른 반응을 요구하는 inductive generalization은 system-1에 가깝지만, query마다 다른 길이의 추론을 수행하는 transduction은 system-2처럼 동작하며, LLM의 reasoning은 바로 이 형태의 계산이라고 본다.
이 관점에서 Solomonoff의 1964년 보편 최적 알고리즘과 Levin의 1973년 universal search는 중요한 출발점이지만, 둘 다 실용적이지 않다. 저자들은 새 논문에서 학습이 inference time을 줄이도록 설계될 때, 모델이 단순한 통계 구조뿐 아니라 algorithmic structure까지 학습하게 된다고 주장한다.
가장 중요한 주장 중 하나는 **log speed-up = I(h : D)**라는 관계다. 여기서 h는 새 문제의 해답, D는 학습 데이터이며, 해답의 속도 향상은 해답과 데이터 사이의 algorithmic mutual information으로 설명된다. 즉, inference time을 줄이도록 학습할수록 모델의 가중치에는 더 많은 유의미한 정보가 담긴다.
이 논리는 기존 scaling laws에 대한 반전으로 이어진다. 파라미터 수를 계속 늘리는 방식은 어느 지점 이후 savant regime으로 들어가, 학습된 통찰 없이 브루트포스로 벤치마크를 통과하는 상태에 가까워질 수 있다고 본다. 저자들은 지능의 핵심 변수가 규모가 아니라 time이라고 말한다.
정리하면, 모델 설계와 학습 목표는 다음 방향으로 바뀌어야 한다.
- inference 단계에서 추가 계산의 marginal value를 예측하도록 설계할 것
- 학습 목표에 complexity cost를 포함해 추론 시간을 줄이도록 유도할 것
- 사용자나 환경의 조건에 맞춰 계산 자원을 조절할 수 있게 만들 것
이때 시간의 비용은 절대적이지 않고 환경 의존적이다. 과학적 발견처럼 수십 년을 허용하는 작업도 있고, 초단타 거래처럼 밀리초 단위가 중요한 작업도 있다. 따라서 에이전트는 환경에 맞춰 더 작은 특화 모델을 호출하거나, 사용자가 inference cost를 조절할 수 있도록 해야 한다.
마지막으로, 이런 아이디어는 AI coding 방식도 바꾼다. 저자들은 AI Functions라는 오픈소스 라이브러리를 예로 들며, 자연어로 작성된 함수 본문과 pre-/post-condition을 결합해 고수준 계획과 저수준 피드백 제어를 동시에 구현할 수 있다고 설명한다. 결과적으로 AI 에이전트는 더 짧은 시간 안에 더 나은 답을 찾도록 학습되고 평가되어야 한다는 것이 글의 결론이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.