AI Briefing

AI 인텔리전스의 '언번들링': 범용 LLM에서 기능별 최적화 아키텍처로

·2026.09.20 09:00

핵심 내용

범용 LLM의 통합 구조가 기능별 분리 아키텍처로 전환되며, 저비용 추론이 에이전트 경제성을 재편하고 있다.

자세히 보기

과거 3년간 GPT, Claude, Gemini 등 LLM의 핵심은 문서 추출, 검색, 추론 등 다양한 기능을 하나의 범용 제품으로 통합하는 Bundling이었다. 그러나 각 기능의 지연 시간(latency)과 비용 요구사항이 근본적으로 다르다는 점이 드러나면서, 경제적 합리성을 갖춘 아키텍처로 Great Unbundling이 진행되고 있다.

비용 구조와 아키텍처의 변화

에이전트가 하나의 인간 목표를 수백~수천 개의 기계적 결정으로 변환하면서, 각 단계의 비용 차이가 제품 전체 경제성에 복리로 작용한다. 이에 따라 **'frontier by default'**에서 **'cheap by default, frontier on exception'**으로 아키텍처가 전환되고 있다. 검색, 재검색(reranking), 메모리, 컴퓨터 사용 등이 별도 인프라 계층으로 분리되며, 작은 오픈 웨이트 모델이 일상적 작업을 흡수한다.

'디코더 세금'과 Jev의 등장

단순 분류나 검증 작업에도 프롬프트를 통해 문장을 생성한 뒤 다시 결정으로 변환하는 **'Decoder tax'**의 비효율이 지적된다. TypeSafe가 출시한 Jev는 이러한 판단(judgment) 기능만 분리하여, 오픈 엔디드 텍스트 대신 구조화된 결정과 확률을 반환한다. 이는 에이전트의 내부 루프(inner loop)에 적합한 비용과 속도로 단일 인지 작업을 패키징한 사례다.

프론티어 모델의 역선택과 애플리케이션 계층의 부상

라우팅 최적화로 반복적 제어나 일반 생성 등 저렴하고 예측 가능한 고빈도 작업이 프론티어 모델에서 제거되면서, 프론티어 모델은 점점 더 모호하고 장기적인(high-order) 문제만 수신하게 된다. 이는 Adverse selection을 유발하여 호출 빈도는 감소할 수 있으나, 호출당 가치와 필요한 테스트 타임 컴퓨트는 증가할 수 있다.

저비용 추론이 만드는 새로운 가능성

판단 비용이 fraction of a cent 수준으로 하락하면, 모든 지원 대화, 거래, 계약 조항 등을 100% 평가할 수 있게 된다. 애플리케이션 계층은 **'Intelligence compiler'**로서 인간 목표를 인지적 연산으로 분해하고 각 단계에 가장 저렴하고 충분한 지능을 구매하여 재조합하는 역할을 수행한다. 인텔리전스는 특정 이벤트가 아닌 소프트웨어의 배경 속성으로 변모하며, 향후 10년은 애플리케이션 계층에서의 분리 및 재조합에 집중될 전망이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.