AI Briefing

Stanford·NVIDIA, 추론 속도 9배 개선한 '대조 언어 모델' CLM 공개

·2026.09.24 13:20

핵심 내용

CLM-8B는 상태와 행동을 분리 인코딩해 캐싱하며, 에이전트 코딩 벤치마크에서 SOTA를 달성했다.

1 / 12

자세히 보기

Stanford University와 NVIDIA Research 연구진이 System One 모델인 **Contrastive Language Models (CLM)**을 공개했다. 이 모델은 상태(state)와 행동(action)을 연결하는 대조 학습(contrastive learning) 목표를 사용하여 빠르고 일반화된 의사결정을 수행한다.

핵심 성능 및 아키텍처

  • CLM-8B는 컴퓨터 사용, 게임, 도구 호출 작업에서 기존 모델(Jev)과 유사한 성능을 내면서도 최대 9배 낮은 지연 시간을 달성했다.
  • 상태와 행동을 분리(disaggregation)하여 임베딩을 독립적으로 캐싱하고 재사용할 수 있는 초효율적인 학습 및 서빙 인프라를 구축했다. 후보 행동이 많거나 행동이 자주 재사용되는 환경에서 효율성이 극대화된다.
  • 경량 미세 조정을 통해 DeepSWE(81.6%) 및 Terminal Bench 2.1(87.6%) 같은 어려운 에이전트 코딩 벤치마크에서 새로운 SOTA를 기록했다.

학습 데이터 및 레시피

CLM은 세 단계의 학습 과정을 거친다:

  1. 사전 학습: Nemotron DQA의 6,000만 개 Q&A 쌍으로 넓은 의미 표현 학습.
  2. 중간 학습: Gemini 2.5 Flash-Lite로 생성된 3,000만 개의 합성 하드 네거티브(hard negatives)로 세밀한 구별 능력 향상.
  3. 후 학습: Agent Data Protocol(ADP)의 100만 개 에이전트 궤적(trajectories)으로 에이전트 환경에 적응.

스케일링 법칙

연구진은 CLM의 테스트 대조 손실(test contrastive loss)이 학습 컴퓨팅, 모델 크기, 데이터셋 크기에 대해 멱법칙(power law)을 따라 예측 가능하게 감소함을 입증했다. 특히 인코더 크기를 늘리는 것이 검증 성능 향상에 가장 큰 영향을 미친다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.