AI Briefing

Inception Labs, Mercury 2.5 공개… 지능 40% 향상 및 초당 1,107 토큰 생성

·2026.09.08 09:00

핵심 내용

Inception Labs가 지능을 40% 높이고 초당 1,107 토큰을 생성하는 Mercury 2.5를 공개했다.

1 / 4

자세히 보기

Inception Labs가 최신 확산 언어 모델(dLLM)인 Mercury 2.5를 출시했다. 이 모델은 역대 최대 규모의 확산 언어 모델로 훈련되었으며, 이전 버전 대비 지능이 40% 향상되어 GPT-5.6 Luna, Gemini 3.5 Flash-Light 등 비용 효율적인 프론티어 모델과 유사한 성능을 달성했다.

핵심 성능 및 사양

  • 속도: NVIDIA GPU 기준 초당 1,107 토큰 생성
  • 지능: Mercury 2 대비 40% 증가
  • 컨텍스트: 최대 260K 토큰 지원
  • 가격: 입력 $0.04/M, 출력 $0.15/M (출시 프로모션 기준)
  • 기능: 병렬 도구 호출(parallel tool calls), 병렬 추론(parallel reasoning) 지원

프로덕션 적용 사례

  • 검색 에이전트: 쿼리 재작성, 리랭킹, 요약 등 복잡한 검색 파이프라인을 단일 상호작용 내에서 처리
  • 음성 에이전트: OpenCall의 라이브 통화 처리 시 모델 응답 지연이 170ms 미만으로 감소
  • 코딩 서브에이전트: Augment Code에서 컨텍스트 압축(compaction) 지연을 150초에서 27초로 단축하고 비용을 90% 절감

추가 발표 및 접근성

  • Mercury Voice (Preview): 음성 에이전트용으로 최적화된 dLLM으로, 첫 토큰 생성 시간(TTFT)이 170ms 미만
  • Mercury Router (Preview): 프롬프트를 분석해 품질, 속도, 비용에 따라 최적의 모델을 라우팅하는 기능
  • 접근 방법: Inception Labs API, Baseten, OpenRouter를 통해 이용 가능하며, 초기 1억 토큰 무료 제공

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.