Inception Labs, Mercury 2.5 공개… 지능 40% 향상 및 초당 1,107 토큰 생성
·2026.09.08 09:00
핵심 내용
Inception Labs가 지능을 40% 높이고 초당 1,107 토큰을 생성하는 Mercury 2.5를 공개했다.
1 / 4
자세히 보기
Inception Labs가 최신 확산 언어 모델(dLLM)인 Mercury 2.5를 출시했다. 이 모델은 역대 최대 규모의 확산 언어 모델로 훈련되었으며, 이전 버전 대비 지능이 40% 향상되어 GPT-5.6 Luna, Gemini 3.5 Flash-Light 등 비용 효율적인 프론티어 모델과 유사한 성능을 달성했다.
핵심 성능 및 사양
- 속도: NVIDIA GPU 기준 초당 1,107 토큰 생성
- 지능: Mercury 2 대비 40% 증가
- 컨텍스트: 최대 260K 토큰 지원
- 가격: 입력 $0.04/M, 출력 $0.15/M (출시 프로모션 기준)
- 기능: 병렬 도구 호출(parallel tool calls), 병렬 추론(parallel reasoning) 지원
프로덕션 적용 사례
- 검색 에이전트: 쿼리 재작성, 리랭킹, 요약 등 복잡한 검색 파이프라인을 단일 상호작용 내에서 처리
- 음성 에이전트: OpenCall의 라이브 통화 처리 시 모델 응답 지연이 170ms 미만으로 감소
- 코딩 서브에이전트: Augment Code에서 컨텍스트 압축(compaction) 지연을 150초에서 27초로 단축하고 비용을 90% 절감
추가 발표 및 접근성
- Mercury Voice (Preview): 음성 에이전트용으로 최적화된 dLLM으로, 첫 토큰 생성 시간(TTFT)이 170ms 미만
- Mercury Router (Preview): 프롬프트를 분석해 품질, 속도, 비용에 따라 최적의 모델을 라우팅하는 기능
- 접근 방법: Inception Labs API, Baseten, OpenRouter를 통해 이용 가능하며, 초기 1억 토큰 무료 제공
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.