AI Briefing

Aplomb 1, Typed Decisions 벤치마크 선두

Aplomb 1 is #1 on Typed Decisions

·2026.10.10 00:58

핵심 내용

Aplomb 1이 Typed Decisions 벤치마크에서 KL 0.123, Brier 0.065로 1위를 기록했다.

자세히 보기

Aplomb 1이 Hugging Face의 공식 확률적 의사결정 벤치마크인 Typed Decisions에서 27B 파라미터 경쟁 모델을 제치고 1위를 차지했다.

벤치마크 성능

이 모델은 KL divergence from gold에서 0.123로 최저치를 기록했으며, 이는 2위 모델보다 38% 낮은 수치다. Brier score도 0.065로 가장 낮았다. 또한 6B 파라미터 미만 모델 중 가장 높은 정확도(73.7%)를 달성했다. 해당 벤치마크는 400개 사례와 2,000개 의사결정을 평가하며, 비정형 텍스트 입력에 대해 5가지 유형별 질문에 대한 확률 분포를 요구한다.

프로덕션 기능

일반 LLM이 명시적 신뢰도 측정 없이 토큰을 생성하는 것과 달리, Aplomb 1은 모든 답변, 도구, 열거형, 부울 인자에 대해 확률 분포를 반환한다. 이를 통해 소프트웨어는 모델이 확신할 때 자율적으로 작동하고, 불확실성이 높을 때 더 큰 모델로 에스컬레이션할 수 있다.

기술 사양 및 가용성

Aplomb 1은 텍스트, JSON, 이미지, 비디오, 오디오 입력을 지원하며 최대 1M 토큰의 컨텍스트 윈도우를 제공한다. 제공사 API 기준 짧은 질문은 약 15 ms에 처리하고, 1M 토큰 문서는 약 3초에 읽는다. 가격은 입력 1M 토큰당 $0.02이며 출력은 무료다. 모델 가중치는 오픈 소스로 Hugging Face에서 공개된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.