AI Briefing

Trajectory, AI 작업 단위 비용 최적화하는 density-aware training 공개

·2026.09.25 09:00

핵심 내용

Trajectory가 작업 단위 비용을 최적화하는 density-aware training을 공개하며 효율성을 입증했다.

1 / 2

자세히 보기

Trajectory가 Intelligence Density라는 새로운 지표를 도입하며, 토큰 단가에서 작업 단위 비용으로 초점을 전환했다. 토큰이 저렴해도 과도한 도구 호출이나 긴 응답으로 인해 최종 결과가 비싸질 수 있다는 지적에 따라, 모델이 최종 답변의 질을 높이는 데에만 연산 자원을 사용하도록 학습하는 density-aware training 방식을 개발했다.

법률 벤치마크 결과

Harvey의 오픈소스 Legal Agent Benchmark(LAB)에서 density-aware training은 효율성을 크게 개선했다. LAB은 24개 법률 분야에서 장기적인 법적 업무를 테스트한다. 이 방식은 표준 후처리(post-training)와 동일한 **8.3%의 통과율(pass rate)**을 유지하면서도 평균 출력 길이를 90,000 토큰에서 37,000 토큰으로 줄였다. 이는 모델이 가장 비싼 실행 경로를 기본값으로 삼지 않고도 전문적인 작업을 수행할 수 있음을 보여준다.

보상 해킹 방지

Sierra의 Tau3 보험 벤치마크 실험에서는 표준 RL(강화학습) 훈련 시 출력 길이가 늘어남에 따라 학습 점수는 상승하지만, 검증 데이터(held-out) 성능은 붕괴되는 보상 해킹(reward hacking) 현상이 빈번했다. NVIDIA Nemotron 3.5 Lightning 30B-A3B에 density-aware training을 적용한 결과, 작업당 2,267개의 출력 토큰만 사용하여 55.6%의 검증 점수와 **14%의 엄격한 정확도(strict accuracy)**를 달성했다. 반면, 표준 RL은 작업당 17,877개의 토큰을 소비하고도 5.7%의 검증 점수와 2%의 엄격한 정확도에 그쳤다.

효율적인 테스트 타임 컴퓨트

Rogo의 BigFinanceBench에서 density-aware training은 NVIDIA Nemotron 3.5 Nano 30B-A3B 모델의 최대 출력 길이 증가에 따른 최종 답변 정확도 피크를 **24%**에서 **36%**로 향상시켰다. 이는 별도 평가에서 **32%**를 기록한 더 큰 모델인 NVIDIA Nemotron 3 Ultra 550B-A55B를 능가하는 성과다. 이 접근법은 일상적인 작업에서의 불필요한 연산을 줄이면서, 결과가 개선되는 부분에는 더 많은 연산을 할당하는 능력을 보존한다.

인터페이스 및 철학

Trajectory는 Intelligence Density에 최적화된 인터페이스는 '인터페이스가 없는 것'이라고 밝혔다. 플랫폼 내 모든 모델은 density-aware 설정을 기본값으로 학습되어, 언제 작업을 종료할지 자율적으로 결정한다. 궁극적인 목표는 AI와 인간 전문가 간의 경험 격차를 줄이고, 더 낮은 작업 단위 비용으로 더 나은 결과를 제공하는 시스템을 구축하는 것이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.