Ornith-1.5: 셀프 스캐폴딩에서 셀프 임프루브먼트로
·2026.08.19 23:48
핵심 내용
Ornith-1.5가 자체 임무 생성 및 강화학습을 통한 셀프 임프루브먼트로 오픈소스 SOTA 달성
자세히 보기
Ornith-1.5는 모델이 새로운 태스크를 제안하고 스캐폴드를 생성하며, 이를 통해 강화학습용 솔루션 롤아웃을 만드는 엔드투엔드 셀프 임프루브먼트 루프를 갖춘 파운데이션 모델입니다.
397B MoE, 35B MoE, 9B Dense 세 가지 규모로 제공되며, 추론, 에이전트, 코딩 작업에서 동급 오픈소스 모델 중 최상위 성능을 보입니다.
- 397B 모델: Terminal-Bench 2.1에서 86.1점, DeepSWE에서 56.0점을 기록하며 Claude Opus 4.8과 동급의 성능을 발휘합니다.
- 35B 모델: Qwen 3.6-35B를 비롯한 동급 모델들을 압도하며, 토큰당 3B 파라미터만 활성화함에도 불구하고 에이전트 코딩 벤치마크에서 큰 격차를 보였습니다.
- 9B 모델: iPhone 및 Android 등 엣지 디바이스에 배포 가능하며, Gemma 4-31B 등 더 큰 모델보다 우수한 성능을 냅니다.
이 모델은 고정된 인간 큐레이션 태스크 대신, 모델의 현재 능력 한계를 넘어서는 진화하는 커리큘럼을 스스로 생성하여 지속 가능한 능력 향상을 도모합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.