Cohere, 60개 언어 모국어 추론 지원하는 Tiny Aya L2-Thinker 공개
핵심 내용
Cohere가 3.35B 파라미터의 Tiny Aya L2-Thinker를 공개해 60개 언어에서 93% 이상의 모국어 추론률을 달성했다.
자세히 보기
Cohere가 사용자의 언어로 직접 추론하는 Tiny Aya L2-Thinker를 공개했다. 3.35B 파라미터의 이 모델은 기존 모델이 비영어권 사용자에게 추론 과정을 숨기거나 문화적 뉘앙스를 놓치는 문제를 해결하기 위해 in-language reasoning을 지원한다. 이를 통해 사용자는 AI의 사고 과정을 검증하고 수정할 수 있으며, 모국어의 문화적 지식을 활용할 수 있다.
데이터 믹싱 전략
모델 성능은 세 가지 기둥으로 구성된 데이터 믹싱 전략에 기반한다.
- 영어 추론 데이터 (ER): 핵심 문제 해결 능력을 구축하기 위해 gpt-oss-120b가 생성한 약 170만 개의 단계별 솔루션.
- 다국어 추론 데이터 (MR): 영어 추론 예시를 44개 언어로 자동 번역한 데이터로, in-language reasoning 비율을 12.8%에서 86.1%로 높였다.
- 다국어 비추론 데이터 (NR): 추론 과정이 없는 질문-답변 쌍으로, 새로운 언어에 대한 일반화 능력을 돕는다.
세 가지 기둥을 모두 결합한 결과, 벤치마크에서 57.4%의 정확도와 96.4%의 in-language reasoning 비율을 달성했다.
성능 및 효율성
Tiny Aya L2-Thinker는 MGSM, PolyMath, GlobalPIQA 등 6개 벤치마크와 60개 언어에서 강력한 성능을 보였다. 영어 전용 모델인 Tiny Aya En-Thinker와 비교했을 때, 6개 벤치마크 중 5개에서 유사한 정확도를 유지하며 오픈 엔디드 글쓰기 작업에서는 소폭 개선된 결과를 나타냈다. 다만 경쟁 수준 수학 정확도가 낮은 PolyMath는 강화 학습 단계 부재로 인한 것으로 추정된다.
이 모델은 특히 저자원 언어에서 효율성이 뛰어나다. 다국어 최적화 토크나이저를 사용해 평균 thinking token을 5,000개 미만으로 유지한다. 반면 Magistral과 M-Thinker 같은 경쟁 모델은 저자원 환경에서 성능 저하가 심하거나 추론 길이가 증가한다. Tiny Aya L2-Thinker는 해결책에 도달하지 못한 채 단계를 반복하는 'doomlooping' 현상을 피하며, 자원 가용성이 낮아져도 높은 추론 품질을 유지한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.