번역벤치마크 1위
We benchmarked TranslateGemma against 5 other LLMs on subtitle translation across 6 languages. At first glance the numbers told a clean story, but then human QA added a chapter. [D]
6개 LLM 번역 벤치마크에서 TranslateGemma-12b가 종합 1위를 기록했다.
영어 자막을 **스페인어·일본어·한국어·태국어·중국어(간체/번체)**로 번역해, 언어쌍별 167개 세그먼트를 평가했다.
평가는 **MetricX-24(낮을수록 좋음)**와 COMETKiwi(높을수록 좋음) 같은 reference-free QE metric으로 진행했고, 이를 조합한 **TQI = COMETKiwi × exp(−MetricX / 10)**도 함께 사용했다.
- 종합 TQI 1위: TranslateGemma-12b (0.6335)
- 2위: gemini-3.1-flash-lite-preview (0.5981)
- 3위: deepseek-v3.2 (0.5946)
- 4위: claude-sonnet-4-6 (0.5811)
- 5위: gpt-5.4-mini (0.5785)
- 6위: gpt-5.4-nano (0.5562)
모든 모델의 COMETKiwi는 0.75~0.79 수준으로 비슷했지만, MetricX-24 충실도 점수에서 차이가 크게 벌어져 순위가 갈렸다.
다만 작성자는 MetricX-24가 Google metric이고 TranslateGemma도 Google 모델이라는 점을 들어, 1위 격차가 일부 과대평가됐을 가능성을 언급했다.
추가로 Claude Sonnet은 일본어에서 최하위를 기록했지만 COMETKiwi는 무난해, 유창성은 좋지만 의미 충실도가 흔들리는 패턴이 드러났다.
Gemini Flash Lite는 풀사이즈 프런티어 모델보다도 상위권을 유지해, 경량 모델의 경쟁력을 보여줬다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.