아랍어 LLM용 STEM 및 코드 벤치마크 '3LM' 공개
📚 3LM: A Benchmark for Arabic LLMs in STEM and Code
·2025.08.01 23:25
아랍어 LLM의 STEM 및 코드 생성 능력을 평가하기 위한 새로운 벤치마크 3LM이 공개되었다.
아랍어 LLM의 기술적 역량을 평가하기 위한 새로운 벤치마크인 **3LM(علم)**이 발표되었다. 기존 벤치마크가 요약이나 감성 분석 등 일반적인 작업에 치중했던 것과 달리, 3LM은 과학적 추론과 프로그래밍 능력을 검증하는 데 중점을 둔다.
벤치마크는 다음 세 가지 데이터셋으로 구성된다:
- Native STEM: 8~12학년 교과서 및 시험 문제에서 추출한 865개의 실제 아랍어 STEM 객관식 문제(물리, 화학, 생물, 수학, 지리).
- Synthetic STEM: YourBench 파이프라인을 활용해 생성한 1,744개의 고난도 추론 문제로, 개념적·분석적 사고력을 테스트한다.
- Arabic Code Benchmarks: HumanEval+ 및 MBPP+를 아랍어로 번역 및 적응시킨 데이터셋으로, 아랍어 프롬프트를 통한 코드 생성 능력을 평가한다.
3LM은 OCR, LLM 기반 추출, 수동 검토 및 백트랜슬레이션(Backtranslation) 과정을 거쳐 데이터의 품질과 논리적 정확성을 확보했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.