NVIDIA, 600만 건 다국어 추론 데이터셋
NVIDIA Releases 6 Million Multi-Lingual Reasoning Dataset
·2025.08.21 07:13
NVIDIA가 5개 국어로 구성된 600만 건 규모의 Nemotron 다국어 추론 데이터셋과 Nemotron Nano 2 9B 모델을 공개했다.
NVIDIA가 오픈 생태계 지원을 위해 Nemotron Post-Training Dataset v2를 공개했다. 이번 데이터셋은 기존 영어 추론 데이터를 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어 5개 언어로 번역한 600만 건 규모의 데이터로 구성되어 있다.
데이터 품질을 높이고 환각(Hallucination)을 방지하기 위해 문장 단위 번역, 특수 브래킷(〘〙)을 활용한 포맷 강제, fastText 기반 언어 식별 등의 검증 메커니즘을 적용했다.
함께 공개된 NVIDIA Nemotron Nano 2 9B 모델은 Transformer-Mamba 하이브리드 아키텍처를 사용하여 기존 모델 대비 최대 6배 높은 토큰 생성 속도를 제공한다. 또한 'Thinking budget' 기능을 통해 추론 비용을 최대 60% 절감할 수 있어 고객 서비스 에이전트나 엣지 디바이스 배포에 최적화되어 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.