AI Briefing

NVIDIA, 600만 건 다국어 추론 데이터셋

NVIDIA Releases 6 Million Multi-Lingual Reasoning Dataset

·2025.08.21 07:13

핵심 내용

NVIDIA가 5개 국어로 구성된 600만 건 규모의 Nemotron 다국어 추론 데이터셋과 Nemotron Nano 2 9B 모델을 공개했다.

자세히 보기

NVIDIA가 오픈 생태계 지원을 위해 Nemotron Post-Training Dataset v2를 공개했다. 이번 데이터셋은 기존 영어 추론 데이터를 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어 5개 언어로 번역한 600만 건 규모의 데이터로 구성되어 있다.

데이터 품질을 높이고 환각(Hallucination)을 방지하기 위해 문장 단위 번역, 특수 브래킷(〘〙)을 활용한 포맷 강제, fastText 기반 언어 식별 등의 검증 메커니즘을 적용했다.

함께 공개된 NVIDIA Nemotron Nano 2 9B 모델은 Transformer-Mamba 하이브리드 아키텍처를 사용하여 기존 모델 대비 최대 6배 높은 토큰 생성 속도를 제공한다. 또한 'Thinking budget' 기능을 통해 추론 비용을 최대 60% 절감할 수 있어 고객 서비스 에이전트나 엣지 디바이스 배포에 최적화되어 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.