AI Briefing

추천NVIDIA, 40개 언어 지원 Nemotron 3.5 ASR 공개

How to Fine-Tune Nemotron 3.5 ASR for Your Language, Domain, or Accent

·2026.06.04 21:59

NVIDIA가 40개 언어를 실시간으로 지원하는 6억 파라미터 규모의 Nemotron 3.5 ASR 모델을 공개했다.

NVIDIA가 실시간 스트리밍이 가능한 다국어 음성 인식(ASR) 모델인 Nemotron 3.5 ASR을 공개했다. 이 모델은 단일 체크포인트로 40개의 언어 로케일을 지원하며, 문장 부호와 대소문자 표기 기능이 내장되어 있다.

주요 특징은 다음과 같다:

  • 효율적인 스트리밍: Cache-Aware FastConformer-RNNT 아키텍처를 사용하여 오디오 프레임을 중복 계산 없이 한 번만 처리함으로써 지연 시간을 획기적으로 줄였다.
  • 낮은 지연 시간: Artificial Analysis 벤치마크에서 스트리밍 ASR 모델 중 지연 시간 2위를 기록하며 높은 정확도와 낮은 지연 시간의 균형을 입증했다.
  • 다국어 및 자동 감지: 한국어, 영어, 일본어, 중국어 등 40개 언어를 지원하며, 입력 언어를 직접 지정하거나 모델이 자동으로 감지하도록 설정할 수 있다.
  • 오픈 웨이트 및 미세 조정: Hugging Face를 통해 오픈 웨이트로 제공되어, 사용자가 특정 언어, 도메인 또는 악센트에 맞춰 **미세 조정(Fine-tuning)**하여 최적화할 수 있다.

이 모델은 별도의 후처리 과정 없이도 즉시 서비스에 적용 가능한 수준의 텍스트를 생성하며, API 의존성 없이 자체 인프라에 배포할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.