AI Briefing

삼성전자, 음악 구조 반영한 AI 노래 평가 프레임워크 'MusicJudge' 공개

핵심 내용

삼성전자가 가사와 음악 구조를 함께 분석해 인간 전문가 수준으로 노래를 평가하는 AI 프레임워크를 공개했다.

1 / 7

자세히 보기

삼성전자 R&D 인스티튜트 인디아-방갈로르 연구진이 Interspeech 2026에서 음악 구조를 반영한 자동 노래 평가 프레임워크 MusicJudge를 제안했다. 기존 평가 방식은 음향 품질이나 가사 전사 중 하나만 보거나 음악적 맥락을 무시해, 멜리스마(melisma)나 템포 유연성 같은 예술적 자유를 페널티로 처리하거나 가사 오류를 놓치는 한계가 있었다.

MusicJudge는 노래를 verse, chorus 등 음악적으로 의미 있는 블록 단위로 나누어 Content fidelity(가사 정확성)와 Musical fidelity(피치/리듬의 구조 준수)를 동시에 평가한다. 파이프라인은 Source separation으로 보컬과 반주를 분리한 뒤, MG-LoRA로 미세 조정된 Whisper 모델을 통해 노래 특유의 발성 패턴에 강건한 전사를 수행한다. 이후 다중 신호 기반 블록 감지와 음악적 피치/리듬 스코어링을 거쳐 최종 점수를 산출한다.

실험 결과, SwaraLyrics 등 데이터셋에서 인간 전문가 순위와의 Spearman correlation 0.683을 기록하며 가사 전용 대비 31.9%, 음악 전용 대비 38.0%의 성능 향상을 보였다. 특히 MG-LoRA 적용으로 노래 전사 정확도가 2위 시스템 대비 약 29.87% 향상되었으며, gamakas나 portamento 같은 복잡한 발성 구간에서도 높은 정확도를 유지했다.

이 프레임워크는 반주로부터 키를 추정해 singer의 transposition을 페널티로 부과하지 않고, song structure를 latent variable로 처리해 라이브 커버 등 순서 변경도 공정하게 평가한다. 현재는 solo performance에 한정되지만, 향후 duets나 choir 등으로 확장 가능하며 보컬 트레이닝 보조 도구 및 음악 대회 예선 심사에 활용될 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.