LG AI Research 398
NeurIPS 2023에서 주목받은 멀티모달 생성 기술과 LG AI Research의 음악 생성 인터페이스를 소개한다.
NeurIPS 2023에서는 AI를 활용한 예술 창작, 특히 오디오 및 음악 생성 기술이 주요 화두였다. Google DeepMind의 Lyria는 특정 아티스트의 목소리와 스타일을 반영한 30초 분량의 곡을 생성하며, Meta의 Audiobox는 텍스트를 기반으로 음성, 효과음, 보컬 스타일 변경 등 다양한 오디오 작업을 수행한다.
LG AI Research의 Data Intelligence (DI) Lab 또한 음악 메타데이터를 기반으로 4마디의 MIDI 루프를 생성하는 인터페이스 연구를 발표했다. 이 기술은 악기, 템포, 평균 피치 등 다양한 메타데이터를 입력받아 음악 연구자와 창작자의 효율성을 높인다.
멀티모달 생성 연구는 일반적으로 서로 다른 모달리티를 연결하는 Prior와 데이터를 압축하는 Encoder/Decoder 구조를 따른다. 이는 VAE와 유사하지만, 오토인코더와 Prior의 학습을 분리하여 복원력을 극대화하고 의미 있는 공간에서 샘플링할 수 있도록 설계되었다.
데이터를 효율적으로 처리하기 위해 Discrete Representation(이산적 표현) 기술이 핵심적인 역할을 한다. 대표적인 모델로는 다음과 같은 기술들이 있다.
- VQ-VAE: 데이터를 압축하고 복원하며, 각 요소를 유한한 개수의 코드로 표현하는 오토인코더 계열 모델
- VQ-GAN: VQ-VAE의 성능을 개선한 모델
- Residual Vector Quantizer: 오디오 도메인에서 이산적 표현의 표준 기술로 자리 잡고 있는 기술
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.