AI Briefing

삼성전자, 700KB 초경량 음성 분류 인코더 AnySimLite 공개

·2026.09.14 13:54

핵심 내용

삼성전자가 700KB 용량으로 스마트폰에서 30ms 미만 추론이 가능한 초경량 음성 분류 인코더 AnySimLite를 공개했다.

1 / 5

자세히 보기

삼성전자 R&D 인도-방갈로르 연구팀이 Interspeech 2026 논문을 기반으로 온디바이스 음성 인접(SA) 분류용 경량 인코더 AnySimLite를 공개했다. 이 모델은 저장 공간 약 700KB, 플래그십 스마트폰 기준 추론 시간 30ms 미만의 성능을 달성하며, 7B 파라미터 LLM 대비 few-shot 설정에서 SOTA에 근접하거나 일치하는 결과를 보였다.

유사성 기반 분류 아키텍처

AnySimLite는 분류 문제를 비교 문제로 재정의하여, 클래스별 약 20개의 exemplar와 입력 간 유사도 점수로 분류를 수행한다. 핵심 개념인 **Nuanced Text Similarity(NTS)**는 어휘나 의미 유사성이 아닌 태스크별 특성 정렬에 기반한다. 아키텍처는 추론 복잡도를 O(n²)에서 O(n)으로 줄이기 위해 두 텍스트를 독립적으로 인코딩하며, 단어 채널(BiLSTM + Attention)과 문자 채널(Conv1D)을 결합해 16차원 L2-normalized 임베딩을 생성한다. 문자 채널은 어휘 외(OOV) 인물 이름의 철자 차이를 구별하는 데 기여한다.

성능 및 배포 효율성

9개 데이터셋(Quora, IMDB, SNIPS 등)에서 대부분 비교군 내 최소 모델 크기로 SOTA 또는 경쟁력 있는 성능을 유지했다. SMS Spam과 TitleSimCurated에서는 최강 경쟁자를 능가했으며, 전체 태스크 평균 정확도 저하는 2.24%에 불과하다. Samsung Galaxy S25 Ultra 기준 8-bit 양자화 시 디스크 용량은 약 700KB이며, 12개 태스크를 지원해도 총 10MB 미만이다. BERT-scale 대비 약 100배, GPT-3 175B 대비 10만 배 이상 파라미터가 적으면서도 정확도 격차는 수 포인트 이내로 유지되어 온디바이스 배포의 핵심 장벽을 낮췄다.

한계 및 향후 방향

긴 문서 구조에 의존하거나 세밀한 multi-label 구분이 필요한 태스크에서는 대형 모델 대비 성능 격차가 발생한다. 또한 few-shot 프로토콜 특성상 exemplar 품질에 민감하다. 연구팀은 분류를 넘어 이 '문제 축소(problem reduction)' 레시피의 확장성을 탐구할 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.