EMNLP 2023
핵심 내용
업스테이지가 EMNLP 2023에 논문 2편을 채택시키며 한국어 NLP 역량을 입증했다.
자세히 보기
업스테이지가 자연어 처리 분야 최고 권위 학회인 EMNLP 2023에서 논문 2편을 발표하며 글로벌 기술력을 다시 확인했다. EMNLP 2023은 12월 6~10일 싱가폴에서 열리며, 지난해 EMNLP 2022는 **3,242편 제출·715편 채택(채택률 22%)**을 기록했다.
이번 성과는 업스테이지 박찬준 테크 리드와 고려대 임희석 교수 연구팀의 협업으로 이뤄진 한국어 NLP 연구다. 회사는 이번 채택이 구글, 애플, 아마존, 바이두 등과 겨루는 국제 학술 무대에서의 경쟁력을 보여준 사례라고 설명했다.
-
KEBAP: Korean Error Explainable Benchmark Dataset for ASR and Post-processing
- 한국어 ASR(음성인식) 후처리를 위한 새로운 벤치마크 데이터셋을 구축한 논문이다.
- 기존 평가는 음성·텍스트 수준의 오류를 충분히 설명하지 못한다는 문제를 짚고, 설명 가능성을 높이는 평가 방법론을 제안했다.
- 배경 소음과 발화자 특성을 반영한 37개 음성 레벨 유형, 13개 텍스트 레벨 오류 유형으로 세분화했으며, Google Cloud Speech Recognition과 CLOVA 같은 상용 시스템에 적용해 분석했다.
-
CHEF in the Language Kitchen: A Generative Data Augmentation Leveraging Korean Morpheme Ingredients
- 한국어의 형태소 특성을 반영한 새로운 데이터 증강 기법 CHEF를 제안했다.
- 형태소 조합에 따라 문장 의미가 달라지는 한국어 특성상, 무작위 증강은 의미 왜곡이나 부자연스러운 문장을 만들 수 있다는 한계를 지적했다.
- 생성형 언어 모델이 형태소 조합을 다양하게 변형해, 더 자연스러운 한국어 문장을 생성하도록 설계했다.
업스테이지는 지난 6월 ICML 2023-DMLR에서도 논문 7편을 발표해 국내 기업 최다 성과를 냈고, 창립 3년 만에 국내외 AI 논문 100편을 발표했다고 밝혔다. 또한 구글 스콜라 기준 NLP 분야 톱 7 컨퍼런스인 ACL, EMNLP, NAACL, TACL, COLING, LREC, WMT 중 저널인 TACL을 제외한 모든 컨퍼런스에서 논문 채택 성과를 냈다고 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.