AI Briefing

[CLEF 2022] 문맥 인지형 개체명 인식 및 관계 추출 - LG AI Research 블로그

·2026.07.16 09:00

LG AI연구원이 화학 특허에서 정보를 추출하는 ChEMU 2022 챌린지에서 높은 성능을 기록하며 기술력을 입증했다.

LG AI연구원은 세계적 출판사 Elsevier와 협력하여 화학 분야의 Information Extraction(정보 추출) 기술을 연구하고 있다. 비정형 텍스트에서 화학 실험 및 물질 정보를 구조화된 데이터로 변환하는 기술은 화학자들의 연구 시간을 단축하는 데 핵심적인 역할을 한다.

ChEMU 2022 챌린지에서 LG AI연구원은 화학 특허 내 반응 정보를 추출하는 두 가지 Task(1a, 1b)에 참여하여, 참가 팀 중 가장 높은 성능을 달성했다. 주요 성과는 다음과 같다.

  • Domain-specific language model 구축: 화학 특허(23GB)와 저널(22GB) 데이터를 활용하여 Bio-LinkBertPost-training함으로써 화학 분야에 특화된 언어 모델을 개발했다.
  • NER 및 RE 모델 최적화: Sequence tagging approach를 채택하여 Entity의 길이에 상관없이 높은 성능을 확보했으며, 모델을 단일 모델이 아닌 Pipeline 방식으로 구성하여 성능을 극대화했다.

Task 1a는 화학 물질 및 수치 정보를 추출하는 **Named Entity Recognition(NER)**을, Task 1b는 트리거 워드와 개체 간의 관계를 추출하는 Event Extraction을 목표로 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.