AI Briefing

[CLEF 2022] 문맥 인지형 개체명 인식 및 관계 추출 - LG AI Research 블로그

·2026.07.16 09:00

핵심 내용

LG AI연구원이 화학 특허에서 정보를 추출하는 ChEMU 2022 챌린지에서 높은 성능을 기록하며 기술력을 입증했다.

1 / 2

자세히 보기

LG AI연구원은 세계적 출판사 Elsevier와 협력하여 화학 분야의 Information Extraction(정보 추출) 기술을 연구하고 있다. 비정형 텍스트에서 화학 실험 및 물질 정보를 구조화된 데이터로 변환하는 기술은 화학자들의 연구 시간을 단축하는 데 핵심적인 역할을 한다.

ChEMU 2022 챌린지에서 LG AI연구원은 화학 특허 내 반응 정보를 추출하는 두 가지 Task(1a, 1b)에 참여하여, 참가 팀 중 가장 높은 성능을 달성했다. 주요 성과는 다음과 같다.

  • Domain-specific language model 구축: 화학 특허(23GB)와 저널(22GB) 데이터를 활용하여 Bio-LinkBert를 Post-training함으로써 화학 분야에 특화된 언어 모델을 개발했다.
  • NER 및 RE 모델 최적화: Sequence tagging approach를 채택하여 Entity의 길이에 상관없이 높은 성능을 확보했으며, 모델을 단일 모델이 아닌 Pipeline 방식으로 구성하여 성능을 극대화했다.

Task 1a는 화학 물질 및 수치 정보를 추출하는 **Named Entity Recognition(NER)**을, Task 1b는 트리거 워드와 개체 간의 관계를 추출하는 Event Extraction을 목표로 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.