AI Briefing

LaCy: 소형 언어 모델이 무엇을 배워야 하는지는 손실만의 문제가 아니다

·2026.04.09 09:00

핵심 내용

LaCy는 SLM이 무엇을 학습하고 무엇을 위임할지 구분해 사실성을 높인다.

자세히 보기

**Small Language Models(SLMs)**는 파라미터 크기 한계 때문에 세계 지식을 충분히 내재화하지 못해, 종종 사실과 다른 출력을 만든다. 이를 보완하려면 외부 모델, 문서, 데이터베이스를 호출해 부족한 정보를 토큰으로 위임할 수 있어야 한다.

핵심 질문은 단순히 "손실이 큰 토큰을 예측할 것인가"가 아니라, 어떤 토큰은 학습하고 어떤 토큰은 위임해야 하는가다. 손실은 정답 토큰과의 불일치를 예측하는 데는 유용하지만, 전처리 문맥 안에서 여전히 사실적인 대안이 될 수 있는 acceptable token까지 무조건 호출 대상으로 삼으면 안 된다.

이를 위해 spaCy grammar parser를 활용해 손실 신호를 보강하고, SLM이 안전하게 예측해도 되는 토큰과 도움을 요청해야 하는 토큰을 가르게 했다. 이 철학을 바탕으로 LaCy라는 사전학습 방법을 제안했다.

실험에서 LaCy 모델은 어떤 토큰을 예측해야 하고 어디에서 위임해야 하는지 더 잘 학습했다. 그 결과, 더 큰 모델과의 캐스케이드 생성에서 FactScore가 높아졌고, Rho나 LLM-judge로 학습한 SLM보다 더 좋은 성능을 보이면서도 더 단순하고 저렴했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.