AI Briefing

Summarize API가 OpenAI 모델을 능가했다

·2023.04.24 21:14

AI21 Summarize API가 OpenAI 모델보다 더 정확하고 압축된 요약을 만들었다.

AI21 LabsSummarize APIOpenAIDavinci-003GPT-3.5-Turbo에 대해 다양한 프롬프트와 학술 데이터, 실사용 데이터에서 비교했다. 자동 지표는 faithfulness ratecompression rate였고, 인간 전문가는 블라인드 평가로 pass rate를 산정했다.

결과는 Summarize API가 전반적으로 OpenAI 모델보다 낫거나 최소한 비슷했다. 특히 실사용 데이터에서 hallucinationreasoning violation이 더 적었고, OpenAI 요약이 'Very Bad'로 분류되는 비율은 2~4배 높았다. 비교 시점에는 GPT-4가 아직 포함되지 않았다.

주요 수치는 다음과 같다.

  • Davinci-003 대비 pass rate 18% 향상
  • Davinci-003 대비 faithfulness score 19% 향상
  • GPT-3.5-Turbo 대비 compression rate 27% 향상
  • compression rate 표준편차가 최소 50% 낮아 요약 길이가 더 일정했다

Summarize API는 별도 프롬프트 없이 원문만 입력하면 바로 작동하는 요약 전용 모델이라 사용성이 단순했고, 결과도 더 일관적이었다. 반면 OpenAI 모델은 강한 프롬프트 엔지니어링을 더해도 의미 있는 개선을 보이지 못했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.