AI Briefing

LLM 출력 압축, 비용 3절감

Does telling an LLM to "be concise" actually save you money? We measured it across 9 models. Compressing the output can save you money and keep accuracy, compressing the input prompt does not. [R]

·2026.08.22 01:38

핵심 내용

LLM 출력 단축은 비용을 최대 3배 절감하지만, 입력 프롬프트 단축은 오히려 비용을 증가시킨다.

자세히 보기

9개 LLM 모델을 대상으로 입력 프롬프트 압축과 출력 지시 압축의 비용 및 정확도 영향을 비교 분석한 연구가 발표되었습니다.

출력 압축의 효과

  • 비용 절감: 출력 토큰을 줄이는 방식은 평균 1.5배, 최대 3배까지 API 비용을 절감했습니다.
  • 정확도 유지: 단축된 출력의 정확도는 제약이 없는 상태와 거의 동일하게 유지되었습니다.
  • 다국어 적용: 영어, 독일어, 일본어 등 11개 언어에서도 동일한 비용 절감 효과가 확인되었습니다.

입력 압축의 역효과

  • 비용 증가: 입력 프롬프트를 줄이면 모델이 누락된 정보를 채우기 위해 더 긴 답변을 생성하여, 최악의 경우 비용이 96% 증가했습니다.
  • 정확도 저하: 입력 단축 시 답변의 정확도가 떨어지는 현상이 관찰되었습니다.

핵심 시사점

  • 출력 토큰은 입력 토큰보다 비용이 높으므로, 짧은 단일 턴 작업에서는 출력 토큰 수를 줄이는 프롬프팅이 비용 절감에 효과적입니다.
  • 단, 출력 단축 시 약 50%의 경우 모델의 원래 추론 과정과 텍스트가 일치하지 않을 수 있으나, 최종 답변만 중요하다면 큰 문제가 되지 않습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.