OCR 비용 역전
We benchmarked 18 LLMs on OCR (7k+ calls) — cheaper/old models oftentimes win. Full dataset + framework open-sourced. [R]
·2026.04.23 14:40
42개 문서·7,560회 호출 벤치마크에서 저가/구형 모델이 OCR 성능과 비용 효율을 앞섰다.
OCR와 문서 추출 워크플로에서 최신·대형 모델에 과지출하는 패턴을 검증하기 위해, 18개 LLM을 동일 조건으로 비교했다.
- 42개 표준 문서를 선정하고 각 모델을 10회씩 반복해 총 7,560회 호출을 수행했다.
- 평가 항목은 pass^n(대규모 신뢰성), cost-per-success, latency, critical field accuracy였다.
- 핵심 결과는 표준 OCR에서는 더 작고 오래된 모델이 프리미엄 모델과 비슷한 정확도를 내면서도 비용은 훨씬 낮았다는 점이다.
전체 데이터셋과 프레임워크는 오픈소스로 공개됐고, 별도 mini-bench와 leaderboard도 제공된다.
- GitHub:
ocr-mini-bench - Leaderboard:
arbitrhq.ai/leaderboards/
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.