AI Briefing

SOB, 값 정확도까지 검증

The Structured Output Benchmark (SOB) - validates both JSON parse and value accuracy [R]

·2026.04.29 06:22

핵심 내용

SOB가 JSON 파싱뿐 아니라 값 정확도까지 함께 측정하는 새 벤치마크를 공개했다.

1 / 2

자세히 보기

Structured Output Benchmark(SOB)은 기존 벤치마크가 주로 JSON schema 통과율만 보던 한계를 겨냥해, 실제 출력 값까지 검증한다.

  • 핵심 지표 7개: Value Accuracy, JSON Pass Rate, Type Safety, Path Recall, Structure Coverage, Faithfulness, Perfect Response
  • 대상 모달리티: text, image, audio
  • 평가 방식: leaf-value 단위로 정답과 exact match를 비교해, 송장 합계나 날짜 매핑처럼 구조는 맞지만 값이 틀린 사례를 잡아낸다.

전체 결과에서는 오픈소스 모델이 선전했고, GLM 4.7이 GPT-5.4 바로 아래인 2위를 기록했다.

반면 대부분의 모델은 JSON schema pass 90%+ 를 보였지만, value accuracy에서는 큰 폭으로 떨어져 구조적 정합성과 실제 값 정확도 사이의 간극이 드러났다.

세부 순위와 데이터셋 설계, 평가 기준은 블로그·리더보드·논문 초안에 공개됐고, 논문은 현재 arXiv 제출 전 상태다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.