AI Briefing

CoT 준수율 9.91%→100% 달성

Qwen Meetup Draft Review Required (Function Calling Harness 2 - CoT Compliance from 9.91% to 100%)

·2026.05.03 03:18

스키마 검증으로 CoT 준수율을 9.91%에서 100%로 높였다고 설명한다.

  • Function Calling Harness의 후속편으로, 결과 정확도보다 절차 준수를 검증하는 하네스를 다룬다.

  • IAutoBeInterfaceEndpointReviewApplication 사례에서 GPT-5.4의 첫 시도 성공률이 **9.91%**였고, 수십 개 엔드포인트를 하나도 빼먹지 않고 분류해야 하는 절차 부담이 원인이라고 설명한다. 자유 서술형 CoT는 누락을 숨기지만, 타입화된 제출은 review, revises[], reason 같은 슬롯을 강제해 빠진 단계와 중복을 즉시 드러낸다.

  • 핵심 메시지는 prompt가 절차를 요청하고 schema가 이를 집행한다는 점이다. 이 접근은 투자 메모, SOAP, IRAC, 코드 리뷰 같은 형식에 확장할 수 있으며, 결과를 당장 판정할 수 없는 영역에서도 최소한의 절차 품질을 보장할 수 있다고 본다. 스키마 자체도 역사 사례로 backtesting해야 한다고 제안한다.

  • 후반부에서는 전통적 function calling의 one-shot 한계를 짚고, Typia의 lenient parsing과 incremental validation으로 스트리밍 중간 상태를 검증하는 방식을 제안한다. 출력이 중간에 잘려도 유효한 접두사는 체크포인트로 남아, 절차 준수율을 **100%**까지 끌어올리는 구조를 설명한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.