에이전트는 테스트·검증 기법을 얼마나 잘 활용하는가?
·2026.09.09 13:04
핵심 내용
GPT-5.6 기반 실험에서 TDD, 폼 메소드 등 검증 스킬 지시가 정확도 향상 없이 비용만 증가시켰다.
자세히 보기
GPT-5.6 Sol 모델을 활용해 Zstd Rust 구현 평가 시 TDD, Formal Methods, Fuzzing 등 26종의 검증 기법 지시가 미치는 영향을 분석한 결과, 대부분의 스킬이 성능 개선에 기여하지 못하거나 오히려 비용을 증가시키는 것으로 나타났다.
검증 기법별 성능 분석
- 폼 메소드(Formal Methods): Verus, Alloy, Lean 4 등 실제 코드 검증 대신 추상적 증명이나 모델링 오류(예: 8-bit overflow)를 발생시켰다. ACL2는 메모리 부족(OOM)으로 평가가 편향되었다.
- TDD: 반복적 접근으로 인해 구현과 테스트가 함께 실패하는 Overfitting을 유발하여 Zstd 검증에 부적합했다.
- Fuzzing/PBT: QuickCheck나 Hegel 사용 시 단순 스모크 테스트나 무작위 입력에 그쳤으며, Hegel 적용 시 정확도 개선 없이 토큰 비용이 90만~180만 증가했다.
- 차등 테스트(Differential Testing): 160회 중 10건만 구조화된 입력을 생성했으며, 나머지는 무의미한 무작위 바이트 반복이었다.
비용 및 효율성 문제
- 검증 스킬 사용 시 Medium/XHigh 모드에서 각각 **16%, 18%**의 추가 비용이 발생했다.
- 'Make no mistakes'와 같은 지시문은 기본 설정(Default)과 통계적으로 유의미한 차이가 없었으며, 불필요한 지시는 성능 저하를 초래했다.
- 긴 텍스트 형태의 설명형 스킬은 모델의 기본 행동 분포를 변경하는 지시형보다 비효율적이며, 대부분 무시되거나 의도치 않은 방향성을 유발했다.
시사점
- LLM은 SW 테스트 훈련 데이터 부족으로 인해 기존 행동 분포를 유지하려는 경향이 강하다.
- 범용적인 테스트 워크플로우 스킬보다 API 제어 등 특정 도메인 스킬이 더 유용할 수 있다.
- 모델 버전 전환(GPT-5.5→5.6) 시 기존 프롬프트의 신뢰도가 급락하므로 모델별 최적화가 필요하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.