OpenAI, Ironclad와 협력해 GPT-6 Astra 학습… 정확도 32% 향상
핵심 내용
GPT-6 Astra, Ironclad 작업서 55.0% 달성해 GPT-5.6 Sol 대비 정확도 32% 향상
자세히 보기
OpenAI가 AI 계약 관리 선도 기업 Ironclad와 협력해 GPT-6 Astra의 학습 및 평가 작업을 개발했다. 이번 협력은 계약 설정, 승인, 재사용 가능한 법적 조항 등 복잡한 비즈니스 워크플로우를 에이전트가 처리하도록 교육하는 데 초점을 맞췄다.
벤치마크 성능
GPT-6 Astra는 Ironclad 특화 작업으로 학습된 최초의 프런티어 모델이다. GPT-5.6 Sol과의 비교 연구에서 Astra는 정확성과 효율성 모두에서 큰 폭의 개선을 보였다.
- 평균 루브릭 점수: Astra는 **55.0%**를 기록해 Sol의 **41.6%**를 앞섰다.
- 시도당 예상 소요 시간: Astra는 평균 19.2분으로, Sol의 37.0분보다 짧았다.
- 개선율: Astra의 평균 점수는 Sol보다 32% 높고, 시도당 예상 소요 시간은 48% 낮았다.
개발 과정에서 사용된 내부 모델은 **63.7%**의 더 높은 점수를 기록해 향후 모델 개선 가능성을 시사했다.
작업 정의 및 방법론
Ironclad 직원과 OpenAI 사용자는 법률, 상업, 조달 업무를 포괄하는 11개 작업을 선정했다. 비밀유지계약 설정이나 관할권별 조항 업데이트 같은 작업은 숙련된 사용자가 30~40분이 걸린다. 각 작업은 8~50개 기준으로 평가되어 성공과 실패를 구체적으로 측정했다.
모델 학습에는 SEC의 EDGAR 데이터베이스에서 개인 정보를 제거한 계약서를 기반으로 한 합성 학습 작업이 사용됐다. OpenAI 고객 데이터나 Ironclad의 비공개 고객 데이터는 사용하지 않았다. 모델은 Ironclad 소프트웨어 환경에서 강화 학습을 통해 피드백을 받으며 성능을 개선했다.
전문 업무에 미치는 영향
이번 협력은 복잡한 워크플로우 자동화 시 비즈니스 규칙과 통제를 유지하는 과제를 부각한다. 에이전트가 재무 승인 한도 같은 규칙을 놓치면 전체 프로세스가 실패한다. 이는 AI 에이전트가 고도화되더라도 인간 감독과 Ironclad 같은 견고한 플랫폼의 필요성이 지속됨을 보여준다.
OpenAI는 다른 소프트웨어 기업들의 연구 참여를 독려하고 있다. 파트너는 에이전트 실패 사례, 안전한 테스트 환경, 전문 도메인 지식을 제공해 전문 AI 작업의 성공 기준을 정의하는 데 기여해야 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.