OpenAI, GPT-6 Astra 공개… 전문 업무 SOTA 달성 및 비용 효율성 개선
핵심 내용
OpenAI가 전문 업무와 코딩에서 SOTA를 달성한 GPT-6 Astra를 공개했으며, 토큰 효율성 향상으로 작업당 비용을 절감했다.
자세히 보기
OpenAI가 GPT-6 Astra를 공개하고 ChatGPT Work, Codex, API를 통해 제공하기 시작했다. 이 모델은 컴퓨터 사용, 소프트웨어 엔지니어링, 사이버 보안, 과학 분야에서 SOTA(State of the Art) 성능을 달성했다. 기존 애플리케이션과의 통합을 위해 데이터 준비나 커스텀 통합 없이도 코드 작성 및 작업 수행이 가능하다.
비용 효율성 및 성능
Astra는 더 적은 토큰과 재시도로 작업을 완료하도록 학습되어 작업당 비용을 절감한다. Terminal Bench 4.0 및 Artificial Analysis Intelligence Index 등 전문 업무 평가에서 비용 효율성 프론티어를 대부분 차지했다. 가격은 입력 토큰당 $10, 출력 토큰당 $50이다.
고객사 활용 및 벤치마크
다수의 기업들이 Astra를 도입해 성능 개선을 확인했다.
- Cognition: Devin 하네스 통합으로 내부 벤치마크 SOTA 달성.
- Databricks: OfficeQA Pro 벤치마크 SOTA 달성 및 GPT-5.6 Sol 대비 비용 효율성 개선.
- Hebbia: 브리핑 준수율 17%, 주장 출처 정확도 19% 향상.
- Box: 문서로 뒷받침되지 않는 결론 거부 능력 우수, 잘못된 주장 확률 10% 이상 감소.
- Datacurve: DeepSWE v1.1에서 74%로 신기록 달성.
- CodeRabbit: 버그 발견율 약 20% 증가, 파일 간 추론이 필요한 PR에서 발견율 2배 이상 증가.
안전성 및 엔터프라이즈 제어
Astra는 Preparedness Framework 하에서 Critical cybersecurity capability threshold에 도달한 첫 모델이다. 내부 안전 벤치마크에서 의도치 않은 결과 발생 빈도가 GPT-5.6 Sol 대비 89%, Claude Fable 5.1 대비 74.7% 감소했다. 엔터프라이즈 관리자는 승인된 웹사이트/앱 접근 제한, 업로드/다운로드 관리, 확인 정책(중요 작업 전 승인 요구) 등을 통해 보안을 강화할 수 있다. 출시 시 기본값은 비활성화(off by default) 상태다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.