AI 시대를 위한 평가 지표
OpenAI가 'Dollar당 유용한 지능'이라는 네 가지 지표로 AI 투자 수익을 측정하는 방식을 제시했다.
경영진들이 AI 지출에서 더 큰 가치를 얻는 방법을 묻고 있다. OpenAI는 토큰당 비용이 아닌 작업 완료도를 중심으로 AI의 경제성을 평가할 것을 제안한다.
1. 실제로 이뤄진 유용한 작업이 얼마나 되는가?
고객 문제 해결, 코드 배포, 계약 검토 등 실제 결과물을 측정하는 것이 시작점이다. 더 우수한 모델은 더 복잡한 작업을 처리할 수 있고, 이는 사람들의 판단과 창의성에 집중할 시간을 만든다.
2. 성공한 작업당 실제 비용은 얼마인가?
토큰당 가격이 낮다고 해서 결과당 비용이 낮은 것은 아니다. 고급 모델이 첫 시도에서 올바른 답을 제공하면 재시도, 검토, 수정 비용이 줄어들어 최종 비용이 더 낮을 수 있다. 이를 위해 전체 비용(컴퓨팅 + 인간 검토 + 재작업)을 성공한 작업 수로 나눈다.
OpenAI가 지난주 출시한 GPT-5.6은 세 가지 계층으로 구성된다: Sol(최상위, 최고 성능), Terra(성능과 비용 균형), Luna(가장 빠르고 저렴). 작업의 경제성에 따라 선택할 수 있다. DeepSWE v1.1 벤치마크에서 GPT-5.6 Sol은 72.7%를 달성하며 다른 주요 모델 대비 API 비용을 36.2% 절감했다.
3. AI가 작업을 올바르게 수행하는 빈도는?
AI 채택은 단계적으로 심화된다. 초안 작성 → 맥락 찾기와 도구 연계 → 실제 작업 수행 순으로 진행되며, 각 단계마다 더 높은 신뢰성을 요구한다. 팀은 세 가지 지표로 추적할 수 있다:
- 사용 가능: 제시된 결과가 품질 기준을 충족
- 수정 필요: 재시도 또는 인간 편집 필요
- 단계 상향: 완료를 위해 인간 개입 필요
신뢰성을 위해서는 명확한 경계 설정이 중요하다. 데이터 접근 권한, 시스템 변경 권한, 검토 및 승인 시점 등을 미리 정의해야 한다. ChatGPT Work는 엔터프라이즈 보안, 개인정보보호, 규정준수, 워크스페이스 관리를 기반으로 한다.
4. 규모가 커질수록 AI 달러당 더 많은 작업이 수행되는가?
같은 워크플로우를 시간에 따라 추적하면서 완료된 작업, 총 비용, 작업당 비용을 기록한다. 완료된 작업이 총 비용보다 빠르게 증가하면서 품질이 유지되거나 향상되면, 각 AI 달러가 더 많은 가치를 생산하고 있다는 뜻이다.
컴퓨팅이 이 방정식의 중심이다. 더 나은 모델, 효율적인 추론, 목표 설정 하드웨어, 높은 사용률, 스마트 라우팅, 강력한 제품 설계가 모두 컴퓨팅 수익을 개선한다. 이러한 이점은 인간의 관점에서 더 나은 답변, 빠른 결과, 더 적은 수정, 신뢰성 높은 제품, 더 낮은 작업 비용으로 경험된다.
이익은 복합적으로 축적된다. 더 나은 인프라 → 가속화된 연구 → 더 우수하고 효율적인 모델 → 향상된 제품 → 채택 증대와 수익 성장 → 다음 세대 연구와 안전에 대한 계속된 투자.
OpenAI는 ChatGPT, ChatGPT Work, Codex, API를 통해 이 모든 것을 하나의 지능형 플랫폼으로 통합한다. 한 계층이 개선되면 모든 제품과 고객이 그 혜택을 받을 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.