Epoch, 프런티어 모델 평가… 정의된 작업은 우수하나 개방형 업무 자동화엔 실패
핵심 내용
Epoch 평가 결과, 프런티어 모델은 정의된 작업은 잘 수행하나 개방형 업무 자동화에는 실패했다.
자세히 보기
Epoch이 Epoch Automation Reports를 공개하며 자사 업무에서 추출한 실제 비즈니스 자동화 과제에 대해 Claude Fable 5.1, GPT-6 Astra, Grok 4.6, Gemini 3.8 Flash, Kimi K3, Qwen 3.8 Max 등 6개 모델을 평가했다. 핵심 결과는 Fable 5.1과 GPT-6 Astra 같은 폐쇄형 모델이 코딩, 계산 분석, 컴퓨터 사용(예: Substack 콘텐츠 포팅) 등 명확히 정의된 작업에서는 신뢰할 수 있지만, 연구 판단이 필요한 개방형 작업에서는 실패하여 완전한 자동화가 불가능하다는 것이다.
성능 및 한계
Fable 5.1과 GPT-6 Astra는 종합 점수에서 선두를 차지했으며 강력한 컴퓨터 사용 능력을 보였다. 그러나 주관적 판단과 암묵적 관례(Epoch의 시각적 스타일 및 독자 선호도 등) 준수가 필요한 그래픽 디자인 및 데이터 인사이트 생성 작업에서는 어려움을 겪었다. Kimi K3와 Qwen 3.8 Max 같은 오픈 웨이트 모델은 정의된 작업에서도 오류율이 높아 벤치마크 점수와 실제 능력 간 격차가 기존 예상보다 크다는 점을 시사했다. 예를 들어 Kimi K3는 필터링 오류로 인해 사실적으로 부정확한 데이터 인사이트를 생성했으나, 폐쇄형 모델은 데이터 인사이트에서 이러한 사실 오류를 범하지 않았다.
연구 판단 실패
모델의 치명적 약점은 유효한 실험을 설계할 수 없다는 점이다. GPT-6 Astra가 AI 에이전트 학습 실패를 조사하도록 요청받은 테스트에서, 이 모델은 4096-token 입력 예산을 가진 파일럿 실험을 제안했다. 이 제약으로 인해 280개의 응답 중 61개가 잘렸고, 모델은 불완전한 데이터에서 규칙을 추론했다. Astra는 오류를 인식하고 예산을 늘려 성능을 개선했지만, 초기 실패를 실험 설정의 결함이 아닌 '획득 예산에 대한 민감도'로 오해하여 결함이 있는 결과를 핵심 발견으로 취급했다. 이러한 결함 있는 결과를 중요한 발견으로 취급하는 패턴은 여러 모델에서 관찰되어 연구 판단력의 부족을 드러냈다.
수렴 및 표준
모델들은 개방형 작업에서 다양성 없이 유사한 아이디어로 수렴하는 경향을 보였다. 예를 들어 Fable 5.1, Gemini 3.8 Flash, Grok 4.6 모두 여론조사 데이터 인사이트로 동일한 주제를 선택했다. 또한 모델들은 충분한 참고 자료에도 불구하고 Epoch의 표준을 파악하지 못해 시각적 스타일이나 주제 관련성 같은 암묵적 관례를 놓쳤다. 연구는 AI가 명확히 정의된 작업은 처리할 수 있지만, 판단력, 패턴 학습, 실험 설계의 격차로 인해 아직 Epoch의 인력을 대체할 수 없다고 결론지었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.