Red queen hypothesis – self-improving AI를 위한 새로운 방향
·2026.08.17 05:01
핵심 내용
에이전트와 평가자를 함께 진화시켜 self-improving AI의 성능 한계를 극복하는 연구를 발표했다.
자세히 보기
self-improving AI 에이전트가 스스로 코드를 수정하며 발전할 때, 고정된 평가 지표(benchmark)에 부딪혀 성장이 멈추는 '평가 천장(evaluation ceiling)' 문제가 발생합니다.
케임브리지 대학교 연구팀(NVIDIA, Flower Labs 협업)은 에이전트와 평가자를 동시에 진화시키는 'Red Queen Gödel Machine' 프레임워크를 제안했습니다. 에이전트가 발전함에 따라 평가 기준도 함께 높아지도록 설계하여, 에이전트가 끊임없이 더 높은 수준의 과제를 수행하며 성장할 수 있도록 합니다.
이 프레임워크는 다음과 같은 성과를 입증했습니다:
- 과학 논문 작성 및 수학 올림피아드 수준의 증명 작업에서 기존 self-improving 에이전트보다 우수한 성능을 기록했습니다.
- 공동 진화된 논문 작성 에이전트는 기존 대비 1.78~1.86배 높은 수락률을 보였으며, 채점 에이전트는 9% 더 높은 정확도를 달성했습니다.
또한, NVIDIA Nemotron 3 Ultra와 같은 오픈 소스 모델을 ChatGPT-5.5와 함께 사용하는 하이브리드 방식을 통해, self-improving AI 시스템 개발에 필요한 컴퓨팅 비용을 크게 절감할 수 있음을 확인했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.