구글 딥마인드, 세계 최초 이중맹검 AI 평가 도입... 벤치마크 오염 방지
·2026.08.28 09:00
핵심 내용
구글 딥마인드가 암호화 기술을 활용해 모델과 평가 데이터를 서로 볼 수 없게 하는 세계 최초 이중맹검 AI 평가를 도입했다.
자세히 보기
구글 딥마인드가 이중맹검(double-blind) 방식을 적용한 세계 최초의 AI 모델 평가를 시범 운영한다. 이는 외부 평가자가 모델 가중치를 볼 수 없고, 구글이 평가 데이터를 미리 볼 수 없도록 하여 벤치마크 오염(benchmark contamination) 문제를 해결하기 위한 조치다.
이번 평가는 Gemini Flash Lite 모델을 대상으로 진행되며, Singapore AI Safety Institute, OpenMains, AVERI, MLCommons 등과의 파트너십을 통해 수행된다. 핵심 기술로는 Google Cloud의 Confidential Computing 포트폴리오 내 Confidential Space가 사용되어, 평가 데이터와 모델 가중치 모두를 암호화된 환경에서 안전하게 처리한다.
기존의 외부 평가는 평가자가 모델을 직접 확인하거나 모델 제공자가 데이터를 보는 방식이었으나, 이번 이중맹검 방식은 양측 모두에게 정보 접근을 제한함으로써 평가의 공정성과 신뢰성을 높인다. 이는 AI 모델의 성능과 안전성을 검증하는 과정에서 발생할 수 있는 인위적인 점수 부풀리기를 방지하고, 정책 입안자 및 기업이 AI 벤치마크 결과를 신뢰할 수 있는 기반을 마련한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.