xAI, Grok 4.6의 BioSecBench 성능 공개… 위험 작업 차단율 59.2%
핵심 내용
xAI가 Grok 4.6의 BioSecBench 평가 결과를 공개하며, 위험한 생물학적 작업 차단과 일반 작업 수행 능력을 모두 입증했다.
자세히 보기
xAI가 LatchBio의 독립 분석을 통해 Grok 4.6의 생물학적 능력 및 보안 벤치마크 결과를 공개했다. Grok 4.6는 BioSecBench-Refusal 평가에서 위장된 위험 작업을 가장 신뢰성 있게 차단하면서도 일반 생물학 작업 수행 능력을 유지한 것으로 나타났다.
BioSecBench 평가 결과
LatchBio의 BioSecBench-Refusal 벤치마크에서 Grok 4.6는 다른 모든 프론티어 모델을 제치고 최고 점수를 기록했다. 이 모델은 위험한 레드팀 태스를 59.2% 차단하고, 일반 태스는 64.8% 완료하여 두 지표 모두 50%를 넘긴 유일한 시스템이었다. 다양한 에이전트 하네스 환경에서 평균 **62.1%**의 점수를 기록하며 상위 3위를 차지했다.
BioSecBench-Surveillance 평가에서는 **53.5%**의 성공률을 보였다. 이는 Opus 5 다음으로 높은 점수이며, GPT-5.6 Sol보다 앞선 결과다. 또한 SpatialBench나 TxBench-PP 등 일반 생물학 능력 평가에서도 다른 프론티어 모델과 동등하거나 더 나은 성능을 입증했다.
거절 행동 분석 및 향후 전망
평가 로그 분석 결과, Grok 4.6는 프롬프트의 명시적 의도와 실제 환경 데이터 간의 불일치를 감지하고 작업 의도를 판단한 후 진행 또는 거절을 결정하는 것으로 확인됐다. xAI는 이러한 안전장치를 통해 합법적인 과학 연구를 가속화하는 동시에, 잘못된 정보나 적대적 사용으로 인한 위험을 최소화하는 것을 목표로 하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.