DeepSeek V4.1 Flash, agentic coding 벤치마크서 Anthropic 제쳐… 미중 AI 격차 3%로 축소
핵심 내용
DeepSeek V4.1 Flash가 agentic coding에서 Anthropic을 제치고 미중 AI 격차를 3%로 좁혔다.
자세히 보기
DeepSeek의 V4.1 Flash 출시로 미국과 중국 AI 모델 간 성능 격차가 사상 최저인 3%까지 좁혀졌다. Bloomberg Intelligence 분석에 따르면, 10월 4일 LiveBench 스냅샷 기준 DeepSeek은 기업 소프트웨어 자동화의 핵심 지표인 agentic coding에서 Anthropic의 주요 모델을 앞섰다. DeepSeek은 이 하위 벤치마크에서 77.3점을 기록한 반면, Anthropic의 Claude Fable 5.1 Max Effort는 66.1점에 그쳤다.
아키텍처 및 가격
DeepSeek V4.1 Flash는 총 7480억 개의 파라미터를 갖춘 Mixture of Experts (MoE) 아키텍처를 사용하며, Engram이라는 새로운 영구 메모리 컴포넌트를 포함한다. 추론 시에는 파라미터의 일부만 활성화되어 연산 비용을 크게 절감한다. 가격은 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $1.20(피크 시간 기준)이며, 오프피크 시간에는 절반이다. 최대 100만 토큰의 컨텍스트 윈도우를 지원하고 네이티브 멀티모달 기능을 추가했다.
벤치마크 차이
LiveBench 데이터는 좁은 격차를 보이지만 다른 방법론에서는 결과가 다르다. NIST의 AI 표준 및 혁신 센터(CAISI)는 2026년 5월 전작인 DeepSeek V4 Pro를 평가하며 미중 간 개발 시간 격차를 약 8개월로 추정했다. 분석가들은 다른 벤치마크가 성능의 서로 다른 측면을 측정하며, 3% 수치는 모든 특정 기업 작업에서의 동등함이 아닌 복합 리더보드 결과임을 지적한다.
법적 및 보안 위험
기업 도입의 주요 제약은 중국 National Intelligence Law이다. 이 법은 중국 기업이 정부 정보 요청에 협조하도록 요구한다. DeepSeek API로 전송되는 독점 코드와 프롬프트 등 데이터는 중국 당국에 공개될 수 있으며, 개인정보 보호 정책으로 이 법적 의무를 우회할 수 없다. 또한 보안 연구원들은 이전에 DeepSeek의 노출된 데이터베이스를 발견해 운영 보안 우려를 제기했다.
기업 영향
엄격한 데이터 거버넌스가 필요한 팀은 오픈 웨이트 모델을 프라이빗 인프라에 self-hosting하여 API 전송 위험을 제거할 수 있지만, 상당한 하드웨어 투자가 필요하다. 미국 정부는 이미 정부 기기에서 DeepSeek 사용을 금지했으며, 양당 입법부는 이러한 제한을 공식화하려 한다. DeepSeek은 agentic coding의 원시 성능에서 선두를 달리지만, 생태계 성숙도와 통합 도구는 Anthropic, OpenAI 등 미국 경쟁사보다 뒤처져 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.