AI Briefing

Cloudflare, 멀티모달 Clef-omni 출시 및 Clef-flash 가격 인하·속도 개선

·2026.10.10 03:27

핵심 내용

Cloudflare가 멀티모달 Clef-omni를 출시하고 Clef-flash 가격을 인하했으며 Clef 속도를 개선했다.

자세히 보기

Cloudflare가 오픈 웨이트 의사결정 모델 Clef 라인업을 확장하며 오디오, 비디오, 이미지, 텍스트 입력을 네이티브로 지원하는 Clef-omni를 공개했다. 이를 통해 개발자는 전사 파이프라인 없이 단일 API 호출로 멀티모달 데이터를 처리할 수 있다. 이 모델은 Qwen3-Omni-30B-A3B-Instruct 혼합 전문가(MoE) 기반 위에 LoRA와 2단계 어텐션 라우팅 메커니즘을 적용해 모든 모달리티의 파라미터를 동시에 점수화한다.

성능 및 가격 업데이트

Clef-omni는 텍스트 약 130 ms, 이미지 150 ms, 21초 영상 클립 1.5초의 중앙값 지연 시간을 기록하며, 입력 토큰당 $0.15의 가격이 책정됐다.

동시에 Cloudflare는 Clef-flash의 가격을 입력 토큰당 $0.038로 인하해 경쟁 모델인 Jev보다 저렴하게 만들었다. 다만 호스팅 버전의 컨텍스트 윈도우는 기존 64k에서 24k로 축소됐다. Cloudflare는 이 한계를 초과하는 요청이 **0.24%**에 불과하다고 설명했으며, Hugging Face의 오픈 웨이트는 자체 호스팅 시 256k 컨텍스트 윈도우를 지원한다. Clef는 입력 토큰당 $0.24에 64k 컨텍스트 윈도우를 유지한다.

인프라 최적화

호스팅 Clef 모델은 SGLang 기반 서빙으로의 마이그레이션 등 인프라 최적화를 통해 속도가 크게 향상됐다. 다양한 입력 크기에서 중앙값 응답 시간이 1.7배에서 2.0배까지 개선됐다:

  • ~800 토큰: 중앙값 262 ms에서 152 ms로 감소
  • ~3,400 토큰: 중앙값 616 ms에서 305 ms로 감소
  • ~16,000 토큰: 중앙값 2,721 ms에서 1,635 ms로 감소

이러한 업데이트는 AI Gateway를 통해 제공되며 Jev API와 완전히 호환된다. Cloudflare는 스팸 탐지, 피싱 중재, PII 스캐닝 등 내부 사용 사례를 강조하며, 전문 머신러닝 팀 없이도 의사결정 기능을 활용할 수 있다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.