에이전트를 구동한다: Workers AI, Kimi K2.5부터 대형 모델 지원 시작
핵심 내용
Cloudflare Workers AI가 Kimi K2.5를 올려 256k 컨텍스트·툴콜링을 지원한다.
자세히 보기
Cloudflare가 Workers AI에 frontier급 오픈소스 대형 모델을 본격 도입했다. 첫 모델은 Moonshot AI의 Kimi K2.5로, 256k context window, multi-turn tool calling, vision inputs, structured outputs를 지원해 에이전트 작업에 적합하다.
Cloudflare는 이미 Durable Objects, Workflows, Dynamic Workers, Sandbox 같은 실행 프리미티브와 Agents SDK를 제공해 왔지만, 이제는 모델까지 같은 플랫폼 안에서 처리할 수 있게 됐다. 이로써 에이전트의 전체 생명주기와 실행 환경을 하나의 개발 플랫폼에서 묶어 운영할 수 있다.
성능과 비용 측면에서도 Kimi K2.5의 효용을 강조했다. Cloudflare 내부의 OpenCode 환경에서 이 모델을 일상적인 agentic coding 작업에 쓰고 있으며, 자동 코드 리뷰 파이프라인과 공개 코드 리뷰 에이전트 Bonk에도 적용했다. 한 보안 리뷰 에이전트는 하루 7B tokens 이상을 처리하며 단일 코드베이스에서 15건 이상의 confirmed issues를 찾아냈고, 중간급 proprietary model로 돌렸다면 연간 $2.4M이 들 작업을 Kimi로 바꾸면서 77% 비용 절감을 달성했다고 밝혔다.
대형 모델을 안정적으로 서빙하기 위해 inference stack도 손봤다. Infire inference engine 위에 Kimi용 custom kernels를 적용해 성능과 GPU utilization을 끌어올렸고, 대형 모델 최적화에 쓰이는 data parallelization, tensor parallelization, expert parallelization, disaggregated prefill 같은 기법을 운영 환경에 맞게 통합했다. Cloudflare는 셀프호스팅 시 필요한 ML Engineer, DevOps, SRE 수준의 최적화를 플랫폼이 대신 처리해 준다고 설명한다.
플랫폼 기능도 에이전트 워크로드 중심으로 강화했다.
- Prefix caching을 활용해 이전 요청의 입력 텐서를 재사용하고, 더 빠른 TTFT와 높은 TPS를 얻는다.
- 캐시된 토큰을 사용량 지표로 노출하고, 입력 토큰보다 저렴하게 과금한다.
- 세션 단위 캐시 적중률을 높이기 위한
x-session-affinity헤더를 도입했다. - 비실시간 작업용으로는 새로 개편한 Asynchronous API를 제공해, 큐에 넣은 요청을 capacity가 생길 때 순차적으로 처리한다.
Cloudflare는 이 비동기 방식이 코드 스캔 에이전트나 리서치 에이전트처럼 즉시 응답이 필요하지 않은 작업에 특히 유용하다고 본다. 모델 페이지, prompt caching, batch API, Agents SDK starter, OpenCode 연동, playground까지 함께 열어두며 Kimi K2.5를 Workers AI의 기본 에이전트 모델로 밀어 올리고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.