AI Briefing

추론 시대를 이끄는 DigitalOcean AI 네이티브 클라우드 내부 (7분 읽기)

·2026.05.05 09:00

DigitalOcean이 추론·에이전트용 AI 네이티브 클라우드를 공개했다.

DigitalOcean은 Deploy 2026에서 추론·에이전트 워크로드를 겨냥한 AI-Native Cloud를 공개했다. 이번 행사에서만 15개 제품을 선보이며, 실리콘부터 에이전트까지 5개 계층을 하나의 오픈 스택으로 묶었다.

AI 워크로드는 단일 요청이 아니라 생각-행동-재사고 루프를 반복한다. 수십만 토큰, 다중 도구 호출, 상태 저장, 코드 실행이 한 작업 안에서 이어지기 때문에, 기존 클라우드처럼 서비스가 분절된 구조로는 맞추기 어렵다.

  • Infrastructure: 19개 데이터센터와 200+ PoP를 운영하고, Kansas CityMemphis에 신규 용량을 더한다. Richmond 데이터센터는 GA이며 NVIDIA HGX B300, AMD Instinct MI350X, H100, H200, MI300/MI325를 제공하고 첫 liquid-cooled racks도 도입했다.
  • Core Cloud: non-blocking RDMA fabric, RDMA-enabled NFS, VPC-native inference를 추가했다. Burstable CPUMicroVM Droplets는 Private Preview로, Firecracker 기반에 약 200ms 시작 시간을 갖는다.
  • Inference Engine: Inference Router가 요청마다 비용·지연·품질을 고려해 모델을 고르고, 의도 판별은 200ms 안에 끝낸다. Dedicated Inference, BYOM, 멀티모달 모델 지원, Batch Inference, Content Safety Guardrails, Serverless Inference, Evaluations를 함께 제공하며, Batch Inference는 피크 서버리스 요금의 약 50% 수준이다. DigitalOcean은 독립 Artificial Analysis 벤치마크에서 Qwen 3.5DeepSeek V3.2의 토큰 처리량이 가장 빠르다고 주장했다.
  • Data & Learning: Knowledge BasesLearning & Feedback Loops는 GA, Managed Weaviate는 Private Preview, PostgreSQL Advanced EditionMySQL Advanced Edition은 Public Preview다. 전자는 기본적으로 MCP 도구로 노출되고, 후자는 50 TiB까지 확장되며 수분 내 1 TiB 스케일업, 초 단위 proxy-based failover, 100+ observability metrics를 지원한다.
  • Managed Agents: Open Harness, Managed Sandboxes, Durable State Management, Plano(Apache 2.0), Launchpad, MCP, ToolBox(Coming Soon)를 묶어 프로덕션 에이전트 런타임을 만든다. Managed SandboxesE2B-compatible이고 Firecracker 기반이며 sub-second cold start를 목표로 한다. ToolBox는 3,000개 이상 커넥터를 겨냥한다.

오픈소스는 바닥부터 깔려 있다. PostgreSQL, MySQL, MongoDB, Valkey, OpenSearch, Kafka, Weaviate, vLLM, SGLang, OpenCode, LangGraph, CrewAI 위에 런타임을 얹고, 사용자는 가중치와 하네스, 도구만 가져오면 된다.

같은 VPC, 같은 실리콘, 같은 청구서로 묶어 egress 비용과 마진 적층, 통합 부담을 줄이는 것이 핵심이다. DigitalOcean은 이 풀스택 최적화가 비용과 성능을 함께 바꾼다고 설명했다. Workato는 1조 건의 자동화 작업을 67% 낮은 비용으로 처리했고, Character.AI는 하루 10억 건 이상의 질의를 2배 추론 처리량으로 소화했다. LawVo는 추론 비용을 42% 낮췄고, Hippocratic AI2천만+ 환자 상호작용을 40% 낮은 지연 시간으로 운영했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.