OpenAI, 자체 추론 칩 Jalapeño 성능 공개: 전력당 처리량 최대 1.9배, 지연 시간 최대 3.6배 개선
핵심 내용
OpenAI의 자체 추론 칩 Jalapeño가 전력당 처리량과 지연 시간에서 기존 하드웨어 대비 우위를 입증했다.
자세히 보기
OpenAI가 자체 개발한 첫 추론 칩 Jalapeño의 초기 성능 테스트 결과를 공개했다. Jalapeño는 단일 아키텍처 내에서 기존 하드웨어가 겪는 처리량과 지연 시간 간의 트레이드오프를 극복하며, 전력당 AI 작업 처리량과 응답 속도를 동시에 향상시켰다.
성능 벤치마크 결과
OpenAI는 공개 벤치마크 InferenceX를 활용해 Jalapeño를 주요 상용 AI 시스템과 비교했다. 테스트 대상 모델은 GPT-OSS 120B, DeepSeek R1, Kimi K2.5 1T이다.
- 전력당 처리량: 피크 처리량 기준 비교 시스템 대비 1.5~1.9배 향상
- 엔드투엔드 지연 시간: 비교 시스템 대비 1.7~3.6배 감소
- 대화형 워크로드: 성능이 2.1~4.1배 높게 측정됨
특히 가장 큰 모델인 Kimi K2.5 1T에서는 전력당 피크 성능이 약 1.5배, 지연 시간이 3.4배 개선된 것으로 나타났다. Jalapeño의 정격 전력은 700W이지만, 테스트 워크로드에서 지속 전력은 550W 이하로 유지되었다.
아키텍처 및 전략
Jalapeño는 칩, 메모리, 네트워크, 소프트웨어, 랙 스케일 시스템을 실제 언어 모델 워크로드에 맞춰 통합 설계했다. 이는 OpenAI가 모델부터 하드웨어까지 전체 스택을 직접 제어하는 '풀스택(Full-stack)' 전략의 일환이다.
OpenAI는 향후 수개월 내 Jalapeño의 생산량을 확대하여 더 빠르고 효율적인 AI 서비스를 제공할 계획이다. 이는 AGI(범용 인공지능)의 혜택을 더 많은 사용자에게 저렴하고 안정적으로 제공하기 위한 기반이 될 것으로 보인다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.