AI Briefing

FuriosaAI, ICML 2026서 풀스택 소프트웨어 효율화

·2026.08.06 09:00

핵심 내용

FuriosaAI가 LLM 추론·학습·서빙 효율화를 다룬 ICML 2026 논문 4편을 발표했다.

자세히 보기

FuriosaAI가 ICML 2026에서 AI 모델 아키텍처부터 서빙 파이프라인, 하드웨어 실행까지 아우르는 소프트웨어 최적화 연구 4편을 발표했다. 모든 논문은 Furiosa 알고리즘 팀 산하 AI Research Group이 작성했다.

  • ReJump: LLM의 추론 과정을 트리와 비연속 전이인 ‘점프’로 표현해 백트래킹·검증·계산 같은 실행 패턴을 분석한다. 이를 통해 Best-of-N 선택 성능을 추론 작업에서 최대 9.1% 높였다.
  • LoSA: 블록 단위 diffusion language model의 KV 캐시 메모리 증가 문제를 해결한다. 안정적인 토큰의 prefix attention을 재사용하고 활성 토큰에만 sparse attention을 적용해 장문 생성 확장성을 높인다.
  • AsyncOPD: rollout 생성과 learner 업데이트를 분리한 비동기 on-policy distillation 파이프라인을 제안한다. 동기식 기준선보다 학습 처리량을 1.6~3.8배 높였다.
  • EfficientRollout: 4비트 self-drafting 모델과 시스템 인지형 speculative decoding, 동적 draft 길이 조정을 결합했다. RL rollout을 최대 19.6%, 엔드투엔드 학습을 12.7% 손실 없이 가속했다.

ICML 기간에는 서울 강남 본사에서 연구자, 시스템 아키텍트, 엔지니어, 협력사 관계자 등 100명 이상이 참석한 커뮤니티 행사를 열고 Furiosa의 풀스택 생태계 구축 방향을 공유했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.