Liquid AI, 엣지용 오픈 d1 의사결정 모델 공개
Multimodal open d1 decision models for the edge
핵심 내용
Liquid AI가 엣지용 오픈 웨이트 의사결정 모델 d1 시리즈를 공개했다.
자세히 보기
Liquid AI가 엣지 디바이스에서의 빠른 구조적 의사결정을 위해 오픈 웨이트 의사결정 모델 d1-3B와 실험적 모델 d1-omni-600M을 공개했다. 생성형 모델과 달리 단일 순방향 패스로 쿼리에 응답해 의도 분류, 유해성 탐지, 의료 QA 등 저지연 추론 작업에 적합하다.
성능 및 벤치마크
d1-3B는 Decision Index 0.2.1에서 48.57점을 기록하며 100억 파라미터 미만 의사결정 모델 중 최고 성능을 입증했다. 이는 Decider 35B-A3B(47.11)를 포함한 모든 4B 및 9B 모델을 능가한다. 7개 공개 데이터셋 평균 점수는 82.9로 Decider 4B(81.1)보다 높으며, 더 작은 d1-omni-600M은 파라미터의 4분의 1 규모로 Decider 2B(77.1)를 넘어서는 78.4점을 달성했다.
| 벤치마크 | d1-omni-600M | d1-3B | Decider 2B | Decider 4B | | :--- | :--- | :--- | :--- | :--- | | SQuAD 2.0 | 74.0 | 83.3 | 67.7 | 76.0 | | Civil Comments | 95.8 | 93.3 | 93.6 | 92.8 | | MASSIVE intent | 86.1 | 86.9 | 81.1 | 88.3 | | PubMedQA | 61.3 | 68.3 | 65.7 | 63.3 | | BoolQ | 77.7 | 86.3 | 87.3 | 89.0 | | XNLI | 74.7 | 85.6 | 85.0 | 88.6 | | PAWS-X | 79.5 | 76.4 | 59.5 | 69.8 | | 평균 | 78.4 | 82.9 | 77.1 | 81.1 |
아키텍처 및 모달리티
두 모델 모두 Liquid Foundation Models(LFMs) 기반이지만 서로 다른 백본을 사용한다.
- d1-3B: 디코더 전용 비전-언어 모델인 LFM2.5-VL-3B로 학습되었으며 텍스트와 이미지 입력을 지원한다.
- d1-omni-600M: 양방향 인코더인 LFM2.5-Encoder-350M으로 학습되었으며 텍스트와 이미지 또는 오디오 입력을 지원한다. 현재 초기 연구 릴리스 단계다.
엣지 및 GPU 추론 속도
NVIDIA와의 협업을 통해 다양한 하드웨어에서 d1-3B를 평가한 결과, 엣지 디바이스에서 단일 질문 응답 시 50ms 미만의 지연 시간을 보였다.
- NVIDIA Jetson AGX Thor: 질문당 16 ms
- Jetson AGX Orin 64 GB: 질문당 26 ms
- Jetson Orin Nano: 질문당 50 ms
- Apple M5 Pro: 질문당 30 ms
고사양 GPU에서는 지연 시간이 더 단축된다.
- NVIDIA RTX 4090: 질문당 8 ms
- AMD MI325X: 질문당 9 ms
모델은 Hugging Face에서 오픈 웨이트 라이선스로 제공되며, 통합 시 transformers>=5.14가 필요하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.