Pi4가 더 빠르다
Much faster static embedding
·2026.04.21 08:53
static embedding을 재구성해 기존 모델보다 최대 100배 빠른 런타임을 만들었다.
static-retrieval-mrl-en-v1를 Rust에서 쓰기 쉽게 다시 구성해, 토큰-ID 조회표 수준의 가중치를 compile-time static globals로 물리고 토크나이저/추론 경로를 단순화했다.
그 결과 기존 구현 대비 약 100배 빠른 속도를 냈고, 원본 모델과 같은 가중치를 쓰기 때문에 정확도 저하 없이 NanoBEIR 성능을 유지했다고 밝혔다.
벤치마크는 M4 Mac Mini와 Raspberry Pi 4 Model B에서 측정했다.
- 배치 QPS: 자체 구현 4.5M(M4), 88.6K(pi4)
- 단일 질의 QPS: 자체 구현 524.9K(M4), 40.9K(pi4)
- 비교군으로는 MiniLM-L6, Potion-2M, StaticMRL을 사용
- 특히 Raspberry Pi 4에서의 속도가 다른 모든 모델의 Mac Mini 성능보다 빠르다고 주장했다.
핵심은 새 모델을 만든 게 아니라, 이미 학습된 static embedding을 훨씬 얇은 전용 런타임으로 재배치해 추론 병목을 크게 줄였다는 점이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.