Blockway, Agens Volundr 32B 프리뷰 공개
Agens Volundr 32B Preview: our small team's first model on our own hybrid architecture. Only 18 of 72 layers keep a KV cache (Apache-2.0)
핵심 내용
Blockway가 Apache-2.0 라이선스로 하이브리드 아키텍처 기반 Agens Volundr 32B 프리뷰를 공개했다.
자세히 보기
홍콩 기반 팀 Blockway가 자체 하이브리드 아키텍처를 적용한 첫 모델 Agens Volundr 32B Preview를 공개했다. 이 모델은 72개 레이어 중 18개만 KV 캐시를 유지하도록 설계해, 모델 가중치보다 KV 캐시 크기가 로컬 하드웨어 배포의 병목이 되는 문제를 해결하고 장기 컨텍스트 작업의 메모리 사용을 최적화한다.
하이브리드 아키텍처 설계
모든 토큰을 처리하는 72층 밀집 아키텍처를 채택하되, 레이어별 어텐션 메커니즘을 차별화했다:
- 54 KDA (Kimi Delta Attention) 레이어: 고정 크기 재귀 상태를 사용하는 선형 어텐션으로 KV 캐시가 필요 없다.
- 17 BCSA 레이어: 최근 4,096개 토큰에 대한 정확한 윈도우를 사용하는 압축 희소 어텐션을 구현하며, 이전 컨텍스트는 4:1로 블록화해 풀링하고 학습된 인덱서로 상위 512개 블록에 접근한다.
- 1개 전체 어텐션 레이어: 72번째 레이어에 위치한다.
- Engram: 호스트 RAM에 저장되는 해시 n-gram 메모리로, 특정 두 레이어에 부착된다.
- mHC: 표준 단일 스트림 대신 4개의 잔차 스트림을 사용한다.
성능 및 벤치마크
이 모델은 262K 컨텍스트 윈도우를 지원한다. 커스텀 sglang 빌드를 사용한 단일 사용자 테스트에서, 2개의 48 GB GPU로 BF16 추론 시 1K 컨텍스트에서 25.1 tok/s의 디코딩 속도를 기록했으며, 8K-64K에서 24.1 tok/s, 128K에서 23.9 tok/s로 24.0 tok/s 수준을 유지했다. 단일 48 GB GPU에서 INT4 양자화를 적용하면 1K 컨텍스트에서 31.0 tok/s에 도달했다.
Qwen3.8-27B와의 비교 벤치마크에서는 코딩 및 수학 작업에서 개선이 나타났다:
- LiveCodeBench v6: +4.2점
- HumanEval: +4.3점
- AIME 2025: +2.9점
- MATH-500: +1.6점
반면 에이전트 작업에서는 열세를 보였다. tau2-bench 점수는 74.2로 Qwen의 79-80점보다 낮았으며, SWE-bench Verified (50개 작업 하위 집합) 점수는 44로 Qwen의 58-64점보다 낮았다. Blockway는 이 격차 해소를 전체 v1 릴리스의 주요 목표로 삼고 있다고 밝혔다.
가용성 및 제한 사항
이 모델은 Apache-2.0 라이선스로 공개되었다. 현재 Blockway가 제공하는 특정 sglang 빌드가 필요하며, 표준 sglang과 vLLM은 아직 로드할 수 없다. GGUF 및 llama.cpp 지원은 계획되어 있으나 현재는 사용할 수 없다. 팀은 이것이 아직 학습 중인 프리뷰 모델임을 강조하며, 전체 버전은 약 10B 토큰까지 사전 학습을 계속하고 장기 에이전트 세션 학습을 포함할 예정이라고 덧붙였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.