Laguna XS.2와 M.1: 심층 분석
핵심 내용
Laguna가 225B M.1과 33B XS.2, ACP 런타임을 공개했다.
자세히 보기
Laguna 패밀리의 첫 두 모델인 M.1과 XS.2가 공개됐다. M.1은 작년 말 사전학습을 마친 기반 모델이고, XS.2는 더 작은 2세대 모델이자 첫 가중치 공개 릴리스다. 고정된 tool calling보다 코드를 쓰고 실행하는 에이전트가 더 표현력 있는 인터페이스라는 판단 아래, 모델과 이를 굴리는 ACP 런타임을 함께 제시했다.
- Laguna M.1: 225B total / 23B activated의 MoE 모델로, 30T tokens를 전부 자체적으로 학습했다. 6,144개 NVIDIA Hopper GPU를 사용했고, SWE-bench Pro 46.9%, **Terminal-Bench 2.0 40.7%**를 기록했다.
- Laguna XS.2: 33B total / 3B activated의 2세대 MoE다. SWE-bench Pro 44.5%, **Terminal-Bench 2.0 30.1%**를 냈고, 가중치는 Apache 2.0으로 공개된다.
두 모델은 한시적으로 API와 OpenRouter에서 무료로 쓸 수 있고, XS.2는 Ollama와 NVIDIA TensorRT-LLM에서도 지원된다. NVFP4 버전도 제공돼 Blackwell 아키텍처에서 강한 성능을 기대할 수 있다. 함께 공개된 agent harness는 Agent Client Protocol(ACP) 서버로, 에이전트 RL 학습과 평가에 쓰는 동일한 실행 계층이다.
학습 스택은 모두 자체 구축이다. Titan 코드베이스와 자체 agent RL 인프라 위에서 웹 데이터는 품질과 다양성을 함께 최적화했고, 고품질 데이터만 남기지 않고 중·하위 품질 버킷도 일부 유지해 STEM과 추론 편중을 줄였다. 합성 데이터는 최종 믹스의 약 **13%**를 차지했고, 전체적으로 4.4T+ synthetic tokens를 사용했다. 글로벌 deduplication이 고품질 데이터를 과도하게 제거한다는 FineWeb의 가설도 재확인했다.
데이터 믹스 최적화에는 약 60개 proxy model을 돌려 surrogate regressor를 학습하는 AutoMixer를 썼다. 내부 분산 구현의 Muon optimizer는 AdamW 대비 약 15% 적은 step으로 같은 loss에 도달했고, Newton-Schulz 기반 orthogonalization을 통신과 분산으로 처리해 병목을 줄였다. 평가는 Laude Institute의 Harbor Framework와 자체 agent harness로 진행됐고, 대부분 최대 500 step, 8GB RAM/2 CPUs sandbox 조건이었다. Terminal-Bench 2.0만 48GB RAM/32 CPUs로 측정했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.