AI Briefing

소형 LLM 정면승부

The joy and pain of training an LLM from scratch

·2026.04.17 16:56

핵심 내용

mii-llm이 64×A100으로 0.4B 다국어 모델 Zagreus/Nesso를 공개했다.

자세히 보기

mii-llm이 Zagreus와 Nesso 모델군의 기술 보고서를 공개했다.

두 모델군은 0.4B 파라미터 규모로 처음부터 학습됐고, edge deployment, 다국어 능력, 유럽 언어 지원을 목표로 설계됐다.

프리트레이닝은 영어 + 목표 언어의 이중 언어 구성으로 진행됐고, 대상 언어는 이탈리아어, 스페인어, 프랑스어, 포르투갈어다.

공개된 모델은 다음과 같다.

  • Zagreus-0.4B-ita: 영어/이탈리아어 베이스
  • Zagreus-0.4B-spa: 영어/스페인어 베이스
  • Zagreus-0.4B-fra: 영어/프랑스어 베이스
  • Zagreus-0.4B-por: 영어/포르투갈어 베이스
  • Nesso-0.4B-instruct: 대화형 후학습 버전
  • Nesso-0.4B-agentic: 구조화·에이전트 작업용 후학습 버전
  • Open-Zagreus-0.4B: 오픈 데이터와 오픈 레시피로 만든 완전 공개 변형

학습 스택은 Datatrove(토크나이징), Hugging Face Nanotron(프리트레이닝), Axolotl(포스트트레이닝), Slurm(멀티노드 오케스트레이션)으로 구성됐고, 하드웨어는 64 NVIDIA A100 GPU, 학습 토큰 규모는 약 1조 tokens다.

설계 선택으로는 MoE 대신 dense 0.4B 구조를 택했다. 보고서는 1B 미만 영역에서는 sparse 효율보다 안정성과 자원 활용률이 더 중요할 수 있다고 설명한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.