AI Briefing

5080로 처음부터

235M param LLM from scratch on a single RTX 5080

·2026.04.22 01:32

핵심 내용

RTX 5080 한 장으로 235M 파라미터 LLM을 처음부터 학습했다.

자세히 보기

PyTorch로 235M 파라미터 LLM을 pretrained weights 없이 처음부터 학습했다.

구성은 18 layers, hidden size 1024, GQA 16 query heads / 4 KV heads, SwiGLU FFN 2816, RoPE(theta 10000), RMSNorm pre-norm, tied embeddings이며, 32k SentencePiece BPE vocab를 사용했다.

학습은 bf16 mixed precision과 gradient checkpointing으로 single consumer GPU인 RTX 5080에 맞췄고, seq len 1024에서 약 5B tokens를 학습했다.

데이터 파이프라인도 직접 구성했다.

  • FineWeb-Edu, Wikipedia, StackExchange, code, ArXiv 사용
  • 품질 및 독성 필터링
  • MinHash deduplication
  • 자체 SentencePiece tokenizer
  • 도메인 가중치 혼합
  • pretraining과 instruction tuning, assistant token만 학습하도록 loss masking 적용

샘플 출력도 공개했다. 예시에서는 "World War 1" 질문에 1914년을 답하고, steak의 정의도 무난하게 응답했다.

다음 버전인 Plasma 1.1은 현재 500M 파라미터로 학습 중이며, 더 나은 멀티턴 대화와 더 큰 vocab, byte fallback을 목표로 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.