AI Briefing

이번 주에 배운 것들 (20분 읽기)

·2026.04.17 09:00

핵심 내용

프론티어 모델은 **distillation**을 막기 어렵고, 대규모 pretraining은 작은 **bias**와 **causality** 위반에도 쉽게 무너진다.

자세히 보기

distillation을 막는 일은 생각보다 어렵다. chain of thought를 숨겨도 우회 경로가 있고, 로컬에서 돌아가는 도구 사용과 파일 수정까지 포함한 에이전트 워크플로는 완전히 가리기 힘들다. 오히려 제품 회사는 사용자가 최종적으로 원한 결과물, 즉 “gold diff”를 RL target으로 삼아 자체 모델을 학습시키며 프론티어 모델을 사실상 증류할 수도 있다.

pretraining이 실패하는 이유로는 크게 두 가지가 강조된다. 하나는 causality를 깨는 설계다. expert routing에서 token routing은 불균형이 심하고, expert choice는 토큰 배치가 서로 영향을 주며 미래 정보를 쓰게 되기 때문에 학습-배포 불일치를 만든다. token dropping 역시 뒤의 토큰이 앞의 토큰 처리에 영향을 주는 식으로 causality를 흔들 수 있다.

다른 하나는 bias의 누적이다. variance는 평균화될 수 있지만 bias는 계속 쌓인다. 예로, FP16 collective에서 작은 gradient를 큰 누적값에 더할 때 정밀도 문제로 값이 크게 왜곡될 수 있고, 이런 류의 버그는 대규모 학습에서 찾기도 매우 어렵다.

학습 병렬화는 이런 문제를 넘기 위한 단계적 해법으로 설명된다. 기본은 data parallel이고, 그 다음이 FSDP다. FSDP는 각 GPU가 파라미터의 일부만 보관하고 layer별로 all-gather를 하며, gradient는 all-reduce 대신 reduce-scatter로 처리해 통신량을 params × 3 수준까지 낮춘다. 다만 GPU 수가 늘수록 compute time은 줄어도 comms time은 줄지 않아 crossover가 생기고, 이때 pipeline parallelism을 추가해야 한다.

하지만 pipeline parallelism은 또 다른 대가를 치른다. batch 앞뒤에서 생기는 bubbles 때문에 GPU 활용률이 떨어지고, stage 간에 residual이나 attention 구조가 얽히면 연구 속도까지 늦어진다. 그래서 핵심은 더 많은 병렬화가 아니라, 어디서 causality를 깨고 어디서 bias를 쌓는지 끝까지 통제하는 discipline이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.