AI Briefing

워크스페이스 실험

What happens when you rip out the residual stream and replace it with a structured workspace (Research Paper - CWT)

·2026.04.19 03:32

핵심 내용

CWT는 계산량을 **약 45%** 줄이면서 baseline 대비 **PPL 1.7% 차이**를 유지했다.

자세히 보기

CWT는 transformer의 residual stream을 완전히 제거하고, 대신 structured workspace로 치환한 아키텍처다.

핵심 비교에서 CWT는 22.9M core compute(attn+FFN)를 사용했고, compute-matched baseline은 41.7M이었다. 그 결과 코어 compute 약 45% 절감에도 불구하고 품질은 PPL 1.7% 차이 수준으로 근접했다.

또한 structured workspace를 쓰면 토큰 단위로 모델 내부 동작을 더 직접적으로 추적할 수 있어, 일반 transformer보다 3D 시각화와 기록이 용이하다고 설명한다.

paper, model weights, model code는 모두 open source로 공개됐다. 저자는 첫 정식 연구 논문이며, 예산과 compute 제약이 있었다고 덧붙였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.