Redwood, AI 모니터링 위한 'NLS 깊이' 정의… Kimi-K3의 높은 깊이와 DeepSeek의 과대 계산 구분
핵심 내용
Redwood Research는 'NLS 깊이'를 정의하고, Gated DeltaNet을 쓰는 Kimi-K3의 깊이 증가와 DeltaNet을 쓰지 않는 DeepSeek-V4-Pro의 Sinkhorn-Knopp 연산에 따른 과대 계산을 구분했다.
자세히 보기
Redwood Research는 AI 모델 내부의 '불투명 순차 깊이(opaque serial depth)'를 측정하기 위해 자연어 기반 노드(NL-rooted node)를 기준으로 한 'NLS 깊이' 지표를 정의했다. 이 지표는 NL-rooted 병목을 통과하지 않는 연산 경로의 깊이를 기준으로 한다. 원문에 따르면, CoT(Chain-of-Thought)를 사용하는 표준 트랜스포머의 불투명 순차 깊이는 레이어 수에 비례하는 경향을 보인다. Gated DeltaNet을 사용하는 Kimi-K3는 비교 대상 표준 트랜스포머보다 레이어당 NLS 깊이가 높은 것으로 분석되었다. DeltaNet을 사용하지 않는 DeepSeek-V4-Pro도 높은 값이 나왔지만, 이는 Sinkhorn-Knopp 연산에 의해 깊이가 과대 계산된 사례로 구분된다. 연구진은 이 연산이 직렬적이지만 FLOPs가 적고 학습된 파라미터를 사용하지 않는다는 점을 들어, 높은 지표값을 현재 NLS 깊이 정의의 결함으로 지적했다. 또한, 프롬프트 엔지니어링이나 일반적인 CoT 학습 등 대부분의 사후 학습(post-training) 방식은 노드를 NL-rooted 상태로 유지하므로 NLS 깊이를 증가시키지 않는다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.