AI Briefing

MoE 모델, 악성 코드 판별에 도덕성 라우팅 경로 활용

·2026.10.06 20:00

핵심 내용

MoE 모델의 도덕성 라우팅 이식 실험 결과 악성 코드 감지 정확도가 크게 변했다.

1 / 3

자세히 보기

악성 코드 감지와 도덕성 라우팅

Mixture-of-Experts(MoE) 모델 연구에 따르면, "이 코드가 악성인가?"라는 질문은 취약점이나 합법성 질문보다 도덕성 관련 질문과 가장 유사한 전문가 라우팅 경로를 활성화한다. OLMoE, DeepSeek-V2-Lite, DeepSeek-Coder-V2-Lite 모델에서 "악성"과 "도덕성" 질문 간 라우팅 거리는 테스트된 모든 개념 중 가장 짧았다(약 1.5 동의어 단위).

모델의 내부 "작업 공간"(잔차 스트림)은 코드 처리 중 "malware"나 "attack" 같은 용어를 디코딩하지만, 라우팅 메커니즘 자체는 도덕적 추론과 정렬된다. 잔차 스트림에서 가독성 있는 도덕 개념을 제거해도 라우팅 분리가 방해받지 않는다는 사실은 라우터가 모델의 명시적 개념 표현과 구별되는 정보를 기반으로 작동함을 시사한다.

라우팅 이식 실험

라우터가 다른 질문의 전문가 경로를 사용하도록 강제하는 라우팅 이식 실험은 기증 질문의 개념을 전달하지 않고도 모델의 최종 답변을 변화시킨다. 주요 발견 사항은 다음과 같다:

  • OLMoE: 취약점 라우팅 적용 시 샘플 전반에 걸쳐 "예" 답변 확률이 유의미하게 증가했다.
  • DeepSeek-V2-Lite (일반): 도덕성 라우팅 적용 시 악성 코드에 대한 "예" 확률이 3~7배 감소했다(중간값 64% → 19%).
  • DeepSeek-Coder-V2-Lite: 도덕성 라우팅은 코딩 모델의 악성 코드 "예" 확률을 높인 유일한 이식 사례였다.
  • 메커니즘: 이러한 변화는 기증자의 답변이 아닌 모델의 내부 논리에 의해 주도된다. 예를 들어 기증자 답변이 원본보다 낮을 때 모델은 **67%**의 확률로 이를 따랐지만, 기증자 답변이 높을 때는 **16%**에 그쳤다.

도덕성 경로 가지치기 영향

Qwen3-Coder-30B와 GPT-OSS-20B에 대한 가지치기 실험은 도덕성 경로가 판단이 저장된 곳이 아니라 라우터가 참조하는 자원임을 보여준다:

  • Qwen3-Coder-30B (REAP 가지치기): 레이어당 25개 전문가(도덕성 경로 셀 116개 포함)를 제거해도 악성/정상 코드 분리는 완벽하게 유지되었으나, 패치되지 않은 취약점에 대한 신뢰도는 하락했다(중간값 0.76 → 0.44).
  • GPT-OSS-20B (4-전문가 가지치기): 레이어당 상위 4개 전문가만 유지하면 도덕성 경로 구조는 보존되지만 판단 능력은 파괴되어, 악성 및 정상 코드 모두에 대해 "아니오"로 답변하면서 AUROC가 1.00 → 0.71로 떨어졌다.

결론

이 연구는 MoE 모델이 코드를 평가할 때 도덕성 관련 경로를 동원함을 시사하며, 악성 코드 감지가 모델의 도덕적 메커니즘과 기능적으로 연결되어 있음을 의미한다. 주요 신규성은 개념 전달 없이 답변 변화를 입증한 전체 깊이 라우팅 이식, 가독성 있는 작업 공간과 라우팅의 분리, 그리고 레이어 간 경로 동원의 사전 등록된 측정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.