DSO: 편향 완화를 위한 Direct Steering Optimization
·2026.04.29 09:00
DSO는 RL로 steering 변환을 최적화해 VLM·LLM 편향을 줄인다.
생성 모델은 사용자의 의사결정을 돕는 과정에서 인구통계적 속성에 영향을 받아 편향된 출력을 낼 수 있다. 예를 들어 시각장애인을 위해 방 안의 의사를 찾는 작업에서 여성 의사를 놓치는 식의 오류가 생길 수 있다.
기존 activation steering은 LLM의 안전성 제어에는 쓰였지만, 집단별 결과를 동등한 확률로 맞춰야 하는 편향 완화에는 충분하지 않았다. 성능 저하 없이 편향을 줄이면서도, 상황에 따라 완화 강도를 조절할 수 있는 방법이 필요했다.
제안된 Direct Steering Optimization(DSO) 는 reinforcement learning으로 활성값에 적용할 선형 변환을 직접 찾는다. 그 결과 VLM과 LLM 모두에서 공정성과 성능의 균형이 더 좋은 결과를 보였고, 추론 시점에 사용자가 원하는 수준으로 편향 완화와 모델 능력 사이의 트레이드오프를 조절할 수 있게 했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.