Multi-Stream LLMs: Thoughts, Inputs, Outputs의 병렬 스트림으로 언어 모델의 병목을 해소하다
·2026.05.22 04:37
LLM의 단일 스트림 병목을 thoughts·inputs·outputs 분리로 푼다.
Multi-Stream LLMs는 기존 chat형 LLM이 가진 단일 메시지 스트림 구조를 문제로 본다.
현재의 에이전트는 사용자, 시스템, 자기 자신의 생각(chain-of-thought), 도구 출력을 모두 하나의 순차적 대화 흐름으로 처리한다. 그 결과
- 읽는 동안에는 행동할 수 없고
- 쓰는 동안에는 새로운 정보를 반영하기 어렵고
- 생각하는 동안에도 동시에 읽기나 행동이 제한된다.
이 논문은 이를 해결하기 위해 instruction-tuning 자체를 multiple parallel streams로 바꾸자고 제안한다. 각 역할을 별도 스트림으로 분리하고, 매 forward pass에서 여러 입력 스트림을 동시에 읽으면서 여러 출력 스트림에 토큰을 생성하는 방식이다. 각 스트림은 이전 timestep에 causal하게 의존한다.
저자들은 이 설계가 다음을 개선할 수 있다고 주장한다.
- 사용성: 읽기, 생각, 출력의 충돌 완화
- 효율성: 병렬화로 인한 처리 개선
- 보안: 역할 분리로 인한 책임 경계 강화
- monitorability: 에이전트 동작 관찰 가능성 향상
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.