Reflection AI, 501B MoE 모델 Beam 공개
Reflection AI, 활성 23B로 추론 연산을 줄인 501B 오픈 웨이트 모델 Beam 발표 (가중치는 이번 달 내 공개 예정)
·2026.10.07 11:30
핵심 내용
10월 중 Apache 2.0 가중치 공개 예정이며, 추론 연산 효율을 강조하는 희소 MoE 구조다.
1 / 8
자세히 보기
Reflection AI가 전체 파라미터 501B, 토큰당 활성 파라미터 23B인 희소 MoE(Sparse Mixture-of-Experts) 모델 Beam을 발표했다. 코딩, 추론, 에이전트 작업에 특화된 텍스트 전용 모델로, 2026년 10월 중 Apache 2.0 라이선스로 가중치와 기술 보고서가 공개될 예정이다.
추론 효율 및 벤치마크
Beam은 GLM-5.2와 유사한 성능을 3~4배 적은 추론 연산으로 달성했다고 주장한다. 발표된 벤치마크에 따르면 서구권 오픈 모델인 Inkling 및 Nemotron 3 Ultra 대비 대부분 지표에서 우위를 점했다.
- SWE Bench Pro v1: Beam 65.5 vs Inkling 54.3
- Terminal Bench v2.1: Beam 80.1 vs Inkling 63.8
- HLE: Beam 36.2 vs Inkling 29.7
다만, 유사 크기의 DeepSeek V4.1 Flash(활성 16B)와 비교해서는 9개 지표 중 7개에서 열세를 보였으며, 절대 성능보다는 연산 효율에 초점을 맞춘 모델임을 시사한다.
학습 규모 및 인프라
사전학습에는 23.8T 토큰이 사용되었으며, NVIDIA GB300 NVL72 GPU 6,144개를 활용해 4주 미만으로 완료했다. 강화학습(RL) 단계에서는 NVIDIA GB300 GPU 10.5K개를 동원해 1억 회 이상의 롤아웃을 생성했다.
- 컨텍스트 확장: 미드트레이닝을 통해 유효 컨텍스트를 1M 토큰으로 확장했다.
- 비동기 학습: Asynchronous Policy Gradient를 적용해 정책 지연(Policy Staleness) 문제를 해결했으며, 평균 11만 개의 롤아웃을 동시 실행했다.
- 환경 큐레이션: 100만 개의 고품질 RL 환경을 확보하고, 보상 해킹을 방지하기 위한 별도 판정 모델을 운영했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.