AI Briefing

Reflection AI, 501B 파라미터 오픈 웨이트 MoE 모델 Beam 공개

·2026.10.05 09:00

핵심 내용

Reflection AI가 501B 파라미터 오픈 웨이트 MoE 모델 Beam을 공개했다.

1 / 10

자세히 보기

Reflection AI가 첫 오픈 웨이트 모델 Beam을 공개했다. 501B 총 파라미터와 23B 활성 파라미터를 갖춘 sparse Mixture-of-Experts (MoE) 아키텍처로, 코딩, 추론, 에이전트 워크로드에 최적화됐다. Reflection AI는 Beam이 더 큰 오픈 웨이트 모델과 경쟁력 있는 성능을 보이면서도 추론 효율성이 우수하다고 주장했다.

아키텍처 및 사전 학습

Beam은 웹 및 독점 라이선스 데이터셋에서 23.8조개의 고품질 토큰으로 사전 학습됐다. 교차된 로컬/글로벌 어텐션, 세분화된 라우팅 전문가, 제어된 잔차 스트림을 적용해 안정적인 최적화를 보장한다. Reflection AI는 Beam Base가 유사 크기의 오픈소스 베이스 모델과 동등하거나 더 나은 성능을 보이며, 6,144 NVIDIA GB300 NVL72 GPU 클러스터에서 4주 미만으로 사전 학습을 완료했다고 밝혔다.

강화 학습 및 인프라

이 모델의 성능은 대규모 강화 학습(RL) 투자에 기반하며, 오픈 랩 역사상 최대 규모의 RL 실행 중 하나로 평가된다. 주요 인프라 지표는 다음과 같다:

  • 컴퓨팅: 4주간 10.5K NVIDIA GB300 GPU 활용
  • 데이터: 1억 개 이상의 롤아웃 생성 및 약 13억 개 샌드박스에서 학습
  • 효율성: 완전 비동기 실행 시스템으로 새 가중치가 추론 플릿에 도달하는 중위 시간을 12초로 단축, 크로스 랙 트래픽 75% 감소
  • 안정성: 71회의 추론 인시던트에도 학습 작업을 종료하지 않고, 중위 8분 내에 용량을 복구

성능 및 효율성 주장

Reflection AI는 Beam을 서구권 오픈 웨이트 프론티어 발전의 선두 주자로 포지셔닝하며, 특히 추론 효율성을 강조한다. GLM 5.2와 유사한 고급 추론 점수를 달성하면서도 추론 컴퓨팅은 3~4배 적게 사용한다고 주장한다. Qwen 3.8-Max 같은 2T+ 파라미터 모델 대비 토큰당 더 높은 지능을 제공하며, Kimi K3가 원시 성능에서는 앞서지만 Beam은 추론 시 효율성에서 우위를 점한다.

Reflection AI가 제공한 벤치마크 비교:

  • DeepSWE v1.1: Beam 44.4 (GLM 5.2: 44.0, Kimi K3: 68.0)
  • SWE Bench Pro v2-Hard: Beam 77.2 (GLM 5.3: 84.3, Kimi K3: 88.2)
  • Terminal Bench v2.1: Beam 80.1 (GLM 5.2: 81.0, Kimi K3: 88.3)
  • AIME 2026: Beam 97.8 (GLM 5.2: 99.2)
  • GPQA Diamond: Beam 90.5 (Kimi K3: 93.5, Qwen 3.8 Max: 92.6)

배포 및 안전성

Beam은 현재 대기자 명단을 통해 일부 사용자에게 제공된다. Reflection AI는 이달 중 Apache 2.0 라이선스 하에 모델 가중치, 기술 보고서, 모델 카드, 개발자 아티팩트를 공개할 계획이다. 다양한 오픈소스 라이브러리 및 하네스와의 통합이 포함된다. 안전 정렬은 Multi-Teacher On-Policy Distillation (MOPD) 및 신중한 정렬 기법을 통해 달성됐으며, 안전 평가 결과는 기술 보고서에 공개될 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.