TII, Falcon 2 11B 모델 및 VLM 공개
Falcon 2: An 11B parameter pretrained language model and VLM, trained on over 5000B tokens and 11 languages
TII가 5조 개 이상의 토큰으로 학습된 11B 규모의 Falcon 2 LLM과 VLM을 공개했다.
TII(Technology Innovation Institute)가 오픈 소스 커뮤니티를 위한 차세대 모델 시리즈인 Falcon 2를 출시했다. 이번 모델은 더 저렴한 추론 비용과 멀티모달 지원을 통해 활용도를 높이는 데 중점을 두었다.
Falcon 2 11B LLM은 고품질 필터링 데이터셋인 RefinedWeb을 포함하여 총 5,000B(5조) 개 이상의 토큰으로 학습되었다. 4단계의 학습 전략을 통해 컨텍스트 길이를 최대 8,192 토큰까지 확장했으며, 영어와 더불어 스페인어, 프랑스어, 독일어 등 10개 언어를 지원한다.
또한, 이미지 이해 능력을 통합한 **11B VLM(Vision-Language Model)**도 함께 공개되었다. 이를 통해 사용자는 텍스트를 사용하여 시각적 콘텐츠에 대해 대화할 수 있다.
모델은 60개의 Transformer 블록으로 구성된 아키텍처를 가지며, 1,024개의 A100 40GB GPU를 사용하여 3D 병렬화 전략(TP=8, PP=1, DP=128)으로 학습되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.