컨텍스트 길이를 100만 토큰으로 확장!
·2024.11.15 01:00
Qwen2.5-Turbo가 컨텍스트 길이를 100만 토큰으로 확장하고 추론 속도와 비용 효율성을 대폭 개선했다.
Qwen2.5-Turbo는 기존 128k였던 컨텍스트 길이를 100만(1M) 토큰으로 대폭 확장했다. 이는 영문 약 100만 단어, 소설 10권, 또는 3만 줄의 코드에 해당하는 방대한 분량이다.
성능 면에서는 Passkey Retrieval 작업에서 100% 정확도를 기록했으며, 긴 텍스트 평가 벤치마크인 RULER에서 93.1점을 기록해 GPT-4(91.6)를 상회하는 성과를 보였다. 또한 짧은 시퀀스 처리 능력에서도 GPT-4o-mini와 대등한 경쟁력을 유지한다.
주요 개선 사항은 다음과 같다:
- 추론 속도 향상: Sparse attention 메커니즘을 통해 100만 토큰 처리 시 첫 토큰 생성 시간(TTFT)을 4.9분에서 68초로 약 4.3배 단축했다.
- 비용 효율성: 100만 토큰당 **0.3위안(¥0.3)**의 가격을 유지하며, 동일 비용으로 GPT-4o-mini보다 3.6배 더 많은 토큰을 처리할 수 있다.
현재 Alibaba Cloud Model Studio, HuggingFace Demo, ModelScope Demo를 통해 이용 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.