고정에 건 두 가지 승부수와 다크호스
핵심 내용
Taalas와 Groq가 모델 가중치를 칩에 고정해 AI 추론의 메모리 병목을 공략한다.
자세히 보기
Taalas와 Groq는 AI 추론에서 가장 큰 병목인 가중치 이동을 줄이기 위해 모델을 칩 가까이에 고정하는 서로 다른 접근을 택했다. GPU는 매 토큰과 레이어마다 HBM에서 가중치를 가져오지만, 전용 칩은 가중치를 온칩 메모리에 두어 메모리 대역폭 의존도를 낮춘다.
Taalas는 mask-ROM fabric에 모델 가중치를 제조 단계에서 새겨 넣는다. 읽기 전용 메모리와 연산 기능을 결합해 데이터가 외부 메모리로 나가지 않고 칩 내부의 물리적 계층을 따라 흐르게 하는 방식이다. 대신 모델이 한 번 정해지면 다시 쓸 수 없다는 유연성의 대가를 치른다.
공개된 업체 측 수치에 따르면 Taalas는 Llama 3.1 8B에서 사용자당 초당 1만6,960토큰을 처리하고, 토큰당 0.015J, 100만 토큰당 0.0075달러를 제시했다. 다만 이 수치는 모두 업체가 측정한 값이며 독립적으로 검증되지는 않았다.
Groq는 가중치를 칩에 유지하되 재작성 가능성을 남겨 두는 절충안을 택했다. 두 방식의 차이는 모델의 얼마만큼을 영구적으로 고정할 것인지에 있으며, 이는 속도와 효율뿐 아니라 모델 교체 주기와 하드웨어의 유연성까지 결정한다.
이 흐름은 Bitcoin 채굴이 CPU에서 GPU, FPGA, ASIC으로 이동한 사례와 맞닿아 있다. 특정 워크로드가 충분히 안정되면 범용 하드웨어를 떠나 전용 실리콘으로 옮겨가고, 그 순간 같은 작업을 수행하는 비용과 접근성이 크게 달라진다.
AI 추론용 전용 칩의 확산은 HBM 수요를 일부 분산할 가능성도 있다. 다만 이 칩을 함께 사용하는 GPU에는 여전히 HBM이 필요하므로, 메모리 공급 압력이 얼마나 줄어들지는 아직 정해지지 않았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.