webAI, 형식 논리 모델 TwIL LM3 Pro 출시
3.66B formal logic model built on Granite 4.2 3B · Hugging Face
핵심 내용
webAI가 3.66B 파라미터 형식 논리 모델 TwIL LM3 Pro를 공개했다.
자세히 보기
webAI가 9월 30일 IBM Granite 4.2 3B를 기반으로 한 3.66B 파라미터 모델 TwIL LM3 Pro를 공개했다. 이 모델은 논리 결론 검증, 규칙 유도, 함의 관계, Lean 증명 비판 등 형식 논리 작업에 특화되어 있다.
성능 및 벤치마크
모델은 LoRA SFT, 체크포인트 병합, 프로그래밍 검증기를 활용한 강화 학습으로 후처리됐다. 논리 복합 벤치마크에서 55.4점을 기록해 Granite 기반 모델(43.1)과 기존 TwIL-LM3(42.2)를 크게 앞섰다. 또한 VibeThinker-3B(41.2)를 능가하고 Qwen3-8B(53.4)와 유사한 성능을 보였으며, 모델 카드는 미세한 차이를 샘플링 노이즈로 분석했다.
주요 강점은 다음과 같다:
- 엄격한 객관식 논리: 41% (차점 모델 17% 대비)
- BBH 논리: 95.4%
다만 규칙 유도, 함의 관계, Lean 형식화에서는 gpt oss 120b보다 뒤처진다. 일반 벤치마크 평균은 79.0으로 VibeThinker-3B(81.0)와 Qwen3-8B(84.9)보다 낮다.
배포 및 제한 사항
TwIL LM3 Pro는 답변당 평균 1,900개 토큰의 긴 추론 체인을 생성하며, llama.cpp에서 응답의 25%가 길이 제한에 도달한다. 잘림을 방지하려면 온도를 0으로 설정하고 최소 2048개 토큰을 할당해야 한다.
다양한 양자화 버전이 제공된다:
- Q4_K_M GGUF: 2.09 GiB, CPU 또는 4 GB VRAM에서 실행 가능
- Q5, Q6, Q8 빌드: 최대 3.63 GiB
Ollama, LM Studio, llama.cpp를 지원한다. 공개된 점수는 BF16 가중치 기준이며, webAI는 아직 Q4 성능을 벤치마크하지 않았다. 라이선스는 비상업적(non-commercial) 용도로 제한된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.