AI Briefing

webAI, 형식 논리 모델 TwIL LM3 Pro 출시

3.66B formal logic model built on Granite 4.2 3B · Hugging Face

·2026.10.10 13:28

핵심 내용

webAI가 3.66B 파라미터 형식 논리 모델 TwIL LM3 Pro를 공개했다.

자세히 보기

webAI가 9월 30일 IBM Granite 4.2 3B를 기반으로 한 3.66B 파라미터 모델 TwIL LM3 Pro를 공개했다. 이 모델은 논리 결론 검증, 규칙 유도, 함의 관계, Lean 증명 비판 등 형식 논리 작업에 특화되어 있다.

성능 및 벤치마크

모델은 LoRA SFT, 체크포인트 병합, 프로그래밍 검증기를 활용한 강화 학습으로 후처리됐다. 논리 복합 벤치마크에서 55.4점을 기록해 Granite 기반 모델(43.1)과 기존 TwIL-LM3(42.2)를 크게 앞섰다. 또한 VibeThinker-3B(41.2)를 능가하고 Qwen3-8B(53.4)와 유사한 성능을 보였으며, 모델 카드는 미세한 차이를 샘플링 노이즈로 분석했다.

주요 강점은 다음과 같다:

  • 엄격한 객관식 논리: 41% (차점 모델 17% 대비)
  • BBH 논리: 95.4%

다만 규칙 유도, 함의 관계, Lean 형식화에서는 gpt oss 120b보다 뒤처진다. 일반 벤치마크 평균은 79.0으로 VibeThinker-3B(81.0)와 Qwen3-8B(84.9)보다 낮다.

배포 및 제한 사항

TwIL LM3 Pro는 답변당 평균 1,900개 토큰의 긴 추론 체인을 생성하며, llama.cpp에서 응답의 25%가 길이 제한에 도달한다. 잘림을 방지하려면 온도를 0으로 설정하고 최소 2048개 토큰을 할당해야 한다.

다양한 양자화 버전이 제공된다:

  • Q4_K_M GGUF: 2.09 GiB, CPU 또는 4 GB VRAM에서 실행 가능
  • Q5, Q6, Q8 빌드: 최대 3.63 GiB

Ollama, LM Studio, llama.cpp를 지원한다. 공개된 점수는 BF16 가중치 기준이며, webAI는 아직 Q4 성능을 벤치마크하지 않았다. 라이선스는 비상업적(non-commercial) 용도로 제한된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.