InternLM, Intern-Decision 4B 및 0.8B 모델 공개
internlm/Intern-Decision 4B and 0.8B
·2026.09.26 17:54
핵심 내용
InternLM이 단일 순방향 패스로 답변 분포를 반환하는 멀티모달 의사결정 모델 Intern-Decision 4B와 0.8B를 공개했다.
자세히 보기
InternLM이 Qwen3.5-4B를 파인튜닝한 멀티모달 구조화 의사결정 모델 Intern-Decision 4B와 0.8B를 공개했다. 이 모델들은 공유 상태, 명명된 질문 스키마, 선택적 이미지를 입력으로 받아 단일 순방향 패스(forward pass)에서 모든 질문에 대한 답변 분포를 반환하도록 설계됐다.
추론 메커니즘
이 모델들은 표준 자유 텍스트 생성 대신 특정 구조화된 후보 점수 매기기 API를 사용한다:
- 입력 처리: 질문과 선택지의 순서를 유지하며, 선택지를 단일 토큰 심볼(A–Z, a–z, 0–9)로 매핑한다.
- 프롬프트 렌더링: 원본 시스템 프롬프트, 상태, 의사결정 스키마,
<decision>플레이스홀더가 포함된 완전한 어시스턴트 JSON 스켈레톤을 렌더링한다. - 로짓 추출: 인과적 Hugging Face 순방향 패스 중 각 플레이스홀더 직전 위치에서 로짓을 읽는다.
- 점수 매기기: 각 필드에 대해 허용된 후보 심볼 로짓에만 softmax를 적용한 후, 체크포인트의 확률 보정을 수행한다.
- 출력: 심볼을 원본 선택지 값으로 다시 매핑하여 타입이 지정된 JSON 답변을 반환한다.
이 방식은 프롬프트에 정답(gold answers)이 삽입되지 않도록 보장하며, 추론 컴파일러는 제공된 상태, 질문, 선택적 이미지만에 의존한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.