AI Briefing

로컬 멀티모달 주간

Last Week in Multimodal AI - Local Edition

·2026.04.23 13:40

핵심 내용

Kimi K2.6, Qwen3.6 등 로컬·오픈소스 멀티모달 모델 신작 정리.

자세히 보기

지난주 로컬·오픈소스 멀티모달 AI 하이라이트를 묶었다.

Moonshot Kimi K2.6는 1T/32B MoE, 256K context, native INT4, 400M MoonViT vision encoder를 내세웠다. 네 가지 변형 중 Agent Swarm은 300 sub-agents와 4,000 coordinated steps를 지원하며, HLE-Full with tools 54.0으로 GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro를 앞섰다고 적었다.

Alibaba Qwen3.6-35B-A3B는 3B active / 35B sparse MoE의 네이티브 멀티모달 모델이다. 262K context를 기본으로 하고 YaRN으로 1.01M까지 확장되며, Apache 2.0으로 공개됐다. 성능 수치는 SWE-Bench Verified 73.4, Terminal-Bench 2.0 51.5, AIME 2026 92.7, VideoMMMU 83.7을 제시했다. 새로 들어간 Thinking Preservation은 대화 간 추론 흔적을 유지한다.

Tencent HY-World 2.0은 편집 가능한 mesh, 3DGS, point cloud를 Unity, Unreal, Blender, Isaac Sim으로 바로 넘길 수 있는 오픈소스 3D world model로 소개됐다. 먼저 나온 WorldMirror 2.0 컴포넌트는 약 1.2B params, BF16, 12-24 GB VRAM 범위로 동작한다.

Motif-Video 2B는 2B DiT 기반 오픈소스 비디오 모델로, 720p / 121 frames를 한 체크포인트로 T2V와 I2V 둘 다 처리한다. **VBench Total 83.76%**로 오픈소스 최고 성적을 주장하며, Wan2.1-14B보다 7배 적은 파라미터로 앞섰다고 적었다. 다만 blind test에서는 Wan2.1-14B가 시간적 안정성과 인체 디테일에서 더 좋다는 caveat가 붙었다.

AniGen은 SIGGRAPH 2026 발표로, 단일 이미지에서 fully rigged 3D를 만들고 shape, skeleton, skinning을 S³ Fields로 함께 생성해 리깅 정합성을 높인다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.