AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#inference-optimization
#inference-optimization와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#inference-optimization 4페이지 | AI Briefing
llama.cpp WebGPU 추론 성능 개선
Reddit
·
2026.06.09 11시
16GB GPU용 35B MoE 구동 Luce Spark 공개
Reddit
·
2026.06.09 00시
llama.cpp, KV 캐시 복사 방지로 성능 개선
Reddit
·
2026.06.08 21시
Launch HN: General Instinct (YC P26) – 엣지 디바이스를 위한 프론티어 모델
Hacker News
·
2026.06.06 01시
Transformer에 세 개의 프로젝션이 꼭 필요할까? QKV 변형에 대한 체계적 연구
Hacker News
·
2026.06.05 08시
LLM 비용 50% 절감하는 agentcodec 공개
Reddit
·
2026.06.05 01시
KVarN: Huawei가 개발한 vLLM 네이티브 KV-cache 양자화 백엔드
Hacker News
·
2026.06.05 00시
llama.cpp, Qwen MTP 추론 최적화
Reddit
·
2026.06.04 02시
로컬 기기용 1비트 Bonsai Image 4B 이미지 생성
GeekNews
·
2026.06.01 16시
MiMo V2.5 추론 최적화
Xiaomi MiMo
·
2026.05.30 09시
llama.cpp, MTP VRAM 절감 업데이트
Reddit
·
2026.05.30 05시
Qwen3.6-35B MTP 적용, 추론 속도 1.49배 향상
Reddit
·
1
·
2026.05.30 05시
Triton 기반 교차 플랫폼 MoE 디스패치 공개
Reddit
·
2026.05.28 06시
Triton 기반 Fused MoE 커널 공개
Reddit
·
2026.05.27 21시
언어 모델에도 수면이 필요하다
Hacker News
·
2026.05.27 00시
KV 캐시 10배 압축하는 Shard 공개
Reddit
·
2026.05.26 13시
llama.cpp, CUDA용 FWHT로 추론 속도 개선
Reddit
·
2026.05.26 02시
llama.cpp, 멀티 GPU 충돌 수정 예정
Reddit
·
1
·
2026.05.26 01시
RTPurbo: Full Attention의 Sparse 전환
Reddit
·
2026.05.26 00시
MLX용 W8A8 양자화 SDK 'Cider' 공개
Reddit
·
2026.05.25 17시
llama.cpp NVFP4/MTP 지원
Reddit
·
2026.05.24 03시
exo, Qwen3.6용 네이티브 MTP 지원 추가
Reddit
·
2026.05.23 22시
NVIDIA Diffusion LM 공개
HuggingFace Blog
·
1
·
2026.05.23 09시
BeeLlama v0.2.0 출시, 추론 속도 대폭 향상
Reddit
·
2026.05.23 02시
이전
2
3
4
5
6
다음
이전
1
2
3
4
5
6
7
다음