AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#inference-optimization
피드
트렌딩
주간
태그
설정
Fast Gemma의 검증된 추론 최적화 레시피 (7분 읽기)
TLDR AI
·
2026.08.04 09시
GPT-5.6은 어떻게 최첨단 지능과 효율성을 결합하는가
OpenAI Blog
·
2026.07.29 09시
llama.cpp, DSpark 추측 디코딩 지원
Reddit
·
2026.07.28 20시
소형 LLM의 추론과 실행 분리 기술 연구
Reddit
·
2026.07.28 19시
Neutrino-1 8B
Hacker News
·
2026.07.28 13시
CachyLLama, SSD 기반 KV 캐싱 지원
Reddit
·
2026.07.25 22시
MoE 모델의 라우팅 전문가 28% 제거해도 성능 유지
Reddit
·
2026.07.25 21시
NVIDIA, ModelExpress 공개
Reddit
·
2026.07.25 17시
LLM의 통계적 무손실 양자화 기술 SLQ 공개
Reddit
·
2026.07.25 03시
LLM 추론 효율을 높이는 PoLar 기술 연구
Reddit
·
2026.07.22 05시
SWE-Pruner Pro: 에이전트 내부 표현을 활용한 컨텍스트 프루닝
Reddit
·
2026.07.21 19시
llama.cpp, AMD ROCm 성능 향상 및 버그 수정
Reddit
·
2026.07.21 15시
Length Value Model: 토큰 단위 길이 모델링을 위한 확장 가능한 가치 사전 학습
Apple ML
·
2026.07.20 09시
추천
Netflix의 자체 LLM 서빙 인프라
Netflix Tech
·
1
·
2026.07.18 06시
LG AI Research: ACL 2024를 통해 본 LLM 효율성 향상 연구
LG AI Research
·
2026.07.16 09시
LG AI Research 477
LG AI Research
·
2026.07.16 09시
임베딩 캐싱 프록시 embedcache 공개
Reddit
·
1
·
2026.07.16 02시
llama.cpp, Intel SYCL 지원 및 성능 개선
Reddit
·
2026.07.15 17시
Meta, RecSys 추론 최적화 IKBO 공개
PyTorchKR 읽을거리
·
2026.07.13 22시
Unsloth, Qwen3.6 NVFP4 양자화 출시
Reddit
·
1
·
2026.07.13 19시
llama.cpp, sm-tensor 성능 최적화 패치
Reddit
·
2026.07.12 08시
유연한 비디오 확산 모델 (Flexible Video Diffusion)
TLDR AI
·
2026.07.10 09시
Blackwell 기반 GLM-5.2 최적 배포 가이드
Reddit
·
2026.07.08 04시
NVIDIA, 효율성 극대화한 Nemotron-3 Puzzle 공개
Reddit
·
2026.07.07 20시
이전
1
2
더 많은 페이지
5
다음
이전
1
2
3
4
5
다음