AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#inference-optimization
#inference-optimization와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#inference-optimization 2페이지 | AI Briefing
llama.cpp, 동적 MTP 최적화 기능 제안
Reddit
·
1
·
2026.08.18 03시
Hadamard 회전 기반 3비트 양자화 WarpQuant
Reddit
·
2026.08.16 10시
397B AI, 아이폰에서 로컬 구동 성공
Reddit
·
1
·
2026.08.16 06시
LLM 라우팅 라이브러리 LLMRouter 공개
Reddit
·
2026.08.16 01시
Qwen3.8-27B 262K 컨텍스트 메모리 분석
Reddit
·
2026.08.14 23시
antirez, MiniMax H3 영상 생성 모델의 Metal 구현체 'h3.c' 공개
PyTorchKR 읽을거리
·
2026.08.13 18시
Fast Gemma의 검증된 추론 최적화 레시피 (7분 읽기)
TLDR AI
·
2026.08.04 09시
GPT-5.6은 어떻게 최첨단 지능과 효율성을 결합하는가
OpenAI Blog
·
2026.07.29 09시
llama.cpp, DSpark 추측 디코딩 지원
Reddit
·
2026.07.28 20시
소형 LLM의 추론과 실행 분리 기술 연구
Reddit
·
2026.07.28 19시
Neutrino-1 8B
Hacker News
·
2026.07.28 13시
CachyLLama, SSD 기반 KV 캐싱 지원
Reddit
·
2026.07.25 22시
MoE 모델의 라우팅 전문가 28% 제거해도 성능 유지
Reddit
·
2026.07.25 21시
NVIDIA, ModelExpress 공개
Reddit
·
2026.07.25 17시
LLM의 통계적 무손실 양자화 기술 SLQ 공개
Reddit
·
2026.07.25 03시
LLM 추론 효율을 높이는 PoLar 기술 연구
Reddit
·
2026.07.22 05시
SWE-Pruner Pro: 에이전트 내부 표현을 활용한 컨텍스트 프루닝
Reddit
·
2026.07.21 19시
llama.cpp, AMD ROCm 성능 향상 및 버그 수정
Reddit
·
2026.07.21 15시
Length Value Model: 토큰 단위 길이 모델링을 위한 확장 가능한 가치 사전 학습
Apple ML
·
2026.07.20 09시
추천
Netflix의 자체 LLM 서빙 인프라
Netflix Tech
·
1
·
2026.07.18 06시
LG AI Research: ACL 2024를 통해 본 LLM 효율성 향상 연구
LG AI Research
·
2026.07.16 09시
LG AI Research 477
LG AI Research
·
2026.07.16 09시
임베딩 캐싱 프록시 embedcache 공개
Reddit
·
1
·
2026.07.16 02시
llama.cpp, Intel SYCL 지원 및 성능 개선
Reddit
·
2026.07.15 17시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
다음