AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#speculative-decoding
#speculative-decoding와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Liquid AI, LFM2.5-VL 추론 가속하는 LFM2.5-VL-DSpark 공개
HuggingFace Blog
·
2026.09.24 23시
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]
AWS Tech Blog (한국)
·
2026.09.10 09시
vLLM, AMD GPU 환경에서 5가지 Speculative Decoding 방식 성능 벤치마크 공개
Hacker News
·
2026.09.07 18시
GLM-OCR 기반 Diffusion 초안 생성 및 AR 검증 기법으로 추론 속도 3.85배 가속
GeekNews
·
1
·
2026.09.03 18시
LLM 추론의 효율적 프론티어 (6분 분량)
TLDR AI
·
2
·
2026.09.02 09시
vLLM v0.28.0 공개, Kimi-K3 및 DeepSeek V4 최적화 대폭 강화
TLDR AI
·
2026.08.31 09시
LFM2.5, DSpark로 추론 3.2배 가속
HuggingFace Blog
·
2026.08.21 01시
DFlash 2: 병렬 드래프팅 유지
Hacker News
·
2026.08.20 05시
Arbitrage: 모델 우위를 고려한 speculative decoding 기반 효율적 추론
Apple ML
·
2026.08.07 09시
DiffusionGemma, 1,500토큰/s
PyTorchKR 읽을거리
·
2026.08.06 15시
FuriosaAI, ICML 2026서 풀스택 소프트웨어 효율화
FuriosaAI
·
2026.08.06 09시
Fast Gemma의 검증된 추론 최적화 레시피 (7분 읽기)
TLDR AI
·
2026.08.04 09시
풍부한 지능 구축
OpenAI Blog
·
1
·
2026.08.01 00시
llama.cpp, MTP 텐서 기본 로드 변경
Reddit
·
2026.07.30 03시
llama.cpp, DSpark 추측 디코딩 지원
Reddit
·
2026.07.28 20시
GLM-5.2를 위한 초고속 API 구축 방법 (5분 읽기)
TLDR AI
·
2026.07.27 09시
LG AI Research: ACL 2024를 통해 본 LLM 효율성 향상 연구
LG AI Research
·
2026.07.16 09시
llama.cpp, Tencent Hy3 모델 지원
Reddit
·
2026.07.14 11시
Show HN: Reame – 실행될수록 빨라지는 CPU 추론 서버
Hacker News
·
2026.07.12 01시
하드웨어 인지형 동적 투기적 디코딩 (Hardware Aware Dynamic Speculative Decoding)
Cohere
·
2026.07.11 01시
BlockPilot: 추론 속도를 높이는 적응형 블록 크기 예측
Reddit
·
2026.07.03 23시
DeepSeek, LLM 추론 속도를 최대 85%까지 높이는 새로운 프레임워크 'DSpark' 오픈 소스 공개
TLDR AI
·
2026.06.30 09시
DeepSeek, 추측적 디코딩용 DeepSpec 공개
Reddit
·
2026.06.28 23시
DSpark: 준자기회귀 생성과 신뢰도 스케줄링 결합한 추측 디코딩 프레임워크 공개
GeekNews
·
2026.06.28 09시
이전
1
2
3
다음
이전
1
2
3
다음
#speculative-decoding | AI Briefing