AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-inference
#llm-inference와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-inference 3페이지 | AI Briefing
llama.cpp, 시맨틱 버저닝 v0.1.0 출시
Reddit
·
1
·
2026.08.17 22시
Qwen 3.8, GB300서 288k 토큰/s 달성
Reddit
·
2026.08.17 02시
bitsandbytes 제작자, 신규 양자화 예고
Reddit
·
2026.08.14 22시
Unsloth Desktop - 로컬 AI 모델 실행·학습·에이전트를 하나로 묶은 오픈소스 앱
GeekNews
·
2026.08.13 10시
WARP, 64GB 맥북서 K3 실행
PyTorchKR 읽을거리
·
1
·
2026.08.12 18시
Apple Silicon macOS VM에서 llama.cpp LLM 추론 11~16배 가속
GeekNews
·
2026.08.12 05시
Ling-3.0-tiny 공개
Reddit
·
2026.08.11 02시
Kimi K3 GGUF 공개
Reddit
·
2026.08.07 17시
다음 토큰 예측을 넘어: Diffusion 언어 모델과 Autoregressive 언어 모델의 성능 특성 분석
Apple ML
·
2026.08.07 09시
Arbitrage: 모델 우위를 고려한 speculative decoding 기반 효율적 추론
Apple ML
·
2026.08.07 09시
DiffusionGemma, 1,500토큰/s
PyTorchKR 읽을거리
·
2026.08.06 15시
LLM 추론 최적화의 핵심 기술: 양자화·KV 캐시·추론 칩
KT Cloud
·
2026.08.06 14시
Ling-3.0-Flash 공개
Reddit
·
1
·
2026.08.05 12시
단일 4GB GPU에서 AirLLM으로 70B 모델 추론
Hacker News
·
2026.08.03 20시
WASTE, NVMe로 초대형 모델 실행
Reddit
·
2026.08.03 09시
버스트형 LLM 추론을 위한 예측적 Speculative KV Replication
Hacker News
·
2026.08.01 04시
모두가 LLM router를 만들고 있지만, 우리는 이를 폐기했다
Hacker News
·
1
·
2026.08.01 03시
29GB RAM으로 Kimi K3를 0.50 tok/s로 실행하기
Hacker News
·
2026.07.31 23시
Fermion Research, Neutrino-1 모델군 공개
PyTorchKR 읽을거리
·
2026.07.30 09시
EschaLabs, 2-bit Qwen3.6-35B-A3B 양자화 모델 공개
Reddit
·
2026.07.30 06시
AI Gateway, 통합 Fast Mode 지원 추가
Vercel Blog
·
2026.07.30 03시
Launch HN: Tokenless (YC S26) – 비용 절감을 위한 자동 모델 스위칭
Hacker News
·
2026.07.30 00시
Kimi K3 및 Kimi K3 Fast, ZDR 지원 및 미국 기반 제공업체 AI Gateway 탑재
Vercel Blog
·
2026.07.27 09시
GLM-5.2를 위한 초고속 API 구축 방법 (5분 읽기)
TLDR AI
·
2026.07.27 09시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
다음