AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-inference
피드
트렌딩
주간
태그
설정
Ling-3.0-Flash 공개
Reddit
·
2026.08.05 12시
단일 4GB GPU에서 AirLLM으로 70B 모델 추론
Hacker News
·
2026.08.03 20시
WASTE, NVMe로 초대형 모델 실행
Reddit
·
2026.08.03 09시
버스트형 LLM 추론을 위한 예측적 Speculative KV Replication
Hacker News
·
2026.08.01 04시
모두가 LLM router를 만들고 있지만, 우리는 이를 폐기했다
Hacker News
·
1
·
2026.08.01 03시
29GB RAM으로 Kimi K3를 0.50 tok/s로 실행하기
Hacker News
·
2026.07.31 23시
Fermion Research, Neutrino-1 모델군 공개
PyTorchKR 읽을거리
·
2026.07.30 09시
EschaLabs, 2-bit Qwen3.6-35B-A3B 양자화 모델 공개
Reddit
·
2026.07.30 06시
AI Gateway, 통합 Fast Mode 지원 추가
Vercel Blog
·
2026.07.30 03시
Launch HN: Tokenless (YC S26) – 비용 절감을 위한 자동 모델 스위칭
Hacker News
·
2026.07.30 00시
Kimi K3 및 Kimi K3 Fast, ZDR 지원 및 미국 기반 제공업체 AI Gateway 탑재
Vercel Blog
·
2026.07.27 09시
GLM-5.2를 위한 초고속 API 구축 방법 (5분 읽기)
TLDR AI
·
2026.07.27 09시
BeeLlama.cpp v0.4.1 출시: KV 캐시 양자화 성능 개선
Reddit
·
2026.07.27 01시
Llama.cpp, MCP 지원 추가로 에이전트 기능 강화
Reddit
·
2026.07.26 08시
Hetzner가 LLM Inference 작업을 진행 중입니다
Hacker News
·
2026.07.24 18시
LoopGain, AI 에이전트 루프 비용 92% 절감
PyTorchKR 읽을거리
·
2026.07.24 12시
Cactus, Gemma 4에 자기신뢰도 프로브 추가
Reddit
·
2026.07.23 03시
Claude Opus 4.8, OpenRouter 점유율 45%
Reddit
·
2026.07.23 01시
pi 0.81.0, llama.cpp 지원 추가
Reddit
·
2026.07.22 00시
토큰 가격은 내려가는데 AI 청구서가 오른 이유
TLDR AI
·
2026.07.21 09시
Ollama 멀티 머신 라우팅 도구 Stoke 공개
Reddit
·
2026.07.21 05시
Qwen2.5-Coder 양자화 성능 연구 결과
Reddit
·
2026.07.20 16시
ATSInfer: 소비자용 기기 LLM 추론 최적화
Reddit
·
2026.07.20 01시
Gemma 4 KV 캐시 grafting 기술 공개
Reddit
·
2026.07.19 06시
이전
1
2
더 많은 페이지
6
다음
이전
1
2
3
4
5
6
다음