AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-serving
피드
트렌딩
주간
태그
설정
PyTorch Foundation, 6개 주요 프로젝트 업데이트 발표
PyTorchKR 읽을거리
·
2026.07.24 19시
추천
Netflix의 자체 LLM 서빙 인프라
Netflix Tech
·
1
·
2026.07.18 06시
llama.cpp, sm-tensor 성능 최적화 패치
Reddit
·
2026.07.12 08시
MoE 서빙 지연시간을 줄이는 ELDR 라우팅 기술
Reddit
·
2026.07.03 23시
에이전트 기반의 SGLang 개발 방식
TLDR AI
·
2026.07.03 09시
Hugging Face Jobs로 vLLM 서버 즉시 구축
HuggingFace Blog
·
1
·
2026.06.26 05시
분산형 AI 추론 속도 15배 향상
Reddit
·
1
·
2026.06.20 19시
Xiaomi, MiMo V2.5Pro 공개
Reddit
·
2026.06.14 21시
Kubernetes 기반 LLM 서빙 최적화 기술
네이버 D2
·
1
·
2026.06.11 11시
Apple, MLX LM Server 공개
Reddit
·
2026.06.09 09시
16GB GPU용 35B MoE 구동 Luce Spark 공개
Reddit
·
2026.06.09 00시
1.58비트 BitCPM4-CANN 공개
Reddit
·
2026.05.18 20시
TurboQuant 정확도·성능 평가
Reddit
·
2026.05.15 05시
Ollama, llama.cpp 직접 지원
Reddit
·
1
·
2026.05.14 23시
Ollama, 모델 카드 정보 업데이트
Reddit
·
2026.05.13 19시
Ollama 보안 취약점: 메모리 누수 및 RCE 위험
Reddit
·
2026.05.11 14시
초고속 추론 엔진 Atlas 오픈 소스 공개
Reddit
·
2026.05.07 05시
vLLM 대비 메모리 8배 절감, FastDMS 공개
Reddit
·
2026.05.05 06시
LLM 서빙에서 CPU와 GPU를 분리해야 하는 이유
TLDR AI
·
2026.05.01 09시
KV 캐시 지역성: LLM 서빙 비용의 숨은 변수
TLDR AI
·
2026.05.01 09시
Qwen 3.6 비교
Reddit
·
2026.04.23 15시
OVHcloud, Hugging Face 추론 파트너 합류
HuggingFace Blog
·
2025.11.25 01시
Hugging Face, Public AI 추론 프로바이더 지원
HuggingFace Blog
·
2025.09.17 09시
SGLang, Transformers 백엔드 통합
HuggingFace Blog
·
2025.06.23 09시
이전
1
2
다음
이전
1
2
다음