AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-serving
#llm-serving와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Kaggle 무료 TPU로 320B GLM-5.3-Flash 서빙 레시피 공개
PyTorchKR 읽을거리
·
2026.09.18 07시
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화: 콜드 스타트 428초→226초
AWS Tech Blog (한국)
·
2026.09.10 09시
Cohere, North Mini Code용 Megakernel 엔진 공개… vLLM 대비 최대 1.41배 속도 향상
Cohere
·
2026.09.09 00시
vLLM, AMD GPU 환경에서 5가지 Speculative Decoding 방식 성능 벤치마크 공개
Hacker News
·
2026.09.07 18시
Paddock 추론 엔진 오픈소스 공개
Reddit
·
1
·
2026.09.04 18시
Cerebras, Qwen 3.8 27B 모델 초당 1,500토큰 속도로 제공
GeekNews
·
2026.09.04 06시
추천
FreeToken, RTX 5090으로 284B MoE 서빙
PyTorchKR 읽을거리
·
1
·
2026.08.25 12시
FreeToken, 로컬 PC에서 290B MoE 고속 실행
Reddit
·
1
·
2026.08.22 12시
LLM 서빙, 띄우는 것과 잘 띄우는 것 사이
토스
·
1
·
2026.08.21 10시
DeepSeek-V4-Pro 서빙 한계 돌파
TLDR AI
·
2026.08.20 09시
llama.cpp, 동적 MTP 최적화 기능 제안
Reddit
·
1
·
2026.08.18 03시
PyTorch Foundation, 6개 주요 프로젝트 업데이트 발표
PyTorchKR 읽을거리
·
2026.07.24 19시
추천
Netflix의 자체 LLM 서빙 인프라
Netflix Tech
·
1
·
2026.07.18 06시
llama.cpp, sm-tensor 성능 최적화 패치
Reddit
·
2026.07.12 08시
MoE 서빙 지연시간을 줄이는 ELDR 라우팅 기술
Reddit
·
2026.07.03 23시
에이전트 기반의 SGLang 개발 방식
TLDR AI
·
2026.07.03 09시
Hugging Face Jobs로 vLLM 서버 즉시 구축
HuggingFace Blog
·
1
·
2026.06.26 05시
분산형 AI 추론 속도 15배 향상
Reddit
·
1
·
2026.06.20 19시
Xiaomi, MiMo V2.5Pro 공개
Reddit
·
2026.06.14 21시
Kubernetes 기반 LLM 서빙 최적화 기술
네이버 D2
·
1
·
2026.06.11 11시
Apple, MLX LM Server 공개
Reddit
·
2026.06.09 09시
16GB GPU용 35B MoE 구동 Luce Spark 공개
Reddit
·
2026.06.09 00시
1.58비트 BitCPM4-CANN 공개
Reddit
·
2026.05.18 20시
TurboQuant 정확도·성능 평가
Reddit
·
2026.05.15 05시
이전
1
2
3
다음
이전
1
2
3
다음
#llm-serving | AI Briefing