AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#vllm
피드
트렌딩
주간
태그
설정
Fast Gemma의 검증된 추론 최적화 레시피 (7분 읽기)
TLDR AI
·
2026.08.04 09시
우리가 자체 C 및 C++ 추론 엔진을 작성하는 이유
Hacker News
·
2026.08.01 01시
Molt: 에이전트 기반 강화학습 프레임워크 (GitHub Repo)
TLDR AI
·
2026.07.28 09시
Ling-3.0-flash 추론 엔진 지원 현황
Reddit
·
2026.07.28 01시
넷플릭스의 사내 LLM 서빙 플랫폼
Netflix Tech
·
2026.07.27 10시
PyTorch Foundation, 6개 주요 프로젝트 업데이트 발표
PyTorchKR 읽을거리
·
2026.07.24 19시
추천
Netflix의 자체 LLM 서빙 인프라
Netflix Tech
·
1
·
2026.07.18 06시
Netflix의 자체 LLM 서빙 시스템 구축
Netflix Tech
·
2026.07.18 06시
유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링
LG AI Research
·
2026.07.16 09시
유휴 추론 GPU 풀을 활용한 GPU 작업 스케줄링
LG AI Research
·
2026.07.16 09시
vLLM, Transformers 백엔드 성능 대폭 개선
HuggingFace Blog
·
2026.07.08 09시
실시간 대화용 Gepard 1.0 오픈소스 공개
Reddit
·
2026.07.08 01시
MoE 서빙 지연시간을 줄이는 ELDR 라우팅 기술
Reddit
·
2026.07.03 23시
Micro-Agent: 모델 API 내부의 협업을 통해 프론티어 모델을 압도하라
Hacker News
·
2026.06.30 03시
Hugging Face Jobs로 vLLM 서버 즉시 구축
HuggingFace Blog
·
1
·
2026.06.26 05시
AI 에이전트를 활용한 포크(Fork) 유지보수 자동화
Cohere
·
2026.06.26 02시
vLLM 진단 도구 vllm-doctor
Reddit
·
1
·
2026.06.08 18시
DeepLearning.AI, vLLM 공식 강의 출시
Reddit
·
2026.06.05 02시
KVarN: Huawei가 개발한 vLLM 네이티브 KV-cache 양자화 백엔드
Hacker News
·
2026.06.05 00시
AMD MI300X에서 DeepSeek-V4-Flash 구동하기
Hacker News
·
2026.06.03 02시
추천
NVIDIA, Qwen3.6 NVFP4 공개
Reddit
·
2026.05.31 02시
vLLM, AMD용 HIP W4A16 커널 지원
Reddit
·
2026.05.29 21시
Hub Bucket을 활용한 1조 파라미터 전송: TRL의 Delta Weight Sync
TLDR AI
·
2026.05.27 23시
유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링
GeekNews
·
1
·
2026.05.27 08시
이전
1
2
3
다음
이전
1
2
3
다음