AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#vllm
#vllm와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
vLLM, 더 넓은 GPU 지원 위해 하드웨어 독립적 계층 추가
PyTorchKR 읽을거리
·
1
·
2026.09.25 19시
vLLM, rope_scaling 덮어쓰기로 모델 36% 설정 불일치 발생
PyTorchKR 읽을거리
·
2026.09.25 17시
vLLM, 의사결정 특화 AI 모델 'Decision 1.0' 공개
PyTorchKR 읽을거리
·
2026.09.25 10시
TextCLF, 캘리브레이션 없는 TQ 양자화 공개
Reddit
·
2026.09.25 07시
TextCLF, 캘리브레이션 없는 4비트 양자화 도구 공개
Reddit
·
2026.09.23 03시
LLM 추론 스택 8종 기능 및 용도 비교
Reddit
·
2026.09.19 01시
AI 에이전트용 GPU 프로파일러 GraphSignal 공개
Reddit
·
2026.09.17 21시
Apple, 영상 캡션 품질 평가용 참조 없는 벤치마크 CapQuiz 공개
Apple ML
·
2026.09.11 09시
NVIDIA Dynamo, 비전 인코더 분리 서빙 기술 공개
PyTorchKR 읽을거리
·
2026.09.11 07시
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화하기 [2부: GPU 한 장의 처리량과 지연 SLO]
AWS Tech Blog (한국)
·
2026.09.10 09시
Amazon EKS에서 vLLM으로 Gemma 4 서빙 최적화: 콜드 스타트 428초→226초
AWS Tech Blog (한국)
·
2026.09.10 09시
TRL v1.14, NCCL 없는 LoRA Async GRPO 지원
HuggingFace Blog
·
2026.09.10 09시
Cohere, North Mini Code용 Megakernel 엔진 공개… vLLM 대비 최대 1.41배 속도 향상
Cohere
·
2026.09.09 00시
vLLM, AMD GPU 환경에서 5가지 Speculative Decoding 방식 성능 벤치마크 공개
Hacker News
·
2026.09.07 18시
Salesforce, 추론 모델용 KV 캐시 eviction 정책 'Random Attention' 공개
TLDR AI
·
2026.09.07 09시
NVIDIA, IFA 2026서 로컬 AI 가속화 및 RTX Spark PC 공개
NVIDIA Blog
·
2026.09.04 01시
NVIDIA, 모델 경량화 도구 공개
PyTorchKR 읽을거리
·
1
·
2026.09.02 09시
vLLM v0.28.0 공개, Kimi-K3 및 DeepSeek V4 최적화 대폭 강화
TLDR AI
·
2026.08.31 09시
Qwen3-Coder 4bit TQ 공개
Reddit
·
2026.08.31 05시
vLLM v0.28.0 릴리스: Kimi-K3 및 DeepSeek V4 최적화, 추론 성능 대폭 향상
Hacker News
·
1
·
2026.08.30 03시
vLLM, Qwen3.8 비결정성 버그 수정
Reddit
·
3
·
2026.08.29 19시
Tontaube, 오픈 TTS 모델 공개
Reddit
·
2026.08.28 18시
LLM, 추론 엔진 취약점 악용해 호스트 머신 제어 가능
TLDR AI
·
2026.08.25 09시
LLM이 추론 엔진의 취약점을 악용해 호스트 머신을 제어할 수 있다
Hacker News
·
2026.08.25 04시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
다음
#vllm | AI Briefing