AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-serving
#llm-serving와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-serving 2페이지 | AI Briefing
Ollama, llama.cpp 직접 지원
Reddit
·
1
·
2026.05.14 23시
Ollama, 모델 카드 정보 업데이트
Reddit
·
2026.05.13 19시
Ollama 보안 취약점: 메모리 누수 및 RCE 위험
Reddit
·
2026.05.11 14시
초고속 추론 엔진 Atlas 오픈 소스 공개
Reddit
·
2026.05.07 05시
vLLM 대비 메모리 8배 절감, FastDMS 공개
Reddit
·
2026.05.05 06시
LLM 서빙에서 CPU와 GPU를 분리해야 하는 이유
TLDR AI
·
2026.05.01 09시
KV 캐시 지역성: LLM 서빙 비용의 숨은 변수
TLDR AI
·
2026.05.01 09시
Qwen 3.6 비교
Reddit
·
2026.04.23 15시
INT3·INT2 KV 캐시 공개
Reddit
·
2026.04.22 15시
Prefill-as-a-Service: 차세대 모델의 KVCache를 데이터센터 간으로 옮기다
TLDR AI
·
2026.04.20 09시
MTP 켜자 24%↑
Reddit
·
2026.04.18 21시
2026 vLLM 코리아 밋업
Rebellions
·
2026.04.14 11시
대규모 AI 추론을 위한 16Gbps UCIe-Advanced 칩 간 인터페이스와 풀칩 확장형 Mesh를 갖춘 4칩렛 AI SoC
Rebellions
·
2026.01.02 12시
OVHcloud, Hugging Face 추론 파트너 합류
HuggingFace Blog
·
2025.11.25 01시
Hugging Face, Public AI 추론 프로바이더 지원
HuggingFace Blog
·
2025.09.17 09시
SGLang, Transformers 백엔드 통합
HuggingFace Blog
·
2025.06.23 09시
vLLM, 긴 프롬프트 병목 현상 개선
HuggingFace Blog
·
2025.06.12 17시
HF, Featherless AI 추론 지원
HuggingFace Blog
·
2025.06.12 09시
LLM 성능 최적화를 위한 요청 큐잉 전략
HuggingFace Blog
·
2025.04.02 22시
Fireworks.ai, HF 추론 제공자로 추가
HuggingFace Blog
·
2025.02.14 09시
HF-FriendliAI 모델 배포 통합
HuggingFace Blog
·
2025.01.22 09시
TGI, Multi-LoRA 서빙 기능 공개
HuggingFace Blog
·
2024.07.18 09시
Hugging Face, OpenAI 호환 Messages API 출시
HuggingFace Blog
·
2024.02.08 09시
TGI, AWS Inferentia2 지원
HuggingFace Blog
·
2024.02.01 09시
이전
1
2
3
다음
이전
1
2
3
다음