AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-inference
#llm-inference와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-inference 2페이지 | AI Briefing
동일 모델 기반 AI 에이전트 하네스 9종 비교, 작업당 비용 최대 17배 차이
Hacker News
·
2026.09.03 01시
WebLLM, WebGPU 기반 브라우저 내 LLM 추론 엔진 공개
Hacker News
·
2026.09.02 23시
NVIDIA, 모델 경량화 도구 공개
PyTorchKR 읽을거리
·
1
·
2026.09.02 09시
LLM 추론의 효율적 프론티어 (6분 분량)
TLDR AI
·
2
·
2026.09.02 09시
슬라이딩 윈도우가 선형 어텐션을 능가하다
Reddit
·
2026.08.31 23시
vLLM v0.28.0 공개, Kimi-K3 및 DeepSeek V4 최적화 대폭 강화
TLDR AI
·
2026.08.31 09시
vLLM v0.28.0 릴리스: Kimi-K3 및 DeepSeek V4 최적화, 추론 성능 대폭 향상
Hacker News
·
1
·
2026.08.30 03시
vLLM, Qwen3.8 비결정성 버그 수정
Reddit
·
3
·
2026.08.29 19시
Qwen3.8-27B SOTA GGUF 공개
Reddit
·
1
·
2026.08.29 06시
GGUF 파일명-실제 비트 불일치
Reddit
·
2026.08.29 05시
Tontaube, 오픈 TTS 모델 공개
Reddit
·
2026.08.28 18시
Ollama KV 캐시 설정의 함정
Reddit
·
2026.08.28 06시
삼성전자, Hot Chips 2026에서 LPDDR5X-PIM 공개… Llama 3.1 추론 속도 3배 향상
Hacker News
·
1
·
2026.08.27 04시
Ollama VRAM 부족, 기본 설정이 원인
Reddit
·
2026.08.26 17시
Qwen3.8-27B NVFP4 양자화 공개
Reddit
·
2026.08.26 10시
LayerStoRm, 소비자 GPU LLM 서빙
Reddit
·
2026.08.25 12시
Hot Chips 2026: High Bandwidth Flash(HBF) 적용
Hacker News
·
1
·
2026.08.24 23시
llama-cpp-turboquant, ConvRot 양자화 지원
Reddit
·
2026.08.24 10시
Llama.cpp 0.2.0 릴리스
Reddit
·
2
·
2026.08.22 15시
PagedAttention: KV 캐시를 위한 가상 메모리
TLDR AI
·
2026.08.21 09시
LFM2.5, DSpark로 추론 3.2배 가속
HuggingFace Blog
·
2026.08.21 01시
Ollama 0.32.15 메타데이터 캐시
Reddit
·
2026.08.21 00시
AirLLM, 2.8T 모델 4GB VRAM 지원
Reddit
·
2026.08.20 19시
Apple Silicon, ANE+GPU 병렬 Prefill 구현
Reddit
·
2026.08.20 06시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
다음