AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-inference
#llm-inference와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
GPT-OSS 템플릿 버그 수정판 공개
Reddit
·
2026.09.27 05시
vLLM, 더 넓은 GPU 지원 위해 하드웨어 독립적 계층 추가
PyTorchKR 읽을거리
·
1
·
2026.09.25 19시
vLLM, rope_scaling 덮어쓰기로 모델 36% 설정 불일치 발생
PyTorchKR 읽을거리
·
2026.09.25 17시
TextCLF, 캘리브레이션 없는 TQ 양자화 공개
Reddit
·
2026.09.25 07시
추천
Underdog, MLX보다 최대 4.5배 빠른 모델 특화 추론 엔진 'Husky' 공개
GeekNews
·
2026.09.23 09시
Inco AI, Apple Silicon 전용 추론 엔진 Splash 공개
PyTorchKR 읽을거리
·
2026.09.20 11시
LLM 추론 스택 8종 기능 및 용도 비교
Reddit
·
2026.09.19 01시
AI 에이전트용 GPU 프로파일러 GraphSignal 공개
Reddit
·
2026.09.17 21시
인텔, OpenVINO 2026.4 공개
Reddit
·
1
·
2026.09.17 18시
Gemma 멀티모달 추론용 단일 파일 C 엔진 공개
Reddit
·
2026.09.16 19시
Edge0, SSD 스트리밍으로 35B MoE 모델 3GiB 메모리 실행
PyTorchKR 읽을거리
·
2026.09.15 08시
Micron, Hot Chips서 메모리 병목 해결책 제시… Samsung PIM으로 LLM 추론 3배 빨라져
Reddit
·
2026.09.14 11시
LLMTraceFX, 캐시 히트가 연산 생략을 증명하지 못함을 검증하는 독립 오디터 도입
TLDR AI
·
1
·
2026.09.13 15시
추천
NVIDIA, 로컬 AI 추론 라우터 'PAIR' 오픈소스 공개
GeekNews
·
2
·
2026.09.13 09시
추천
RTK 토큰 절감 주장과 실제 비용 벤치마크 간 괴리 확인
GeekNews
·
3
·
2026.09.11 17시
Nvidia, Pi 에이전트 효율화 확장 'SoL-Pi' 공개
Reddit
·
2026.09.11 05시
KV 캐시 연구: LRU 대체 정책의 한계와 Capacity-bound 환경에서의 실패
Hacker News
·
2026.09.10 22시
에이전트 런타임으로서의 KV 캐시 [R]
Reddit
·
2026.09.07 18시
Salesforce, 추론 모델용 KV 캐시 eviction 정책 'Random Attention' 공개
TLDR AI
·
2026.09.07 09시
NInfer 포크 공개: RTX 5090에서 NVFP4 KV 캐시 및 YARN으로 555k 컨텍스트 지원
Reddit
·
2026.09.06 07시
eLLM, CPU 추론 성능 공개
Reddit
·
2026.09.04 21시
Cerebras Model Catalog (Website)
TLDR AI
·
2026.09.04 09시
ik_llama.cpp, Qwen3.8 MTP 지원 병합
Reddit
·
2026.09.04 01시
GLM-OCR 기반 Diffusion 초안 생성 및 AR 검증 기법으로 추론 속도 3.85배 가속
GeekNews
·
1
·
2026.09.03 18시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
다음
#llm-inference | AI Briefing