AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-inference
#llm-inference와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-inference 4페이지 | AI Briefing
BeeLlama.cpp v0.4.1 출시: KV 캐시 양자화 성능 개선
Reddit
·
2026.07.27 01시
Llama.cpp, MCP 지원 추가로 에이전트 기능 강화
Reddit
·
2026.07.26 08시
LoopGain, AI 에이전트 루프 비용 92% 절감
PyTorchKR 읽을거리
·
2026.07.24 12시
Hetzner가 LLM Inference 작업을 진행 중입니다
Hacker News
·
2026.07.24 09시
Cactus, Gemma 4에 자기신뢰도 프로브 추가
Reddit
·
2026.07.23 03시
Claude Opus 4.8, OpenRouter 점유율 45%
Reddit
·
2026.07.23 01시
pi 0.81.0, llama.cpp 지원 추가
Reddit
·
2026.07.22 00시
토큰 가격은 내려가는데 AI 청구서가 오른 이유
TLDR AI
·
2026.07.21 09시
Ollama 멀티 머신 라우팅 도구 Stoke 공개
Reddit
·
2026.07.21 05시
Qwen2.5-Coder 양자화 성능 연구 결과
Reddit
·
2026.07.20 16시
ATSInfer: 소비자용 기기 LLM 추론 최적화
Reddit
·
2026.07.20 01시
Gemma 4 KV 캐시 grafting 기술 공개
Reddit
·
2026.07.19 06시
openPangu-2.0-Flash GGUF 지원
Reddit
·
2026.07.19 03시
유휴 Inference GPU Pool을 이용한 GPU Job 스케줄링
LG AI Research
·
2026.07.16 09시
ExLlamaV3 v1.0.0 정식 출시
Reddit
·
2026.07.15 16시
Qwythos-9B-v2 모델 공개
Reddit
·
2026.07.14 22시
LLM 추론 토큰 2~3배 압축 기술 공개
Reddit
·
2026.07.13 21시
llama.cpp, 에이전트 워크플로우용 체크포인트 버그 수정
Reddit
·
2026.07.13 08시
Mesh LLM: iroh 기반의 분산 AI 컴퓨팅
Hacker News
·
2026.07.12 07시
Show HN: Reame – 실행될수록 빨라지는 CPU 추론 서버
Hacker News
·
2026.07.12 01시
하드웨어 인지형 동적 투기적 디코딩 (Hardware Aware Dynamic Speculative Decoding)
Cohere
·
2026.07.11 01시
Ollama, 6,500만 달러 Series B 투자 유치
Reddit
·
2026.07.10 23시
SWE 에이전트를 위한 예산 인식형 실행을 통한 Best-of-N 성능 향상
AI21 Labs
·
2026.07.08 19시
vLLM, Transformers 백엔드 성능 대폭 개선
HuggingFace Blog
·
2026.07.08 09시
이전
2
3
4
5
6
다음
이전
1
2
3
4
5
6
7
8
9
다음