AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#model-serving
피드
트렌딩
주간
태그
설정
Claude 주요 모델 성능 저하
Reddit
·
2026.08.05 16시
Intern S2 Mobius 공개
Reddit
·
2026.08.05 11시
MiniMax, H3 가중치 공개
PyTorchKR 읽을거리
·
2026.08.04 14시
단일 4GB GPU에서 AirLLM으로 70B 모델 추론
Hacker News
·
2026.08.03 20시
DS와 MLE가 함께 일하는 법
토스
·
2026.08.03 12시
WASTE, NVMe로 초대형 모델 실행
Reddit
·
2026.08.03 09시
llama.cpp 새 Mac 앱 공개
Reddit
·
1
·
2026.08.03 05시
우리가 자체 C 및 C++ 추론 엔진을 작성하는 이유
Hacker News
·
2026.08.01 01시
29GB RAM으로 Kimi K3를 0.50 tok/s로 실행하기
Hacker News
·
2026.07.31 23시
ModelExpress: 모델 아티팩트를 빛의 속도로 배포하기
TLDR AI
·
2026.07.27 09시
Stripe, OpenRouter 인수 협상 착수
GeekNews
·
2026.07.27 05시
NVIDIA, ModelExpress 공개
Reddit
·
2026.07.25 17시
집에서 BitTorrent 방식으로 대형 언어 모델 실행하기
Hacker News
·
2026.07.23 10시
pi 0.81.0, llama.cpp 지원 추가
Reddit
·
2026.07.22 00시
ExLlamaV3 v1.0.0 정식 출시
Reddit
·
2026.07.15 16시
vLLM, Transformers 백엔드 성능 대폭 개선
HuggingFace Blog
·
2026.07.08 09시
gVisor Snapshotting을 통한 GPU Cold Start 시간 단축
Hacker News
·
2026.07.02 01시
Micro-Agent: 모델 API 내부의 협업을 통해 프론티어 모델을 압도하라
Hacker News
·
2026.06.30 03시
DeepLearning.AI, vLLM 공식 강의 출시
Reddit
·
2026.06.05 02시
Standard GPU에서의 실시간 LLM 추론: 요청당 3,000 tokens/s
Hacker News
·
2026.05.29 18시
Forge - 가드레일로 8B 모델의 에이전트 작업 성공률을 53%에서 99%로 끌어올리는 도구
GeekNews
·
2026.05.20 17시
LM Studio, MTP 지원 추가
Reddit
·
2026.05.20 12시
llama.cpp, MTP 개선 반영
Reddit
·
2026.05.19 21시
Claude Code 성능저하 원인
Reddit
·
2026.05.19 00시
이전
1
2
3
다음
이전
1
2
3
다음