AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#inference
#inference와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Mica v0.1 4B: 에이전트 루프용 오픈 의사결정 모델
Reddit
·
2026.09.26 07시
추천
Jev 대안 CLM 공개, 에이전트 의사결정 4배 빨라
Reddit
·
2026.09.24 15시
NVIDIA, LLM 추론 벤치마크 도구 AIPerf 공개
PyTorchKR 읽을거리
·
2026.09.22 18시
Qwen3.5 기반 소형 의사결정 모델 'Kev' 공개, TypeSafe API 호환 및 성능 지표 제공
Hacker News
·
2026.09.21 16시
tool-prune 공개, 도구 스키마 선별 속도 0.4ms
Reddit
·
2026.09.19 01시
John Hennessy 등 연구진, 로컬 LLM의 전력당 지능(IPW) 효율성 측정 논문 발표
Hacker News
·
2026.09.14 18시
AI는 언제 작업을 중단해야 하는지 학습할 수 있다
Reddit
·
2
·
2026.09.10 16시
HP, GB300 슈퍼칩 탑재 AI 워크스테이션 'ZGX Fury' 주문 시작
Hacker News
·
2026.09.10 04시
Hugging Face, WebGPU 커널 공개
HuggingFace Blog
·
2026.09.01 09시
Artificial Analysis, 모바일 기기용 소형 LLM 추론 성능 벤치마크 공개
Hacker News
·
2026.08.28 04시
Sopro V2, 경량 TTS 공개
Reddit
·
2026.08.27 23시
ik_llama.cpp 신규 기능 업데이트
Reddit
·
2026.08.27 16시
Applied Compute, 자체 연구용 AI 모델 훈련 플랫폼 AC2 공개
TLDR AI
·
2026.08.26 09시
kimodo.cpp, PyTorch 없는 C++ 이식 공개
PyTorchKR 읽을거리
·
2026.08.25 15시
추천
FreeToken, RTX 5090으로 284B MoE 서빙
PyTorchKR 읽을거리
·
1
·
2026.08.25 12시
와트당 최대 30배의 작업 처리: NVIDIA Vera Rubin NVL72, AI 에이전트 효율성 신기록 달성
NVIDIA Blog
·
2026.08.25 00시
LLM 출력 압축, 비용 3절감
Reddit
·
2026.08.22 01시
텍스트-음성 변환 모델이 50ms 미만으로 응답하도록 만든 방법
Hacker News
·
2026.08.22 00시
Stealth Model
Hacker News
·
1
·
2026.08.21 08시
Qwen3.8-27B 2bit 양자화 공개
Reddit
·
2026.08.21 02시
Syzygy, Mach-1 35B 공개
Reddit
·
2026.08.20 16시
추천
Cerebras, CS-4 공개
PyTorchKR 읽을거리
·
3
·
2026.08.20 15시
DeepSeek-V4-Pro 서빙 한계 돌파
TLDR AI
·
2026.08.20 09시
DFlash 2: 병렬 드래프팅 유지
Hacker News
·
2026.08.20 05시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
다음
#inference | AI Briefing