AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-inference
#llm-inference와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-inference 7페이지 | AI Briefing
llama.cpp b9180 MTP 지원
Reddit
·
2026.05.17 02시
llama.cpp, MTP 지원 추가
Reddit
·
2026.05.16 21시
GGUF에는 가중치 외에 무엇이 들어 있고, 아직 무엇이 빠져 있나?
GeekNews
·
2026.05.16 16시
Orthrus-Qwen3: Qwen3에서 최대 7.8배 tokens/forward, 동일한 출력 분포
Hacker News
·
2026.05.16 07시
Orthrus-Qwen3-8B 7.8배 가속
Reddit
·
2026.05.16 04시
Orthrus: Diffusion 기반 병렬 토큰 생성 기술 공개
Reddit
·
2026.05.16 02시
llama.cpp, RDNA3 Flash Attention 수정 업데이트 출시
Reddit
·
2026.05.15 09시
GGUF에는 가중치 외에 무엇이 들어있으며, 무엇이 아직 부족한가?
Hacker News
·
2026.05.15 02시
continuous batching의 비동기화
TLDR AI
·
2026.05.15 00시
Sipeed K3, 30B LLM 구동
Reddit
·
2026.05.14 00시
Attention Drift 발견
Reddit
·
2026.05.13 04시
AMD Strix Halo용 Luce DFlash 지원
Reddit
·
2026.05.13 03시
Rapid-MLX - Apple Silicon 전용 초고속 로컬 AI 엔진
GeekNews
·
2026.05.12 09시
ExLlamaV3 대규모 업데이트
Reddit
·
2026.05.11 16시
240W로 700B LLM 구동하는 AI 가속기 등장
Reddit
·
2026.05.11 07시
AI 자립을 향한 여정(23분 읽기)
TLDR AI
·
2026.05.10 17시
NVIDIA, Star Elastic 공개
Reddit
·
2026.05.10 09시
Lemonade에 vLLM ROCm 추가
Reddit
·
2026.05.09 03시
vLLM V0에서 V1로: RL에서 보정보다 정확성 먼저
TLDR AI
·
1
·
2026.05.07 06시
Google TPU, DFlash로 추론 3배 가속
Reddit
·
2026.05.06 00시
Apple Silicon 기반 LLM 추론 성능 분석
Reddit
·
2026.05.05 22시
Apple Silicon LLM 추론 성능 분석 결과
Reddit
·
2026.05.05 22시
KV 캐시 양자화 성능 비교
Reddit
·
2026.05.02 08시
PFlash, prefill 10배
Reddit
·
2026.05.01 23시
이전
5
6
7
8
9
다음
이전
1
2
3
4
5
6
7
8
9
다음