AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmark
#benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#benchmark 2페이지 | AI Briefing
NVIDIA NemoClaw로 만든 기억하는 에이전트, 지식과 판단을 분리해 정확도 82.8% → 90.9%로 개선
PyTorchKR 읽을거리
·
2026.09.09 12시
Sierra, 에이전트 구축 능력 평가하는 Hyper-τ-bench 공개… 인간 협업 시 성능 82.2%
TLDR AI
·
2026.09.09 05시
OpenBMB, MiniCPM5-2B 공개
Reddit
·
2026.09.07 22시
vLLM, AMD GPU 환경에서 5가지 Speculative Decoding 방식 성능 벤치마크 공개
Hacker News
·
2026.09.07 18시
모바일 에이전트 벤치마크 공개
Reddit
·
2026.09.07 15시
PyTorchKR, 9월 2주차 AI 논문 10편 요약
PyTorchKR 읽을거리
·
2026.09.07 09시
OpenAI GPT-6 Astra 99.9% 점수는 하네스 효과…ARC Prize는 AGI 선언 거부
TLDR AI
·
2026.09.06 21시
MMLU 점수의 비교 가능성을 검증하는 APL… 적용 가능한 bridge 없으면 'incomparable'
TLDR AI
·
1
·
2026.09.06 09시
Auto-BenchMax 공개, MCP 점수 2배
PyTorchKR 읽을거리
·
2026.09.04 07시
추천
OpenAI, GPT-6 Astra 공개… ARC-AGI-3 99.9% 달성 및 정렬 안전성 대폭 강화
OpenAI Blog
·
4
·
2026.09.03 20시
Qwen, Taobao와 협력해 장기 운영 능력 평가하는 'E-Commerce Bench' 공개
Qwen
·
2026.09.03 11시
오픈소스 AI 탐지기 성능 한계
Reddit
·
1
·
2026.09.02 21시
스마트폰에서 GUI 에이전트 실행에 관한 문헌 리뷰: AndroidWorld
Reddit
·
2026.09.02 16시
소형 트랜스포머로 ARC-AGI-1 44% 달성, 비용 67센트
Hacker News
·
2026.09.01 18시
EnvHarness, 정적 환경 재구성
PyTorchKR 읽을거리
·
1
·
2026.09.01 15시
Terminal Bench 4.0 공개
Reddit
·
2026.08.29 16시
Stanford 연구진, 과학 워크플로우 기반 AI 에이전트 벤치마크 Terminal-Bench-Science 0.1 공개
TLDR AI
·
2026.08.28 09시
HF, 힌디어 ASR 평가 도입
HuggingFace Blog
·
2026.08.28 09시
AI 자가 개선 벤치마크 공개
Reddit
·
2026.08.28 05시
LAION Big Video Dataset
Hacker News
·
2026.08.27 10시
52개 T2I 모델 벤치마크 공개
Reddit
·
2026.08.27 06시
벤치마크 리드한 1,000만 달러 시드 라운드 유치 발표
LangChain Blog
·
2026.08.26 06시
신약 예측 벤치마크 LEADBOARD 공개
PyTorchKR 읽을거리
·
2026.08.22 19시
LLM 출력 압축, 비용 3절감
Reddit
·
2026.08.22 01시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
10
다음