AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmark
#benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Mica v0.1 4B: 에이전트 루프용 오픈 의사결정 모델
Reddit
·
2026.09.26 07시
추천
Jev 대안 CLM 공개, 에이전트 의사결정 4배 빨라
Reddit
·
2026.09.24 15시
OpenAI, 22개국 80여 명 전문가 참여 'MentalHealthBench' 공개
OpenAI Blog
·
2026.09.23 19시
NVIDIA, AI 에이전트 평가 지표 재정의
PyTorchKR 읽을거리
·
2026.09.23 17시
Qwen Intelligence, SOTA 모바일 AI 에이전트 3종 및 오픈 벤치마크 공개
TLDR AI
·
2026.09.23 09시
추천
Anthropic, Claude Opus 5.5 공개… 비용 40% 절감 및 역대 최고 정렬 점수 기록
Anthropic News
·
2026.09.23 02시
LinearSolveBench 공개, AI의 수치 해법 능력 평가
Reddit
·
2026.09.23 00시
Qwen3.5 기반 소형 의사결정 모델 'Kev' 공개, TypeSafe API 호환 및 성능 지표 제공
Hacker News
·
2026.09.21 16시
xAI, Grok 4.7 공개… 코딩 및 지식 작업 성능 강화
xAI
·
2026.09.21 09시
추천
Step 5 Preview 공개: 600B 파라미터 MoE 모델, agentic 작업 및 금융 분석 성능 강조
Hacker News
·
2
·
2026.09.20 13시
RoboHarm 벤치마크, 로봇 정책의 위험 지시 거절 능력 평가 결과 발표
Hacker News
·
2026.09.18 09시
Mac용 오픈소스 AI 에이전트 'AutoBot' 공개, OSWorld서 OpenAI Sol Max 대비 성능 우위
Hacker News
·
2026.09.18 01시
Pinecone, 벡터 양자화 벤치마크 도구 VQ-bench 공개
Reddit
·
2026.09.18 00시
Apple, 리셋 없는 RL의 '비가역성 절벽' 측정하는 REVERSAL-BENCH 공개
Apple ML
·
2026.09.17 09시
GoBench 공개, LLM 추론 능력 평가 지표로 주목
Reddit
·
2026.09.17 03시
대만 특화 VLM 벤치마크 VisTW 공개
Reddit
·
2026.09.16 12시
Prior Labs, 테이블 데이터 파운데이션 모델 TabPFN-3.5 공개
Reddit
·
2026.09.16 01시
UkisAI, Qwen 3.8 27B 추론 속도 1.95배 높인 Swift 모델 공개
Reddit
·
2026.09.15 00시
AI 에이전트 CAD 벤치마크: CadQuery의 명시적 실패 vs OpenSCAD의 조용한 실패
Hacker News
·
2026.09.12 09시
ARC Prize, 자율적 개방형 혁신 평가하는 ARC-AGI-4 벤치마크 공개
TLDR AI
·
2026.09.12 09시
Apple, 영상 캡션 품질 평가용 참조 없는 벤치마크 CapQuiz 공개
Apple ML
·
2026.09.11 09시
Meta, 실제 웨어러블 데이터 기반 건강 추론 벤치마크 'WearableQA' 공개
TLDR AI
·
2
·
2026.09.11 09시
DF26 벤치마크, AI 생성 영상 탐지 한계 드러내
Reddit
·
2026.09.11 01시
Q2D-Web, 1억 9천만 문서 기반 대규모 웹 검색 리트리버 벤치마크 공개
TLDR AI
·
2026.09.10 09시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
10
다음
#benchmark | AI Briefing