AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmark
#benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#benchmark 3페이지 | AI Briefing
SOP-Bench: 실제 비즈니스 절차에서 AI 에이전트를 평가하는 새로운 벤치마크
Amazon Science
·
2026.08.22 00시
Felony Bench: AI 에이전트의 제3자 침해 사고 집계
Hacker News
·
2026.08.22 00시
Nvidia AVO, ARC-AGI-3 인터랙티브 추론 벤치마크 100% 달성
Hacker News
·
2026.08.21 22시
ASR 모델, 벤치마크 답 외우기
HuggingFace Blog
·
1
·
2026.08.21 09시
DeepSeek-V4-Flash-Vision-Exp 출시: 멀티모달 API 정식 오픈
DeepSeek
·
2026.08.21 09시
모든 모델은 속임수를 쓴다
Hacker News
·
2026.08.20 22시
검증기가 필요하다
AI21 Labs
·
1
·
2026.08.19 21시
새는 비행기처럼 날지 않는다. AI도 마찬가지다.
TLDR AI
·
2026.08.19 09시
오픈소스 30B, GPT-5.5 제친다
Reddit
·
2026.08.18 20시
Anthropic: Conceptual Reasoning Index 소개
Hacker News
·
1
·
2026.08.13 22시
Launch HN: Discovered Materials (YC P26) – 새로운 물질을 발견하는 AI agents
Hacker News
·
2026.08.12 16시
추천
Grok 4.6 공개
xAI
·
1
·
2026.08.12 09시
LlamaIndex, 추출 벤치마크 공개
Reddit
·
1
·
2026.08.12 01시
고도화된 AI 아첨
TLDR AI
·
2026.08.10 09시
DeepSeek V4 Flash 0731의 ARC-AGI 평가 결과
GeekNews
·
1
·
2026.08.08 06시
AI 튜터, 언제 도와야 하나
HuggingFace Blog
·
2026.08.08 02시
DeepAmbigQA: LLM 답변 완전성 평가를 위한 모호한 다단계 질문
Apple ML
·
2026.08.06 09시
AI가 혼자 완수할 수 있는 가장 큰 소프트웨어 프로젝트는 무엇인가?
Hacker News
·
2026.08.04 01시
APEX-Accounting: 회계 업무를 위한 AI 생산성 벤치마크
TLDR AI
·
2026.08.03 09시
이번 주 주목할 AI 논문
PyTorchKR 읽을거리
·
1
·
2026.08.03 06시
추천
DeepSeek-V4-Flash 업데이트
DeepSeek
·
2026.07.31 21시
HANDBOOK.md: 긴 정책 문서만으로는 에이전트를 안정적으로 통제할 수 없음
GeekNews
·
2026.07.31 02시
AI 모델 보안 강건성 리더보드 공개
Reddit
·
2026.07.30 07시
Handbook.md: 긴 문맥의 Agentic Instruction Following을 위한 벤치마크
Hacker News
·
2026.07.29 22시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
10
다음