AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ai-benchmark
#ai-benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Surge AI, 장기 금융 추론 평가 벤치마크 DAYJOB: Finance 공개
TLDR AI
·
2026.09.25 09시
EEBench 공개: AI 회로 설계 능력 평가, Claude Opus 5가 61.6%로 1위
GeekNews
·
2026.09.06 01시
GPT-6 Astra, 로봇 조작 태스크에서 Claude Fable 대비 성공률 95%·비용 2.3배 절감
TLDR AI
·
2026.09.04 09시
TxBench-AB 공개, LLM의 항체 발견 능력 평가
TLDR AI
·
2026.09.03 09시
Multiverse Computing, 유럽 최고 성능 추론 모델 'Quasar 438B' 공개
Hacker News
·
2026.09.02 19시
Ornith-1.5 오픈 모델, 397B, 35B, 9B 규모로 출시
TLDR AI
·
2026.08.20 09시
dig.bench (웹사이트)
TLDR AI
·
2026.08.18 09시
주요 AI 벤치마크 오류 12% 발견 및 정제 버전 공개
Reddit
·
2026.07.29 04시
DeepsecBench: 사이버 보안 취약점 탐색 모델 성능 평가
Vercel Blog
·
2026.07.27 13시
에이전트 추론을 위한 Legora 벤치마크
TLDR AI
·
2026.07.27 09시
Meta의 Watermelon, GPT-5.5 벤치마크 성능 추월
TLDR AI
·
2026.07.03 09시
GeneBench-Pro를 소개합니다
OpenAI Blog
·
2026.06.30 09시
새로운 코드 벤치마크 DeepSWE 공개
Reddit
·
1
·
2026.06.24 11시
웨이보의 초소형 VibeThinker-3B가 다시 한번 벤치마크 논란을 일으키는 이유
TLDR AI
·
2026.06.17 09시
LifeSciBench 소개
OpenAI Blog
·
2026.06.17 09시
Kaggle, AI 벤치마크 생성을 더욱 간편하게
Google AI Blog
·
1
·
2026.06.05 01시
비용 대비 지능 (Intelligence Per Dollar)
TLDR AI
·
2026.06.04 09시
미국 정부 벤치마크, 중국 AI 뒤처져
Reddit
·
2026.05.05 20시
2026년 AI 현황을 설명하는 그래프들
GeekNews
·
2026.04.20 21시
휴머노이드 88% 실패율
Reddit
·
2026.04.20 17시
가장 주목받는 AI agent benchmark를 악용하기
Hacker News
·
2026.04.12 04시
AI 성능의 상한선을 측정할 벤치마크가 고갈되고 있다
TLDR AI
·
2026.04.08 09시
카카오, AI 활용 역량 검증하는 'AI TOP 100' 출제 비하인드 공개
카카오
·
2025.11.24 00시
IndQA 소개
OpenAI Blog
·
2025.11.04 07시
이전
1
2
다음
이전
1
2
다음
#ai-benchmark | AI Briefing