AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmark
#benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#benchmark 15페이지 | AI Briefing
Hugging Face, 분산형 평가 시스템 출시
HuggingFace Blog
·
2026.02.04 09시
H Company, UI 특화 Holo2 모델 공개
HuggingFace Blog
·
2026.02.04 02시
에미리트 방언 평가 벤치마크 Alyah 공개
HuggingFace Blog
·
2026.01.27 19시
IBM, 산업용 AI 에이전트 벤치마크 공개
HuggingFace Blog
·
2026.01.21 15시
포용적 관점에서 본 산업 현장: 포용적 AI 에이전트 벤치마크 (1)
NAVER CLOVA
·
2026.01.12 00시
AI 에이전트 evals 해부하기
Anthropic Engineering
·
2026.01.09 00시
AI의 과학 연구 수행 능력 평가
OpenAI Blog
·
2025.12.16 18시
Qwen3-Omni-Flash-2025-12-01: 더 똑똑하게 듣고, 보고, 따르는 업그레이드
Qwen
·
2025.12.09 06시
Stable Cinemetrics: 전문 영상 생성을 위한 구조적 분류체계와 평가
Stability AI Research
·
2025.10.02 00시
HuggingFace, 검색 벤치마크 RTEB 공개
HuggingFace Blog
·
2025.10.01 09시
에이전트 평가용 Gaia2 및 ARE 공개
HuggingFace Blog
·
2025.09.22 09시
AI 에이전트 벤치마크 TextQuests 공개
HuggingFace Blog
·
2025.08.12 09시
아랍어 LLM용 STEM 및 코드 벤치마크 '3LM' 공개
HuggingFace Blog
·
2025.08.01 23시
비디오 LMM 벤치마크 'TimeScope' 공개
HuggingFace Blog
·
2025.07.23 09시
미래 예측 벤치마크 FutureBench 공개
HuggingFace Blog
·
2025.07.17 09시
Solar Pro 2
Upstage
·
2025.07.10 10시
HealthBench 소개
OpenAI Blog
·
2025.05.12 19시
LCLM 평가 벤치마크 HELMET 공개
HuggingFace Blog
·
2025.04.16 09시
BrowseComp: 브라우징 에이전트를 위한 벤치마크
OpenAI Blog
·
2025.04.10 19시
아랍어 LLM 평가 리더보드 및 AraGen 업데이트
HuggingFace Blog
·
2025.04.08 09시
DeepSeek-V3-0324 모델 공개
HuggingFace Blog
·
2025.03.27 03시
SWE-Lancer 벤치마크 소개
OpenAI Blog
·
2025.02.18 19시
HF, LLM 리더보드 수학 평가 개선
HuggingFace Blog
·
2025.02.14 09시
데이터 에이전트용 DABstep 벤치마크 공개
HuggingFace Blog
·
2025.02.04 09시
이전
12
13
14
15
16
다음
이전
7
8
9
10
11
12
13
14
15
16
다음