AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#benchmark
#benchmark와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#benchmark 14페이지 | AI Briefing
에이전트 반토막
Reddit
·
2026.04.15 00시
AWS와 Johns Hopkins Engineering, AI/ML 항체 설계용 대규모 데이터셋 공개
Amazon Science
·
2026.04.14 23시
PHP 8.6 Closure 최적화
Hacker News
·
2026.04.14 19시
번역벤치마크 1위
Reddit
·
2026.04.14 19시
Gemma 4를 Codex CLI에서 로컬 모델로 실행하기
GeekNews
·
2026.04.14 11시
N-Day-Bench – LLMs는 실제 코드베이스에서 실제 취약점을 찾을 수 있을까?
Hacker News
·
2026.04.14 06시
메모리 생존기
Reddit
·
2026.04.13 04시
CPU 동일 조건 역전
Reddit
·
2026.04.13 03시
AI agent 벤치마크를 무너뜨린 방법과 다음 단계
GeekNews
·
1
·
2026.04.12 21시
오픈모델 역전
Reddit
·
2026.04.10 15시
Claude Opus 4.6 공개
Anthropic News
·
2026.04.10 12시
122B 198t/s
Reddit
·
2026.04.10 09시
Launch HN: Relvy (YC F24) - 온콜 runbooks, 자동화
Hacker News
·
2026.04.09 21시
AI 에이전트를 위한 Claw-Eval 벤치마크 (GitHub 저장소)
TLDR AI
·
2026.04.09 09시
SWE-bench Verified는 더 이상 최첨단 코딩 역량을 측정하지 못한다
Hacker News
·
2026.04.07 18시
Vision2Web: 에이전트 검증 기반의 시각적 웹사이트 개발 계층적 벤치마크
TLDR AI
·
2026.04.03 09시
에이전트 새기준
HuggingFace Blog
·
2026.04.02 01시
ADeLe: 다양한 task에서 AI 성능을 예측하고 설명하기
Microsoft Research
·
2026.04.02 01시
시각적으로 정합된 상호작용형 계획을 위한 벤치마크 AsgardBench
Microsoft Research
·
2026.03.27 04시
대규모 언어 모델 학습에서 다운스트림 지표의 스케일링 특성 재검토
Apple ML
·
2026.03.26 09시
AI 에이전트를 위한 체계적 디버깅: AgentRx 프레임워크 소개
Microsoft Research
·
2026.03.13 01시
Claude Opus 4.6의 BrowseComp 성능에서 드러난 eval 인식
Anthropic Engineering
·
2026.03.06 00시
AI 에이전트가 실제 Stripe 통합을 만들 수 있을까? 벤치마크로 검증했다
Stripe Engineering
·
2026.03.02 09시
Meta·Hugging Face, 에이전트 평가용 OpenEnv 공개
HuggingFace Blog
·
2026.02.12 09시
이전
12
13
14
15
16
다음
이전
7
8
9
10
11
12
13
14
15
16
다음