AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#evaluation
#evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#evaluation 2페이지 | AI Briefing
Reinforced Agent: 도구 호출 에이전트를 위한 추론 시점 피드백
Apple ML
·
2026.05.01 09시
AISI, GPT-5.5 사이버 역량 평가
Simon Willison
·
2026.05.01 08시
GPT-5.5, 사이버 평가 선두
Reddit
·
2026.05.01 01시
Qwen-Scope: 지능을 해독하고 잠재력을 끌어내다
Qwen
·
2026.04.30 13시
DeepMind, GenAI 평가용 ProEval GitHub 저장소 공개
TLDR AI
·
2026.04.30 09시
SWE-bench Verified가 더 이상 프런티어 코딩 역량을 측정하지 못하는 이유
GeekNews
·
2026.04.27 18시
SWE-bench 오염 확인
Reddit
·
2026.04.27 03시
사람: 점수 너머의 판단
무신사
·
2026.04.23 17시
모델이 필요 이상으로 코드를 수정하는 현상, 오버-에디팅
Hacker News
·
2026.04.23 02시
2부: 정책을 따르는 평가자, LLM-as-a-Judge
하이퍼커넥트
·
2026.04.22 09시
Haiku가 Opus를 역전
Reddit
·
2026.04.21 23시
The Machine: AI가 AI 활용 코드를 평가하는 법
무신사
·
2026.04.20 14시
OpenClaw의 두 얼굴
TLDR AI
·
2026.04.20 09시
문서 파서 성능측정
Reddit
·
2026.04.17 05시
맥락으로 평가를 짠다
Reddit
·
2026.04.17 02시
옵트아웃 함정
Reddit
·
2026.04.16 11시
모델별 편차 충격
Reddit
·
2026.04.16 03시
검증 구멍 오럴
Reddit
·
2026.04.15 15시
에이전트 반토막
Reddit
·
2026.04.15 00시
AI agent 벤치마크를 무너뜨린 방법과 다음 단계
GeekNews
·
1
·
2026.04.12 21시
LLM-as-a-Judge로 Netflix 쇼 시놉시스 평가하기
Netflix Tech
·
2026.04.11 01시
AI 에이전트를 위한 Claw-Eval 벤치마크 (GitHub 저장소)
TLDR AI
·
2026.04.09 09시
SWE-bench Verified는 더 이상 최첨단 코딩 역량을 측정하지 못한다
Hacker News
·
2026.04.07 18시
에이전트 새기준
HuggingFace Blog
·
2026.04.02 01시
이전
1
2
3
다음
이전
1
2
3
다음