AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#evaluation
피드
트렌딩
주간
태그
설정
Google, 에이전트 CLI 공개
PyTorchKR 읽을거리
·
1
·
2026.08.02 15시
DeepSWE, 코딩 모델 리더보드 오류 지적
Reddit
·
2026.06.02 12시
Agent Judge: 프로덕션 에이전트의 롱 컨텍스트 평가 문제 해결
TLDR AI
·
2026.05.29 09시
LangSmith Engine 소개
LangChain Blog
·
2026.05.29 07시
LangChain Labs 출범
LangChain Blog
·
2026.05.23 13시
오픈 에이전트 리더보드 공개
HuggingFace Blog
·
2026.05.18 23시
에이전틱 LLM 파이프라인의 캐싱
AI21 Labs
·
1
·
2026.05.14 05시
Harvey의 Legal Agent Benchmark 공개
TLDR AI
·
2026.05.07 09시
Reinforced Agent: 도구 호출 에이전트를 위한 추론 시점 피드백
Apple ML
·
2026.05.01 09시
AISI, GPT-5.5 사이버 역량 평가
Simon Willison
·
2026.05.01 08시
GPT-5.5, 사이버 평가 선두
Reddit
·
2026.05.01 01시
Qwen-Scope: 지능을 해독하고 잠재력을 끌어내다
Qwen
·
2026.04.30 13시
DeepMind, GenAI 평가용 ProEval GitHub 저장소 공개
TLDR AI
·
2026.04.30 09시
SWE-bench Verified가 더 이상 프런티어 코딩 역량을 측정하지 못하는 이유
GeekNews
·
2026.04.27 18시
SWE-bench 오염 확인
Reddit
·
2026.04.27 03시
사람: 점수 너머의 판단
무신사
·
2026.04.23 17시
The Machine: AI가 AI 활용 코드를 평가하는 법
무신사
·
2026.04.20 14시
에이전트 새기준
HuggingFace Blog
·
2026.04.02 01시
Agent 평가 준비 체크리스트
LangChain Blog
·
2026.03.27 23시
엔터프라이즈 AI 배포
AI21 Labs
·
2026.03.10 20시
RAG, 들어는 봤는데… 내 서비스에는 어떻게 적용할까?
우아한형제들
·
2026.03.10 11시
모듈형 AI 에이전트 조율
AI21 Labs
·
2026.02.26 21시
에이전트 평가용 Gaia2 및 ARE 공개
HuggingFace Blog
·
2025.09.22 09시
기업용 지식 에이전트
AI21 Labs
·
2025.08.25 21시
이전
1
2
다음
이전
1
2
다음