AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-evaluation
#llm-evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
LangSmith, 에이전트 디버깅용 'Trajectories' 출시
LangChain Blog
·
2026.09.24 23시
Anthropic 연구: 에이전트 시장 효율성 저하 주범은 협상력 아닌 '선호도 정확도'
Anthropic Research
·
2026.09.24 09시
TypeSafe Jev 모델의 '보정된 확률' 주장에 대한 기술적 반박
Hacker News
·
2026.09.23 09시
LangSmith, 의료 AI 신뢰성 확보 위한 임상 평가 인프라로 활용
LangChain Blog
·
2026.09.23 02시
UiPath, 에이전트 작업 길이별 Claude 모델 성능 격차 공개
Reddit
·
2026.09.22 21시
AISI·EvalEval, LLM 평가 재현성 표준화 협력
HuggingFace Blog
·
2026.09.22 09시
AI 에이전트 코드 변경의 3분의 1, 테스트로 검증 안 돼
Reddit
·
1
·
2026.09.20 22시
IBM, AI 에이전트 일관성 지표 'Consistency Gap' 공개
HuggingFace Blog
·
2026.09.16 01시
Goodhart Labs 실험: GPT-6-Astra·Claude Fable, 체스 평가서 여전히 외부 엔진 사용 부정행위
Hacker News
·
2026.09.13 23시
Meta, 실제 웨어러블 데이터 기반 건강 추론 벤치마크 'WearableQA' 공개
TLDR AI
·
2
·
2026.09.11 09시
SlopCodeBench 연구: AI 생성 코드는 인간 코드 대비 중복·복잡도 2배 높아
Hacker News
·
2026.09.10 09시
Anthropic, Claude 모델의 사이버 보안 사고 정렬 평가 결과 발표
Anthropic Research
·
2026.09.09 09시
KDDI, Buffmee RAG 앱 성능 최적화… 지연 38% 감소 및 Groundedness 25% 개선
Google Cloud AI
·
2026.09.08 09시
코딩 에이전트 연구: LSP보다 grep 선호 현상과 도구 인터페이스 설계의 중요성
GeekNews
·
1
·
2026.09.06 14시
추천
코딩 에이전트 도구 선택 분석: Claude Code는 사전 지식 의존, Codex는 웹 검색 활용
GeekNews
·
2026.09.05 11시
Perplexity 인용 검증 결과, 수치 포함 문장의 34.7%가 출처 불일치
Hacker News
·
2026.09.02 22시
AI 문명 창발은 암송? CIVOS 실험 결과 공개
PyTorchKR 읽을거리
·
2026.08.31 16시
IKP 기법으로 비공개 LLM의 파라미터 수 추정: Claude Sonnet 약 766B, GPT-5.5 Pro 약 5.3T
GeekNews
·
2026.08.28 23시
Stanford 연구진, 과학 워크플로우 기반 AI 에이전트 벤치마크 Terminal-Bench-Science 0.1 공개
TLDR AI
·
2026.08.28 09시
Apple, MCP 사양만으로 AI 에이전트 평가 시나리오 자동 생성하는 'Agent Seer' 공개
Apple ML
·
2026.08.28 09시
AI 자가 개선 벤치마크 공개
Reddit
·
2026.08.28 05시
LangSmith Engine: 에이전트를 개선하는 에이전트 구축 방법
LangChain Blog
·
2026.08.26 23시
Candidly, LangSmith로 상태 인식 에이전트 하네스 구축하기
LangChain Blog
·
2026.08.26 23시
LangSmith Evaluations의 Pytest 및 Vitest 통합 기능 소개
LangChain Blog
·
2026.08.26 06시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
다음
#llm-evaluation | AI Briefing