AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-evaluation
#llm-evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-evaluation 3페이지 | AI Briefing
몇 주에서 하루로: LLM 평가 속도를 높여 반복적인 개선을 가능하게 만든 방법
Airbnb Tech
·
2026.07.15 02시
Amazon Bedrock 모델을 promptfoo로 성능 평가하기
AWS Tech Blog (한국)
·
2026.07.11 18시
에이전트 개선은 데이터 마이닝의 문제다
LangChain Blog
·
2026.07.08 00시
Artificial Analysis, 오픈 모델 개방성 지수 발표
Reddit
·
2026.07.07 09시
Vending-Bench에서 나타난 Fable 5의 부적절한 행동: 그럴듯한 부인(Plausible Deniability)을 동반한 기만
Hacker News
·
2026.07.06 21시
해석 가능성을 통한 데이터 어노테이터 안전 정책의 이해
Apple ML
·
2026.07.06 09시
코드의 청결함이 Coding Agent에 영향을 미치는가?
Hacker News
·
2026.07.06 08시
"프론티어 AI가 의료 전문 툴을 이겼다"는 논문 재검증해보니 — 채점자간 일치도 0.10, 채점자가 곧 참가자
GeekNews
·
2026.07.02 14시
Senior SWE-Bench: 에이전트를 시니어 엔지니어로 평가하는 오픈소스 벤치마크
Hacker News
·
2026.07.02 11시
Amazon Bedrock AgentCore로 구축하는 AgentOps (2): 관측성, 평가, 그리고 AgentOps 라이프사이클
AWS Tech Blog (한국)
·
2026.06.30 22시
Amazon Bedrock AgentCore로 구축하는 AgentOps (2): 관측성, 평가, 그리고 AgentOps 라이프사이클
AWS Tech Blog (한국)
·
2026.06.30 22시
LLM 상호 평가 시 모델 제품군별 편향성 발견
Reddit
·
2026.06.28 09시
AI 에이전트의 작업 수행 방식 평가 연구
Reddit
·
2026.06.26 22시
AI의 정치적 편향성: AI 모델들의 현재 위치
Hacker News
·
2026.06.25 22시
9명의 판사, 실제로는 2명분: 상관관계가 있는 오류가 LLM 평가 패널을 저해한다
Apple ML
·
2026.06.23 09시
Fireworks를 활용해 비용을 100배 절감한 Trace Judge 구축하기
LangChain Blog
·
2026.06.16 02시
Align Evals 소개: LLM 애플리케이션 평가 프로세스 간소화
LangChain Blog
·
1
·
2026.06.16 02시
관측 가능성(Observability)을 활용한 AI 에이전트 디버깅 및 평가 방법: LangChain 가이드
LangChain Blog
·
2026.06.16 01시
AI2, 모델 개발용 평가 도구 olmo-eval 공개
HuggingFace Blog
·
1
·
2026.06.13 00시
AI 헬스 코치 구축하기: 평가, 안전성 및 규제 준수
LangChain Blog
·
1
·
2026.06.10 15시
DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다
GeekNews
·
2026.06.09 10시
FrontierCode
TLDR AI
·
2026.06.09 07시
에스토니아 언어 연구소, LLM용 에스토니아어 벤치마크 공개
Reddit
·
2026.06.06 06시
PolyRange: 오염 없는 AI 사이버 보안 벤치마크 공개
Reddit
·
2026.05.31 18시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
다음