AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#llm-evaluation
#llm-evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#llm-evaluation 5페이지 | AI Briefing
기술 평가 방법론
LangChain Blog
·
2026.03.06 03시
Hugging Face, 분산형 평가 시스템 출시
HuggingFace Blog
·
2026.02.04 09시
2026년 1월: LangChain 뉴스레터
LangChain Blog
·
2026.01.30 11시
IBM, 산업용 AI 에이전트 벤치마크 공개
HuggingFace Blog
·
2026.01.21 15시
Mimo V2 Flash 안전성 평가
Xiaomi MiMo
·
2025.12.18 09시
NVIDIA, 오픈 평가 표준 공개
HuggingFace Blog
·
2025.12.17 22시
정치적 공정성
Anthropic News
·
2025.12.10 09시
Deep Agent 평가하기: 우리의 학습 내용
LangChain Blog
·
2025.12.04 02시
BigCodeArena: 실행 기반 코드 평가 플랫폼
HuggingFace Blog
·
2025.10.07 18시
필리핀어 LLM 평가 벤치마크 공개
HuggingFace Blog
·
2025.08.12 09시
미래 예측 벤치마크 FutureBench 공개
HuggingFace Blog
·
2025.07.17 09시
LCLM 평가 벤치마크 HELMET 공개
HuggingFace Blog
·
2025.04.16 09시
HF, LLM 리더보드 수학 평가 개선
HuggingFace Blog
·
2025.02.14 09시
데이터 에이전트용 DABstep 벤치마크 공개
HuggingFace Blog
·
2025.02.04 09시
아랍어 LLM 평가용 AraGen 공개
HuggingFace Blog
·
2024.12.04 09시
BAAI, 다국어 LLM 토론 평가 플랫폼 'FlagEval Debate' 공개
HuggingFace Blog
·
2024.11.20 09시
Judge Arena: LLM 평가 모델 벤치마킹
HuggingFace Blog
·
2024.11.19 09시
Promptim: 프롬프트 최적화를 위한 실험적 라이브러리
LangChain Blog
·
2024.11.14 03시
금융 특화 LLM 리더보드 공개
HuggingFace Blog
·
2024.10.04 09시
LLM 기반 VQA 평가 지표 LAVE 제안
HuggingFace Blog
·
2024.07.25 09시
메모리 검색 성능 개선: New Computer, LangSmith를 통해 재현율 50% 향상 달성
LangChain Blog
·
2024.07.02 23시
LLM 보안 평가 프레임워크 공개
HuggingFace Blog
·
2024.05.24 09시
LangSmith를 활용한 회귀 테스트
LangChain Blog
·
2024.05.02 01시
프롬프트 형식에 따른 LLM 평가 변동성
HuggingFace Blog
·
2024.04.30 09시
이전
2
3
4
5
6
다음
이전
1
2
3
4
5
6
다음