AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#model-evaluation
#model-evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#model-evaluation 2페이지 | AI Briefing
종양학 AI 임계값 평가 도구 공개
Reddit
·
2026.08.15 02시
AX-Ray, AI 모델의 인과적 안전성 진단
PyTorchKR 읽을거리
·
2026.08.14 11시
AI 모델 선택: 하나의 프롬프트, 11개의 모델, 서로 다른 결과
Hacker News
·
2026.08.13 22시
추천
SpaceXAI의 Grok 4.6, Artificial Analysis Intelligence Index에서 61점 기록
Hacker News
·
1
·
2026.08.13 01시
대규모 언어 모델에서 나타나는 자기성찰적 인식
Hacker News
·
2026.08.12 06시
DeepSeek V4 Flash 0731의 ARC-AGI 평가 결과
GeekNews
·
1
·
2026.08.08 06시
Qwen3.8 Max, Agentic Index 종합 1위
GeekNews
·
2026.08.07 07시
smevals: 소형·대형 모델 평가 프레임워크
TLDR AI
·
2026.08.03 09시
MIT 연구: AI 금융 조언은 놀라울 만큼 뛰어나다
Hacker News
·
2026.08.02 07시
500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가
GeekNews
·
2026.07.29 07시
SlopCodeBench 벤치마크, Opus 5의 장기 코딩 성능 한계 지적
GeekNews
·
2026.07.28 22시
9B 오픈 모델의 $500 RL 파인튜닝이 카탈로그 리뷰에서 프론티어 모델을 능가했다
Hacker News
·
2026.07.28 11시
UK AISI / CAISI의 Kimi K3 사이버 역량 예비 평가 결과
Hacker News
·
2026.07.25 13시
OpenAI 모델, 사이버보안 테스트 도중 탈출하다
TLDR AI
·
2026.07.22 09시
OpenAI와 Hugging Face, 보안 사고 대응을 위해 협력
Hacker News
·
2026.07.22 05시
Kimi K3: 성능과 그에 따른 논란들 (70분 분량)
TLDR AI
·
2026.07.21 09시
LG AI Research 352
LG AI Research
·
2026.07.16 09시
사회적 영향: 모델 및 언어에 따른 Claude의 가치 체계
Hacker News
·
2026.07.15 19시
모델 및 언어에 따른 Claude의 가치관 분석
Anthropic Research
·
2026.07.13 09시
CursorBench 3.1
Hacker News
·
2026.07.02 16시
Show HN: Claude, Codex, Cursor에서 직접 사용하는 스마트 모델 라우팅
Hacker News
·
2026.06.27 01시
DiffusionBench: Generative Diffusion Transformer의 통합적 평가를 향하여
Hacker News
·
2026.06.24 11시
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다
GeekNews
·
2026.06.07 18시
'배틀쉽' 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기
GeekNews
·
2026.06.04 10시
이전
1
2
3
4
다음
이전
1
2
3
4
다음