AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#model-evaluation
#model-evaluation와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Check Point, TypeSafe AI의 Jev 모델 프롬프트 인젝션 취약성 발견
Hacker News
·
2026.09.24 22시
Paper Instruments, AI 에이전트 문서 편집 정확도 높이는 'Paper Office' 출시
Hacker News
·
2026.09.23 09시
LLM 시맨틱 캐시, 검증 로직이 보증 무너뜨리는 '셀프셀렉션' 현상 확인
Reddit
·
1
·
2026.09.22 11시
GPT 모델 안전성 훈련이 성차별을 줄이는 것이 아니라 변형시킨다는 연구 발표
Hacker News
·
2026.09.19 13시
추천
Toss, 공개 리더보드와 실제 업무 성능 괴리 해소 위한 'Toss Benchmark' 구축
토스
·
1
·
2026.09.16 14시
LLM 유머 취향 연구 결과 공개
Reddit
·
2026.09.16 09시
LLM 강화학습, 쉬운 문제 연산 줄이고 어려운 문제에 집중해 성능 향상
TLDR AI
·
2026.09.16 09시
AI 에이전트 CAD 벤치마크: CadQuery의 명시적 실패 vs OpenSCAD의 조용한 실패
Hacker News
·
2026.09.12 09시
에이전트는 테스트·검증 기법을 얼마나 잘 활용하는가?
GeekNews
·
2026.09.09 13시
Artificial Analysis, Intelligence Index v4.3 공개
Reddit
·
2026.09.08 03시
AI 모델이 실제 비즈니스 운영: 가짜 청구서로 12,431달러 송금, 3,200달러 손실
Hacker News
·
2026.09.08 03시
OpenRouter 라우팅의 함정: 동일 모델도 Provider별 성능·기능 편차 발생
Hacker News
·
2026.09.08 03시
AI 지능 레이어 소유 전략: 오픈 웨이트 모델 기반 자체 AI 구축 4단계 로드맵
GeekNews
·
2026.09.04 10시
동일 모델 기반 AI 에이전트 하네스 9종 비교, 작업당 비용 최대 17배 차이
Hacker News
·
2026.09.03 01시
오픈소스 AI 탐지기 성능 한계
Reddit
·
1
·
2026.09.02 21시
AI2, 벤치마크 분석법 공개
HuggingFace Blog
·
1
·
2026.09.02 06시
METR 보고서, HuggingFace 해킹 사건 분석: AI 에이전트 군집의 자발적 협력과 평가 시스템 우회 시도 확인
Hacker News
·
1
·
2026.08.30 23시
Sutro, '분석형 AI' 구축을 위한 실무 핸드북 공개
Hacker News
·
2026.08.29 04시
OpenAI, 모델 학습 중단
PyTorchKR 읽을거리
·
2026.08.20 08시
현실 환경에서의 Chain-of-Thought 추론은 항상 충실하지 않다
Hacker News
·
2026.08.20 01시
Roboflow Playground: 30개 이상의 Computer Vision 모델을 비교하고 테스트하기
Hacker News
·
2026.08.18 03시
Qwen3.8 27B, Artificial Analysis에서 52점 기록
Hacker News
·
2026.08.18 02시
Red queen hypothesis – self-improving AI를 위한 새로운 방향
Hacker News
·
2026.08.17 05시
LLM이 초등학교 5학년 수준 이상의 자료를 전혀 보지 못한다면 어떤 일이 벌어질까?
Hacker News
·
1
·
2026.08.16 16시
이전
1
2
3
4
다음
이전
1
2
3
4
다음
#model-evaluation | AI Briefing