AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#reward-hacking
#reward-hacking와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Trajectory, AI 작업 단위 비용 최적화하는 density-aware training 공개
TLDR AI
·
2026.09.25 09시
Goodfire, 모델 내부 Activation 신호로 Reward Hacking 탐지 기술 공개
TLDR AI
·
2026.09.18 09시
Yoshua Bengio, AI 에이전트의 부정행위 원인 분석 및 안전성 강화 방안 제시
Hacker News
·
2026.09.11 20시
OpenAI, 모델 학습 중단
PyTorchKR 읽을거리
·
2026.08.20 08시
AI는 당신이 원하는 대로 작동하지 않는다. 이것은 나쁜 것이다
Hacker News
·
2026.07.25 07시
재귀적 자기 개선의 첫 실험적 증거
TLDR AI
·
2026.07.16 09시
Reward Model의 과도한 민감도 문제
TLDR AI
·
2026.06.29 09시
도구 사용 능력을 갖춘 LLM 에이전트의 취약점 측정
TLDR AI
·
2026.06.26 09시
RewardHackBench: AI 에이전트 부정행위 방지 벤치마크
Reddit
·
2026.06.17 21시
AI에서 새롭게 드러나는 전략적 추론 위험: 분류 체계 기반 평가 프레임워크
TLDR AI
·
2026.04.28 09시
가장 주목받는 AI agent benchmark를 악용하기
Hacker News
·
2026.04.12 04시
RL 학습이 Chain-of-Thought 모니터링 가능성을 저해하는 시점 예측하기
TLDR AI
·
2026.04.02 09시
프론티어 추론 모델의 오작동 탐지
OpenAI Blog
·
2025.03.10 19시
#reward-hacking | AI Briefing