AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#ppo
피드
트렌딩
주간
태그
설정
멀티모달 LLM의 얼라인먼트 이해: 종합 연구
Apple ML
·
2026.08.03 09시
강화학습의 성능 저하를 막는 Closed-Loop 최적화 기술 PIRL
Reddit
·
2026.07.28 21시
책임의 분산: Weight Transport 없이 Dale의 원칙을 준수하는 학습법
TLDR AI
·
2026.07.20 09시
Greg Brockman 인터뷰 [동영상]
GeekNews
·
2026.05.25 10시
HuggingFace, RLOO 트레이너 공개
HuggingFace Blog
·
2024.06.12 09시
PPO 기반 RLHF 구현 가이드 및 재현 결과
HuggingFace Blog
·
2023.10.24 09시
TRL-PEFT 통합으로 RLHF 지원
HuggingFace Blog
·
2023.03.09 09시
강화학습을 활용한 게임 밸런싱 자동화
데브시스터즈
·
2021.01.18 09시