AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#grpo
피드
트렌딩
주간
태그
설정
강화학습의 성능 저하를 막는 Closed-Loop 최적화 기술 PIRL
Reddit
·
2026.07.28 21시
의료 전문 Reasoning-Medical-27B 공개
Reddit
·
2026.07.28 16시
에이전트 RL을 위한 SAO 최적화 기술 공개
Reddit
·
2026.07.14 21시
에이전트형 강화 학습을 위한 단일 롤아웃 비동기 최적화
TLDR AI
·
2026.07.10 09시
VibeThinker: 새로운 SFT+GRPO 방식을 통해 추론 능력에서 Opus 4.5를 능가하는 3B 파라미터 모델
Hacker News
·
2026.06.23 11시
Replay Buffer를 통한 어려운 문제 해결 방식의 재고
TLDR AI
·
2026.06.19 09시
GUI Grounding 모델 Vista 9B/4B 공개
Reddit
·
2026.06.13 16시
ReAligned-Qwen3.5 모델 시리즈 공개
Reddit
·
1
·
2026.05.28 00시
Agentic GRPO: 에이전트 학습 최적화
Reddit
·
2026.05.23 19시
재귀적 언어 모델(RLM) 강화학습
TLDR AI
·
2026.05.13 09시
Mac Mini 3대로 GRPO 실험
Reddit
·
2026.04.26 19시
Intel, 경량 수학 에이전트 DeepMath 공개
HuggingFace Blog
·
2025.12.04 09시
Kimina-Prover-RL: Lean 4 정리를 위한 오픈소스 학습 파이프라인 공개
HuggingFace Blog
·
2025.08.14 21시
TRL, VLM 정렬 기술 지원 확대
HuggingFace Blog
·
2025.08.07 09시
TRL, vLLM Co-location 지원
HuggingFace Blog
·
2025.06.03 09시
Liger Kernel, GRPO 메모리 40% 절감
HuggingFace Blog
·
2025.05.25 09시
LLM 강화학습 효율 높이는 PipelineRL
HuggingFace Blog
·
2025.04.26 07시
HuggingFace, Open-R1 프로젝트 진행 상황 공개
HuggingFace Blog
·
2025.02.02 09시
DeepSeek R1 'Aha Moment' 재현 가이드
HuggingFace Blog
·
2025.01.31 19시
Qwen2-Math 소개
Qwen
·
2024.08.08 01시