AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#grpo
#grpo와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
올리브영, NLL 지표 기반 정렬 학습으로 AI Pick 추천 카드 품질·형식 동시 개선
올리브영
·
1
·
2026.09.18 17시
Wispr, 실시간 전사 특화 음성 모델 'Canto' 공개... GRPO 학습으로 경쟁 모델 대비 낮은 WER 달성
Hacker News
·
2026.09.18 03시
Apple 연구진, 확산 언어 모델 RL 성능 높이는 DACA-GRPO 공개
Apple ML
·
2026.09.16 09시
단일 프롬프트로 LLM 안전 정렬 제거하는 GRP-Obliteration 기법 공개
Hacker News
·
2026.09.15 23시
영어를 넘어선 GRPO: 비영어 및 다국어 환경에서의 GRPO 대규모 연구
Apple ML
·
2026.08.18 09시
LittleLearner (웹사이트)
TLDR AI
·
2026.08.17 09시
GRPO 학습용 1만 개 금융 추론 데이터셋 공개
Reddit
·
2026.08.16 23시
강화학습의 성능 저하를 막는 Closed-Loop 최적화 기술 PIRL
Reddit
·
2026.07.28 21시
의료 전문 Reasoning-Medical-27B 공개
Reddit
·
2026.07.28 16시
에이전트 RL을 위한 SAO 최적화 기술 공개
Reddit
·
2026.07.14 21시
에이전트형 강화 학습을 위한 단일 롤아웃 비동기 최적화
TLDR AI
·
2026.07.10 09시
Replay Buffer를 통한 어려운 문제 해결 방식의 재고
TLDR AI
·
2026.06.19 09시
GUI Grounding 모델 Vista 9B/4B 공개
Reddit
·
2026.06.13 16시
ReAligned-Qwen3.5 모델 시리즈 공개
Reddit
·
1
·
2026.05.28 00시
Agentic GRPO: 에이전트 학습 최적화
Reddit
·
2026.05.23 19시
재귀적 언어 모델(RLM) 강화학습
TLDR AI
·
2026.05.13 09시
Mac Mini 3대로 GRPO 실험
Reddit
·
2026.04.26 19시
3대 맥미니 GRPO
Reddit
·
2026.04.16 19시
GRPO로 요약모델 강화
Reddit
·
2026.04.15 18시
이질적 선호 정렬을 위한 개인화 Group Relative Policy Optimization
Apple ML
·
2026.04.02 09시
vLLM CUDA 정수 오버플로우
AI21 Labs
·
2026.03.25 17시
OOM 없이 vLLM 확장하기
AI21 Labs
·
2026.02.05 23시
동적 데이터 유예
AI21 Labs
·
2026.01.23 03시
Intel, 경량 수학 에이전트 DeepMath 공개
HuggingFace Blog
·
2025.12.04 09시
이전
1
2
다음
이전
1
2
다음
#grpo | AI Briefing