AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#rlhf
#rlhf와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
Reef Infra, 대화 로그 기반 RL 학습 레시피 공개
Reddit
·
2026.09.20 01시
TRL v1.14, NCCL 없는 LoRA Async GRPO 지원
HuggingFace Blog
·
2026.09.10 09시
폴 크리스티아노, OpenAI 재단 이사회 및 안전·보안위원회 합류
OpenAI Blog
·
2026.09.10 02시
TRL과 OpenEnv를 활용해 수채화를 그리는 코딩 모델 훈련하기
HuggingFace Blog
·
2026.09.03 09시
긴 컨텍스트가 LLM의 RLHF 정렬을 무력화한다
Reddit
·
2026.08.17 06시
AI 정렬 연구의 암묵적 가치 이론 분석
PyTorchKR 읽을거리
·
2026.08.15 18시
LG AI Research 391
LG AI Research
·
2026.07.16 09시
[NeurIPS 2023] RLHF, RLAIF 연구 트렌드와 주요 논문 소개
LG AI Research
·
2026.07.16 09시
[ACL 2024] LLM 연구의 최신 트렌드와 핵심 인사이트 - LG AI Research 블로그
LG AI Research
·
2026.07.16 09시
Mac 기반 분산 RL 학습 성공
Reddit
·
2026.07.16 01시
Replay Buffer를 통한 어려운 문제 해결 방식의 재고
TLDR AI
·
2026.06.19 09시
Meta는 엔지니어링 조직을 망가뜨리고 있는가?
GeekNews
·
2026.06.17 16시
Cursor Composer 2.5, Cursor 내 가장 많이 선택받는 모델로 등극 — 10배 사용량 보너스
GeekNews
·
2026.05.20 10시
Anthropic, Claude에게 '왜'를 가르치다 - 정렬 훈련(Alignment Training) 개선 사례
GeekNews
·
2026.05.13 10시
분포 관점에서 본 SFT·RL·On-Policy Distillation
TLDR AI
·
2026.05.11 09시
Hugging Face, RL 환경 비교 가이드 공개
Reddit
·
2026.05.05 23시
이질적 선호 정렬을 위한 개인화 Group Relative Policy Optimization
Apple ML
·
2026.04.02 09시
16개 오픈소스 RL 라이브러리 비교 분석
HuggingFace Blog
·
2026.03.10 09시
카카오, Kanana-2 공개… 병렬 RL과 미드트레이닝으로 에이전트 성능 강화
카카오
·
2026.01.15 00시
지난 10년
OpenAI Blog
·
2025.12.11 09시
언어 모델의 확장 가능한 강화학습을 위한 GSPO
Qwen
·
2025.07.27 16시
Anthropic, 안전하고 신뢰할 수 있는 AI 개발을 위해 Series B 투자 유치
Anthropic News
·
2025.07.22 02시
Rule-Based Rewards를 통한 모델의 안전 행동 개선
OpenAI Blog
·
2024.07.24 18시
GPT-4를 활용한 GPT-4의 오류 탐지
OpenAI Blog
·
2024.06.27 19시
이전
1
2
다음
이전
1
2
다음
#rlhf | AI Briefing