AI Briefing
피드
안내
개발
검색
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
주간
주간·월간 인기
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#rlhf
피드
트렌딩
주간
태그
설정
LG AI Research 391
LG AI Research
·
2026.07.16 09시
[ACL 2024] LLM 연구의 최신 트렌드와 핵심 인사이트 - LG AI Research 블로그
LG AI Research
·
2026.07.16 09시
[NeurIPS 2023] RLHF, RLAIF 연구 트렌드와 주요 논문 소개
LG AI Research
·
2026.07.16 09시
Mac 기반 분산 RL 학습 성공
Reddit
·
2026.07.16 01시
Replay Buffer를 통한 어려운 문제 해결 방식의 재고
TLDR AI
·
2026.06.19 09시
Meta는 엔지니어링 조직을 망가뜨리고 있는가?
GeekNews
·
2026.06.17 16시
Cursor Composer 2.5, Cursor 내 가장 많이 선택받는 모델로 등극 — 10배 사용량 보너스
GeekNews
·
2026.05.20 10시
Anthropic, Claude에게 '왜'를 가르치다 - 정렬 훈련(Alignment Training) 개선 사례
GeekNews
·
2026.05.13 10시
분포 관점에서 본 SFT·RL·On-Policy Distillation
TLDR AI
·
2026.05.11 09시
Hugging Face, RL 환경 비교 가이드 공개
Reddit
·
2026.05.05 23시
16개 오픈소스 RL 라이브러리 비교 분석
HuggingFace Blog
·
2026.03.10 09시
Kanana-2 개발기 (2): 개선된 post-training recipe를 중심으로
카카오
·
2026.01.15 00시
지난 10년
OpenAI Blog
·
2025.12.11 09시
Anthropic, 안전하고 신뢰할 수 있는 AI 개발을 위해 Series B 투자 유치
Anthropic News
·
2025.07.22 02시
Rule-Based Rewards를 통한 모델의 안전 행동 개선
OpenAI Blog
·
2024.07.24 18시
GPT-4를 활용한 GPT-4의 오류 탐지
OpenAI Blog
·
2024.06.27 19시
HuggingFace, RLOO 트레이너 공개
HuggingFace Blog
·
2024.06.12 09시
LangSmith를 활용한 Pairwise Evaluation
LangChain Blog
·
2024.05.16 00시
Model Spec 소개
OpenAI Blog
·
2024.05.08 09시
AI21과 Invisible Technologies 전략적 파트너십
AI21 Labs
·
2023.12.11 18시
PPO 기반 RLHF 구현 가이드 및 재현 결과
HuggingFace Blog
·
2023.10.24 09시
TRL, DDPO로 Stable Diffusion RLHF 지원
HuggingFace Blog
·
2023.09.29 09시
DPO를 이용한 Llama 2 미세 조정 가이드
HuggingFace Blog
·
2023.08.08 09시
Meta, Llama 2 공개 및 HF 통합
HuggingFace Blog
·
2023.07.18 09시
이전
1
2
다음
이전
1
2
다음