AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#reinforcement-learning
#reinforcement-learning와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
DeepSeek, 대규모 에이전트 학습용 샌드박스 인프라 'DSec' 공개
Hacker News
·
2026.09.27 03시
Google Cloud, Gemini RLFT 맞춤화 모범 사례 가이드 공개
Google Cloud AI
·
2026.09.25 09시
Trajectory, AI 작업 단위 비용 최적화하는 density-aware training 공개
TLDR AI
·
2026.09.25 09시
FreedomIntelligence, 단일 강화 학습 기법 적용한 의료 LLM HuatuoGPT-3-27B 공개
Reddit
·
2026.09.25 04시
Stanford, 로봇 범용 포스트 트레이닝 알고리즘 EXPO-FT 제안
TLDR AI
·
2026.09.24 09시
초파리 뇌 시뮬레이션, 마리오 3 실시간 학습 공개
Reddit
·
2026.09.23 21시
구글 리서치, RL 기반 검색 증류 기술 R4T 공개
PyTorchKR 읽을거리
·
2026.09.22 15시
Reef Infra, 대화 로그 기반 RL 학습 레시피 공개
Reddit
·
2026.09.20 01시
추천
Jev와 경쟁하는 오픈소스 의사결정 모델 Laya 공개... 6~8배 빠르고 할루시네이션 차단
Hacker News
·
1
·
2026.09.19 19시
Wispr, 실시간 전사 특화 음성 모델 'Canto' 공개... GRPO 학습으로 경쟁 모델 대비 낮은 WER 달성
Hacker News
·
2026.09.18 03시
FreedomIntelligence, 의료 특화 LLM HuatuoGPT-3-9B 공개
Reddit
·
2026.09.18 01시
Apple, 리셋 없는 RL의 '비가역성 절벽' 측정하는 REVERSAL-BENCH 공개
Apple ML
·
2026.09.17 09시
Apple 연구진, 확산 언어 모델 RL 성능 높이는 DACA-GRPO 공개
Apple ML
·
2026.09.16 09시
Postgres 쿼리 계획 지연 시간 44.7% 줄인 4B 파라미터 RL 모델 공개
GeekNews
·
2026.09.16 09시
LLM 강화학습, 쉬운 문제 연산 줄이고 어려운 문제에 집중해 성능 향상
TLDR AI
·
2026.09.16 09시
Periodic Neon, GPT-6·Claude 5.1 대비 저비용으로 과학 분석 성능 우위
TLDR AI
·
2026.09.15 09시
Reef, OpenClaw-RL 가중치 릴리스 게이트 레시피 공개
Reddit
·
2026.09.14 17시
Dream-RSI, 재발견 시뮬레이터로 재귀적 자기 개선 루프 구축
TLDR AI
·
2026.09.14 09시
InternLM, 과학 특화 AI 모델 Intern-S2-397B 공개
Reddit
·
2
·
2026.09.13 19시
Cognition, Kimi K3 기반 SWE-2 공개
PyTorchKR 읽을거리
·
2026.09.12 10시
Recurrent Looped Transformer 공개: 시퀀스 길이에 따라 깊이가 확장되는 아키텍처
TLDR AI
·
2026.09.12 09시
AgileRL Arena v1.0 공개
Reddit
·
2026.09.12 00시
Yoshua Bengio, AI 에이전트의 부정행위 원인 분석 및 안전성 강화 방안 제시
Hacker News
·
2026.09.11 20시
MS, RL만으로 4B 코딩 에이전트 FrogNano 공개
Reddit
·
2026.09.10 22시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
10
다음
#reinforcement-learning | AI Briefing