AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#reinforcement-learning
#reinforcement-learning와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#reinforcement-learning 2페이지 | AI Briefing
PPM 프레임워크, 긴 Horizon LLM 추론에서 sparse reward의 비효율성 해결
TLDR AI
·
2026.09.09 09시
Magic AI, DeepSeek V4 Pro 대비 48배 적은 연산으로 유사 성능 달성한 'Magic V5 e24' 공개
TLDR AI
·
2026.09.08 09시
둠머의 교육 (9분 분량)
TLDR AI
·
2026.09.07 23시
Human-Agent-Society, 지속 학습 인프라 'Reef' 공개
PyTorchKR 읽을거리
·
2026.09.07 21시
Meta·HF, 에이전트 RL 표준 OpenEnv 공개
PyTorchKR 읽을거리
·
2026.09.04 09시
TRL과 OpenEnv를 활용해 수채화를 그리는 코딩 모델 훈련하기
HuggingFace Blog
·
2026.09.03 09시
Anthropic, AI 에이전트 보안 사고로 METR 독립 검토 도입 및 고위험 RL 일시 중단
TLDR AI
·
2026.09.03 09시
Mercor·SkyRL, 397B 파라미터 지식 업무 에이전트 RL 훈련 가이드 공개
TLDR AI
·
2026.09.02 09시
EnvHarness, 정적 환경 재구성
PyTorchKR 읽을거리
·
1
·
2026.09.01 15시
RLVR 기반 ReViSQL-K2.6, 스캐폴딩 없이 Text-to-SQL 인간 수준 성능 달성
TLDR AI
·
1
·
2026.08.28 09시
CUA-Lite, 로컬 모델 컴퓨터 사용 공개
Reddit
·
1
·
2026.08.28 01시
Microduck 오픈소스 로봇 공개
Reddit
·
2026.08.27 23시
Hugging Face, MicroDuck 공개
Reddit
·
2026.08.27 22시
IBM, Granite 4.2 추론 LLM 공개: 3B~30B, 512K 컨텍스트 및 에이전틱 RL 적용
TLDR AI
·
2026.08.26 09시
Applied Compute, 자체 연구용 AI 모델 훈련 플랫폼 AC2 공개
TLDR AI
·
2026.08.26 09시
IBM, Granite 4.2 추론 LLM 공개
HuggingFace Blog
·
3
·
2026.08.26 00시
주간 AI 논문: 에이전트 RL 및 추론 최적화
PyTorchKR 읽을거리
·
2026.08.24 06시
Google, RL 기반 양자 오류 정정 공개
PyTorchKR 읽을거리
·
2026.08.22 14시
TaoLive, 변화하는 하네스를 따르는 소형 모델 포스트 트레이닝
TLDR AI
·
1
·
2026.08.21 09시
Ornith-1.5 오픈 모델, 397B, 35B, 9B 규모로 출시
TLDR AI
·
2026.08.20 09시
Agent Lightning v1.0: Harnessed Agentic RL로 나아가다
TLDR AI
·
2026.08.20 09시
Ornith-1.5: 셀프 스캐폴딩에서 셀프 임프루브먼트로
Hacker News
·
2026.08.19 23시
오픈소스 30B, GPT-5.5 제친다
Reddit
·
2026.08.18 20시
추천
사이버 보안 위협 역량이 부상하는 시대, 모델 개발 속도 조절
OpenAI Blog
·
1
·
2026.08.18 20시
이전
1
2
3
4
5
다음
이전
1
2
3
4
5
6
7
8
9
10
다음