AI Briefing
피드
안내
검색
EN
로그인
전체
피드·트렌딩·게시판 통합
피드
최신 뉴스
트렌딩
오픈소스·릴리즈
게시판
블로그·홍보
태그
주제별 탐색
#reinforcement-learning
#reinforcement-learning와 관련된 AI·개발 뉴스를 최신순으로 모았습니다. 원문 출처와 한국어 요약을 함께 확인할 수 있습니다.
피드
트렌딩
태그
설정
#reinforcement-learning 10페이지 | AI Briefing
카카오, Kanana-1.5 추론 성능 강화 연구 공개… SFT와 RL 최적화 전략 제시
카카오
·
2025.08.29 00시
Kimina-Prover-RL: Lean 4 정리를 위한 오픈소스 학습 파이프라인 공개
HuggingFace Blog
·
2025.08.14 21시
언어 모델의 확장 가능한 강화학습을 위한 GSPO
Qwen
·
2025.07.27 16시
Qwen-MT: 속도와 지능이 만나는 번역
Qwen
·
2025.07.24 23시
Qwen3-Coder: 세계를 향한 에이전틱 코딩
Qwen
·
2025.07.22 22시
정리 증명 SOTA 모델 Kimina-Prover 공개
HuggingFace Blog
·
2025.07.10 21시
Grok 4
xAI
·
2025.07.09 00시
Liger Kernel, GRPO 메모리 40% 절감
HuggingFace Blog
·
2025.05.25 09시
o3 및 o4-mini 시스템 카드 부록: Codex
OpenAI Blog
·
2025.05.16 17시
GPT-4o의 아첨(Sycophancy) 현상에서 놓쳤던 부분에 대한 심층 분석
OpenAI Blog
·
2025.05.02 17시
Qwen3: 더 깊게 생각하고 더 빠르게 행동하기
Qwen
·
2025.04.29 05시
LLM 강화학습 효율 높이는 PipelineRL
HuggingFace Blog
·
2025.04.26 07시
OpenAI o3 및 o4-mini 시스템 카드
OpenAI Blog
·
2025.04.16 19시
Qwen2.5-VL-32B: 더 똑똑하고 가벼워진 모델
Qwen
·
2025.03.24 01시
QwQ-32B: 강화 학습의 힘을 활용하다
Qwen
·
2025.03.06 01시
대규모에서의 정확도
AI21 Labs
·
2025.02.24 23시
Grok 3 Beta — 추론 에이전트의 시대
xAI
·
2025.02.19 00시
DeepSeek R1 'Aha Moment' 재현 가이드
HuggingFace Blog
·
2025.01.31 19시
HuggingFace, Open-R1 프로젝트 공개
HuggingFace Blog
·
2025.01.28 09시
Operator 시스템 카드
OpenAI Blog
·
2025.01.23 19시
OpenAI o1 시스템 카드
OpenAI Blog
·
2024.12.05 19시
LLM의 추론 능력 학습
OpenAI Blog
·
2024.09.12 19시
OpenAI o1-mini
OpenAI Blog
·
2024.09.12 19시
Qwen2-Math 소개
Qwen
·
2024.08.08 01시
이전
7
8
9
10
11
다음
이전
2
3
4
5
6
7
8
9
10
11
다음