Tren
dar
대시보드
논문
뉴스
GitHub
AI 소식
KO
EN
로그인
AI 소식
논문
대시보드
뉴스
GitHub
“reinforcement learning”
이 키워드와 관련된 논문 · GitHub · 뉴스를 한곳에 모았습니다.
논문
12
전체 →
Semantic Scholar
자연어·LLM
인용 530
추론·에이전트 성능과 효율성을 동시에 높인 오픈 LLM
DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
OpenAlex
자연어·LLM
인용 1.4K
대규모 언어 모델의 발전과 활용에 대한 종합적 조사
A Survey of Large Language Models
Semantic Scholar
멀티모달
인용 568
강화학습으로 멀티모달 대규모 언어모델의 추론 능력 향상
Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
Semantic Scholar
자연어·LLM
인용 395
LLM 추론 효율화를 위한 오버싱킹 문제와 해결 방안 종합 분석
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
Semantic Scholar
자연어·LLM
인용 264
단 하나의 학습 예제로 LLM 수학 추론 능력을 향상시키는 강화학습
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
Semantic Scholar
자연어·LLM
인용 233
LLM 추론 능력 향상을 위한 강화학습 기반 방법론 종합 분석
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
Semantic Scholar
자연어·LLM
인용 152
확산 기반 대규모 언어 모델에 강화학습으로 추론 능력 부여
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
Semantic Scholar
자연어·LLM
인용 105
LLM 사후 훈련 방법론을 체계적으로 정리한 서베이
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
Semantic Scholar
자연어·LLM
인용 12
정확도 평가가 LLM 환각을 부추기는 메커니즘 규명
Evaluating large language models for accuracy incentivizes hallucinations
Semantic Scholar
ML 방법론
인용 8
희소 오토인코더로 LLM 내부를 진단·제어·개선하는 오픈소스 도구
Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models
Semantic Scholar
ML 방법론
인용 8
LLM 강화학습에서 신용할당 문제를 다루는 47가지 방법 체계적 분류
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
Semantic Scholar
멀티모달
인용 3
멀티모달 LLM의 장기 시각 추론을 위한 다중 에이전트 프레임워크
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
GitHub
1
전체 →
AI·금융
Jupyter Notebook
★ 15.7K
금융 강화학습을 위한 오픈소스 프레임워크 FinRL
AI4Finance-Foundation/FinRL
뉴스
4
전체 →
Hacker News
안전·보안
▲ 9
메타인지 피드백을 통한 강화학습으로 LLM의 불확실성 표현을 개선하는 연구
Reinforcement Learning with Metacognitive Feedback Elicits Uncertainty in LLMs
Hacker News
강화학습
▲ 6
장기 계획 강화학습을 위한 Jax 기반 경제 시뮬레이션 환경
TycoonLE: A Jax reinforcement learning environment for long-horizon planning
Hacker News
▲ 74
The Little Book of Reinforcement Learning
arstechnica
▲ 0
Quantum error correction can constantly recalibrate a processor