[태그:] Reinforcement Learning
-
Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains (ArXiv 2025)
이 논문의 핵심 아이디어는 매우 명확합니다. 수학·코딩처럼 정답을 자동 검증할 수 없는 영역에서도, 문제별(instance-specific) rubric을 여러 개의 작은 verifier처럼 사용하면 RLVR의 장점을 유지하면서 RL을 수행할 수 있다. 기존 RLVR(Reinforcement Learning with Verifiable Rewards)는 exact match, unit test 등 명확한 보상이 존재하는 수학·코딩에서 강력하지만, 의료 상담처럼 정확성·완전성·안전성·문맥 적합성 등이 동시에 필요한 open-ended 문제에서는 단일 binary reward를…
-

* TTRL: Test-Time Reinforcement Learning (NeurIPS 2025)
https://www.dropbox.com/scl/fi/ns4oytqbvv592au9b5xab/nips25-TTRL_Learning_At_Test_Time.pdf?rlkey=epso498d6ip6i7pyahmat0wzk&dl=0 논문 **“TTRL: Test-Time Reinforcement Learning” (NeurIPS 2025)**는 라벨이 없는 test 데이터에서 RL을 수행하여 LLM을 test-time에 self-evolve 시키는 방법을 제안합니다 . 아래에서 핵심 아이디어, 수식, 실험 결과, 그리고 왜 작동하는지까지 체계적으로 정리하겠습니다. 1. 문제 설정: Test-Time RL 기존 RL 기반 reasoning 모델 (예: GRPO, PPO 기반 수학 RL)은 ground-truth label이 있는 데이터를 사용합니다. 그러나 TTRL은…