[태그:] RRD
-
Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks (ArXiv 2026)
이 논문의 핵심은 다음 한 문장으로 정리할 수 있습니다. Open-ended task에서 rubric을 많이 만드는 것 자체가 중요한 것이 아니라, “구분력이 있는 rubric을 충분히 발견하고, 잘못된 방향의 rubric과 중복 rubric을 제거하고, 서로 상관된 rubric을 중복 계산하지 않는 것”이 중요하다. 이를 위해 저자들은 RRD (Recursive Rubric Decomposition) 를 제안합니다. RRD는 ① rubric 생성 → ② 재귀적 분해…