
이 논문의 핵심 아이디어는 매우 명확합니다.
수학·코딩처럼 정답을 자동 검증할 수 없는 영역에서도, 문제별(instance-specific) rubric을 여러 개의 작은 verifier처럼 사용하면 RLVR의 장점을 유지하면서 RL을 수행할 수 있다.
기존 RLVR(Reinforcement Learning with Verifiable Rewards)는 exact match, unit test 등 명확한 보상이 존재하는 수학·코딩에서 강력하지만, 의료 상담처럼 정확성·완전성·안전성·문맥 적합성 등이 동시에 필요한 open-ended 문제에서는 단일 binary reward를 만들기 어렵습니다. 저자들은 이를 **Rubrics as Rewards(RaR)**라는 구조화된 reward로 바꾸고 GRPO를 수행합니다. 가장 좋은 RaR-Implicit는 Direct-Likert reward 대비 HealthBench에서 최대 31% relative improvement, GPQA-Diamond에서 7% relative improvement를 보입니다.
아래에서는 관련 연구 → 방법론 → 실험 설계 → 실험 결과 → ablation → 논문의 의미와 한계 순으로 자세히 설명하겠습니다.
1. 문제의 출발점: 왜 Rubric이 필요한가?
1.1 기존 RLVR
RLVR의 전형적인 reward는
처럼 정의할 수 있습니다.
예:
- GSM8K: 숫자 final answer가 일치하는가?
- MATH: symbolic/numeric answer가 정답인가?
- Code: test case를 통과하는가?
따라서 별도의 learned reward model 없이도 ground-truth verifier로 RL을 할 수 있습니다.
하지만 의료 질문을 생각하면,
“이 환자에게 어떤 처치를 권해야 하는가?”
라는 답변에는 단순히 진단명 하나만 맞는 것으로 충분하지 않습니다.
예를 들어:
- 진단이 맞는가?
- 핵심 증거를 설명했는가?
- 위험한 처치를 권하지 않았는가?
- 중요한 differential diagnosis를 고려했는가?
- 설명이 충분한가?
를 모두 봐야 합니다.
논문은 RLVR의 이런 한계를 multi-criteria reward로 확장합니다. 기존 preference-based reward model은 response length나 formatting 같은 superficial artifact, annotator bias에 과적합할 수 있으며 대량의 pairwise preference data도 필요하다는 문제를 지적합니다.
2. 핵심 직관: Rubric = 여러 개의 작은 verifier
RaR의 가장 중요한 개념은 다음입니다.
기존 RLVR:
RaR:
즉 하나의 복잡한 “좋은 답인가?” 판단을 여러 개의 명시적인 subgoal로 분해합니다.
논문의 Figure 1도 정확히 이 구조입니다.
그 다음
입니다. Reference answer를 expert supervision의 proxy로 사용해 prompt-specific rubric을 생성하고, 그 rubric을 judge에게 주어 reward를 계산한 뒤 GRPO policy update를 수행합니다.
3. Related Work
논문의 Related Work는 크게 세 갈래입니다.
3.1 RLVR를 math/code 밖으로 확장하려는 연구
초기의 RLVR는 주로:
- mathematical reasoning
- code generation
에 집중했습니다.
논문에서 언급하는 최근 흐름은 다음과 같습니다.
General-Reasoner
GENERAL-REASONER는 약 200K개의 mixed-domain corpus를 이용하여:
- physics
- finance
- policy
등으로 GRPO 기반 RLVR를 확장하고 MMLU-Pro에서 약 10점 향상을 보고합니다.
Cross-domain RLVR
후속 연구에서는:
- medicine
- chemistry
- psychology
- economics
까지 확장하고 하나의 cross-domain reward model이 여러 도메인을 supervise할 가능성을 보여줍니다.
Med-RLVR
MED-RLVR는 의료 multiple-choice QA에 verifiable reward를 적용하여 3B 모델에서도 reasoning capability를 끌어냅니다. 하지만 결국 MCQ이므로 답이 맞는지 자동 판별할 수 있다는 점에서는 여전히 RLVR-friendly task입니다.
RaR가 이들과 다른 지점은:
“verifiable domain을 넓힌다”가 아니라 “verifiability 자체가 약한 문제를 structured criteria로 바꾼다”는 것입니다.
3.2 Rubric을 이용한 LLM evaluation
두 번째 계열이 RaR와 가장 직접적으로 관련됩니다.
이미 rubric 기반 평가는 상당히 널리 연구되었습니다.
대표적으로:
HealthBench
의료 답변에 대해 clinician-written criteria를 사용합니다.
한 response에 대해 단순히
score = 7/10
으로 평가하지 않고,
- communication quality
- instruction following
- accuracy
- context awareness
- completeness
등을 세부적으로 평가합니다.
HealthBench는 약 48K clinician-written criteria와 LLM judge를 결합합니다.
Rubric is All You Need
Pathak et al.은 question-specific rubric이 generic checklist보다 code evaluation의 accuracy와 consistency를 향상시킨다고 보고합니다.
LLM-Rubric
multidimensional calibrated evaluation이라는 방향입니다.
RaR와의 차이
기존 연구:
RaR:
즉 rubric을 평가 도구에서 training-time reward function으로 승격시킨 것이 핵심 novelty입니다.
논문은 기존 rubric 연구가 주로 output grading 또는 DPO용 preference data conditioning에 사용된 반면, RaR는 이를 on-policy RL의 직접 reward로 사용한다고 강조합니다.
3.3 Preference Learning / RLHF / Process Reward
기존 RLHF는
같은 pairwise preference를 학습하여 reward model 을 구축합니다.
문제는:
- human comparison 비용
- preference subjectivity
- reward hacking
- length bias
- style bias
입니다.
반대로 RLVR는 reliable하지만 reward가 sparse합니다.
또 다른 접근인 process supervision은 reasoning 과정의 step별 reward를 제공합니다.
예:
하지만 step-level label 자체를 만들기가 비쌉니다.
따라서 저자들이 보는 spectrum은 대략 다음과 같습니다.
| 방법 | Reward signal | 장점 | 단점 |
|---|---|---|---|
| RLVR | exact verifier | 정확, 저비용 | 적용 domain 제한 |
| RLHF/RM | preference | 범용적 | bias/reward hacking |
| Process RM | step-wise correctness | dense supervision | annotation 비용 |
| RaR | structured rubric | dense + interpretable | rubric 품질 의존 |
RaR는 이 중간 지점을 노립니다.
4. 방법론: Formalization
입력 prompt: x
현재 policy:
에서 response를 sample:
각 prompt x마다 k개의 rubric criterion이 존재합니다.
여기서 는 criterion importance이고, 는 criterion j를 response가 만족했는지 나타냅니다.
5. Reward Aggregation 방법
논문에서 가장 중요한 methodological comparison입니다.
두 가지가 있습니다.
- Explicit aggregation
- Implicit aggregation
5.1 Explicit Aggregation
각 criterion을 독립적으로 judge합니다.
그 후 weighted average: 을 사용합니다.
예를 들어 rubric이 다음과 같다고 합시다.
| Criterion | weight | satisfy |
|---|---|---|
| Correct diagnosis | 1.0 | 1 |
| Explain key evidence | 0.7 | 1 |
| Optional detail | 0.3 | 0 |
| Avoid pitfall | 0.9 | 1 |
그러면
장점
Criterion별로 무엇을 만족했는지를 알 수 있으므로 interpretability가 높습니다.
단점
를 사람이 정해야 합니다.
실험에서는: 을 사용합니다.
특히 Pitfall criterion은 실제로
“misinformation을 피한다”
처럼 positive wording으로 바꾸므로 만족하면 positive reward가 들어갑니다.
5.2 Implicit Aggregation
여기가 실험상 가장 좋은 방법입니다.
criterion별 를 명시적으로 계산해서 합산하지 않습니다.
대신 LLM judge에 전체를 넣고 를 직접 계산합니다.
judge에게는 대략:
prompt와 response와 rubrics가 주어졌을 때 모든 rubric을 종합적으로 고려하여 response quality를 1–10으로 평가하라.
라고 요청합니다.
그 뒤 로 normalize합니다.
중요한 차이
Explicit:
Implicit:
입니다.
RaR-Implicit는 사람이 를 수동 tuning할 필요가 없습니다.
6. 왜 이것이 RLVR의 generalization인가?
논문의 흥미로운 이론적 framing입니다.
일반 RaR:
에서 이고 라고 놓으면
즉 conventional RLVR가 그대로 됩니다.
따라서 저자들은: 이라고 해석합니다.
RaR는 single binary correctness를 에서 로 일반화한 것입니다.
이 framing은 이 논문의 conceptual contribution 중 상당히 좋은 부분이라고 봅니다.
7. Rubric Generation
실제로는 rubric 품질이 방법 전체의 성패를 결정합니다.
논문은 좋은 rubric이 가져야 할 네 가지 desiderata를 정의합니다.
7.1 Expert Grounding
criterion은 domain expert가 중요하게 보는:
- essential fact
- reasoning step
- conclusion
을 포함해야 합니다.
하지만 의료 전문가가 모든 20K 문제에 rubric을 쓰는 것은 비쌉니다.
그래서 을 사용합니다.
즉 reference answer를 expert guidance의 proxy로 봅니다.
7.2 Comprehensive Coverage
단순 factual correctness뿐 아니라
- accuracy
- logical coherence
- completeness
- style
- safety
등을 포함해야 합니다.
그리고 Pitfall criterion도 둡니다.
예:
“common misdiagnosis를 피해야 한다.”
7.3 Criterion Importance
모든 criterion이 동일하게 중요하지 않습니다.
예:
따라서 importance information을 붙입니다.
논문에서는:
- Essential
- Important
- Optional
- Pitfall
을 사용합니다.
7.4 Self-contained criterion
각 criterion은 judge가 다른 정보를 다시 찾아보지 않아도 평가할 수 있어야 합니다.
예를 들어 나쁜 criterion은:
“적절한 치료법을 제시한다.”
입니다.
무엇이 적절한지 criterion 자체로는 모릅니다.
좋은 criterion은:
“The response recommends approximately 150 mEq sodium bicarbonate during the first four hours.”
처럼 작성합니다.
이렇게 해야 작은 judge도 criterion 자체만 보고 를 평가할 수 있습니다.
네 가지 설계 원칙과 7–20개의 prompt-specific criteria 생성 과정이 논문에 명시되어 있습니다.
8. 실제 의료 Rubric 예
논문의 sodium bicarbonate 예가 이 방법을 아주 잘 보여줍니다.
문제:
65 kg 환자, pH=7.05, base deficit=-40. 처음 4시간 동안 bicarbonate를 얼마나 투여할 것인가?
Reference answer에서는 를 계산한 뒤, safety를 위해 처음에는 약 150 mEq를 투여한다고 합니다.
여기에 생성되는 rubric은 다음과 비슷합니다.
Essential
- 공식
을 올바르게 사용.
- 약 150 mEq의 초기 dose 권고.
Important
- partial correction의 이유 설명.
- 780 mEq 계산 과정 설명.
- patient data를 올바르게 사용.
Optional
- base deficit이 severe metabolic acidosis를 의미한다는 설명.
Pitfall
- rapid overcorrection 위험을 무시하지 않음.
즉 하나의 reference answer를 단순히 로 비교하지 않고,로 분해합니다.
이 점이 Reference-Likert보다 효과적인 이유입니다.
9. Rubric dataset
9.1 RaR-Medicine
약 20K medical prompts입니다.
source:
- medical-o1-reasoning-SFT
- NaturalReasoning
- SCP-116K
- GeneralThought-430K
Rubric은 GPT-4o로 생성합니다.
실제 전체 예제 수는: 20,166
평균 rubric 수: 7.5
평균 question length:
9.2 RaR-Science
약 20,625
examples.
GPQA-Diamond의 분야와 맞도록:
- chemistry
- physics
- biology
등의 science reasoning question을 구성합니다.
Rubric은 o3-mini로 생성합니다.
평균 rubric 수도 약 7.5 입니다.
10. Policy learning: GRPO
Base model은 Qwen2.5-7B 입니다.
각 prompt q 마다: K=16개 response를 현재 policy에서 sampling합니다.
Sampling temperature: T=1.0
context/max length: 3584.
judge는 기본적으로: GPT-4o-mini 입니다.
각 rollout에 대해 를 계산합니다.
그 다음 GRPO를 통해 같은 prompt 내 response들의 상대적 reward로 policy를 update합니다.
논문의 training 설정은:
이고 8×H100 한 노드에서 학습합니다.
GRPO 관점에서 보면
논문 자체는 GRPO objective를 새롭게 제안한 것이 아니라 GRPO에 들어가는 reward 를 바꾼 연구입니다.
일반적인 GRPO 관점에서는 동일 prompt의 reward들에 대해 대략 형태의 group-relative advantage를 만들고 policy를 개선합니다.
따라서 RaR의 핵심은 optimizer가 아니라 입니다.
기존 RLVR:
Direct-Likert:
RaR: 입니다.
11. Baseline
비교 구성이 매우 중요합니다.
(1) Qwen2.5-7B
base model.
(2) Qwen2.5-7B-Instruct
instruction-tuned model.
(3) Direct-Likert
Judge에게
“이 response가 얼마나 좋은지 1–10점으로 평가하라.”
만 묻습니다.
즉 rubric도 reference도 없습니다.
11.1 Reference-Likert
Judge에게 reference answer까지 제공합니다.
RaR와 비교하기 위한 상당히 강한 baseline입니다.
11.2 RaR-Predefined
모든 문제에 동일한 generic rubric을 사용합니다.
예:
- factually correct
- complete
- concise
- helpful
따라서 instance-specificity가 없습니다.
11.3 RaR-Explicit
Prompt-specific rubric + explicit weighted sum.
11.4 RaR-Implicit
Prompt-specific rubric + holistic LLM aggregation.
최종적으로 이 방법이 가장 좋습니다.
12. 평가 1: HealthBench
HealthBench는 5,000개의 realistic clinical conversation을 포함하고 physician-authored rubric으로 평가합니다.
평가 axis:
- Communication quality
- Instruction following
- Accuracy
- Context awareness
- Completeness
Main overall result:
| Method | HealthBench overall |
|---|---|
| Qwen2.5-7B | 7.7 |
| Qwen2.5-7B-Instruct | 22.7 |
| Direct-Likert | 25.5 |
| Reference-Likert | 28.9 |
| RaR-Predefined | 12.5 |
| RaR-Explicit | 29.7 |
| RaR-Implicit | 31.2 |
중요한 비교
Direct-Likert: 25.5
RaR-Implicit: 31.2
relative improvement:
본문이 언급하는 “up to 31%”는 세부 evaluation setting/axis의 최대 relative improvement를 포함한 표현입니다.
더 중요한 것은 Reference-Likert도 넘어선다는 점입니다.
31.2>28.9.
즉 같은 reference 정보가 있다 하더라도
이라는 결과입니다.
13. RaR-Predefined가 왜 실패하는가?
이 결과가 상당히 중요합니다.
RaR-Predefined: 12.5 로 매우 낮습니다.
심지어 Direct-Likert: 25.5 보다 훨씬 나쁩니다.
이는 단순히
“rubric을 쓰면 좋다”
가 아니라
는 것을 의미합니다.
Generic criteria:
- correct
- concise
- complete
만으로는 어떤 사실이 정확해야 하는지, 어떤 failure를 피해야 하는지 reward model에 알려주지 못합니다.
저자들도 generic rubric이 prompt-specific requirement와 failure mode를 놓쳐 reward misalignment를 유발한다고 분석합니다.
14. 평가 2: GPQA-Diamond
이 부분이 논문의 generalization claim에 중요합니다.
GPQA-Diamond는 multiple-choice science reasoning benchmark입니다.
즉 evaluation 시에는 rubric이 필요 없습니다.
결과:
| Method | GPQA-Diamond |
|---|---|
| Qwen2.5-7B | 31.7 |
| Qwen2.5-7B-Instruct | 35.0 |
| Direct-Likert | 34.8 |
| Reference-Likert | 36.5 |
| RaR-Predefined | 31.7 |
| RaR-Explicit | 36.9 |
| RaR-Implicit | 37.6 |
Direct-Likert 대비:
대략 수준이며 논문에서는 약 7% relative gain으로 요약합니다.
15. 왜 GPQA 결과가 중요한가?
가능한 비판은:
“rubric reward로 학습했으니 rubric으로 평가하는 HealthBench에서 잘 나오는 것은 당연하지 않은가?”
입니다.
GPQA-Diamond는 이 문제를 완화합니다.
Training: Rubric reward
Evaluation: multiple-choice accuracy.
그럼에도 성능이 증가했습니다.
따라서 저자들의 주장은: 모델이 단순히 rubric evaluator를 gaming한 것이 아니라, 실제 reasoning capability도 어느 정도 향상되었다
입니다.
물론 이것만으로 reward hacking 가능성이 완전히 제거됐다고 보기는 어렵습니다.
16. RaR-Implicit vs RaR-Explicit
결과는 일관되게:
HealthBench: 31.2>29.7
GPQA: 37.6>36.9.
저자 해석은:
Explicit
장점:
- criterion별 score 확인 가능
- weight 조정 가능
- interpretability 우수
단점:
- hand-tuned weight가 brittle
- criterion 간 상호작용을 표현하기 어려움
Implicit
장점:
- judge가 criterion interaction을 종합적으로 판단
- hand-designed weighting 불필요
즉 예를 들어
“진단은 틀렸지만 설명 스타일은 좋다”
라는 response를 단순 weighted sum보다 LLM이 holistic하게 낮게 판단할 수 있다는 것입니다.
논문도 Explicit의 고정 weight는 통제성과 해석성은 높지만 brittle하며, Implicit가 전반적으로 가장 좋다고 결론냅니다.
17. Human preference alignment 실험
또 하나 흥미로운 결과입니다.
약 3,000개의 HealthBench prompt를 사용하여:
- preferred: practitioner-approved answer
- rejected: controlled perturbation으로 열화시킨 response
pair를 만듭니다.
Judge에게 두 response를 평가하게 해서 를 측정합니다.
비교:
Direct Likert
Rubric-guided
결과적으로 모든 judge scale에서 rubric 제공이 human preference와의 alignment를 높였습니다.
특히 작은 judge에서 개선폭이 큽니다.
18. 작은 Judge가 특히 이득을 보는 이유
저자들의 핵심 해석입니다.
작은 LLM에게 그냥
“이 의료 답변에 1~10점을 줘라.”
라고 하면 작은 모델이 내부적으로 다음을 모두 추론해야 합니다.
반면 rubric을 주면:
- diagnosis X를 언급했는가?
- sign Y와 diagnosis를 연결했는가?
- treatment Z를 권고했는가?
- dangerous recommendation W를 피했는가?
처럼 evaluation problem을 분해합니다.
즉 rubric이 일종의 역할을 합니다.
Appendix의 judge-scale training 결과도 이를 보여줍니다.
| Judge | RaR-Implicit | Direct-Likert |
|---|---|---|
| GPT-4o-mini | 27.9 | 25.3 |
| Qwen-32B | 26.2 | 25.4 |
| Qwen-14B | 25.0 | 24.9 |
| Qwen-7B | 26.7 | 22.0 |
Qwen-7B에서는:
즉 +4.7 points 향상입니다.
논문에서는 rubric reward 사용 시 judge scale에 따른 policy 성능 범위도 더 좁아진다고 해석합니다.
19. Ablation 1: Human vs Synthetic Rubric
HealthBench-1k에서 가장 흥미로운 ablation입니다.
| Training | Overall |
|---|---|
| Expert-Answer-SFT | 20.4 |
| Simple-Likert | 23.9 |
| Reference-Likert | 31.7 |
| RaR-Implicit-Synthetic-NoRef | 32.0 |
| RaR-Implicit-Synthetic | 35.9 |
| RaR-Implicit-Human | 34.8 |
여기서:
- Synthetic-NoRef: LLM이 reference 없이 rubric 생성
- Synthetic: reference answer를 보고 rubric 생성
- Human: 인간이 작성한 rubric
입니다.
가장 놀라운 결과:
차이는 크지 않으므로 “synthetic이 human보다 본질적으로 우월하다”고 해석하면 안 됩니다.
보다 적절한 결론은: strong LLM + high-quality reference로 만든 rubric이 human-authored rubric에 근접하는 수준의 supervision을 제공할 수 있다
입니다.
20. 왜 reference answer가 중요한가?
Synthetic rubric, no reference: 32.0
Synthetic rubric + reference: 35.9.
즉 LLM 자체가 아무리 강해도 문제만 보고
“좋은 답이 갖추어야 할 criterion을 생성하라.”
라고 하는 것보다, 정답/reference를 제공한 뒤 criterion을 생성하는 것이 훨씬 좋습니다.
이것은 RaR의 scalability에 중요한 함의를 줍니다.
사람이 직접 rubric 10개를 쓰는 대신: Human/expert answer –> LLM rubric expansion
을 수행할 수 있습니다.
저자도 reference-guided synthetic rubric이 reference-free rubric보다 일관되게 강하며, high-stakes domain에서는 expert signal이 중요하다고 강조합니다.
21. Ablation 2: Rubric의 어떤 구성 요소가 중요한가?
결과:
| Setting | HealthBench-1k |
|---|---|
| Essential-only | 34.9 |
| No categorical labels | 38.8 |
| No pitfall | 37.2 |
| All rubrics | 37.2 |
이 결과는 꽤 흥미롭습니다.
21.1 Essential-only는 나쁨
34.9
즉 정답의 핵심만 검사하면 충분하지 않습니다.
다양한 criteria:
- correctness
- explanation
- completeness
- safety
- etc.
를 모두 사용하는 것이 좋은 learning signal을 만듭니다.
21.2 Importance label은 의외로 별로 중요하지 않음
놀랍게도: No categorical labels=38.8가 All=37.2 보다 오히려 높습니다.
따라서
- Essential
- Important
- Optional
이라는 hand-designed importance 정보가 필수는 아닙니다.
이 결과는 특히 RaR-Implicit와 잘 연결됩니다.
LLM judge가 criterion 내용을 읽고 중요도를 스스로 어느 정도 infer할 수 있기 때문입니다.
21.3 Pitfall도 효과가 명확하지 않음
No Pitfall=37.2 , All=37.2.
즉 synthetic pitfall criteria가 큰 도움을 주지 못했습니다.
저자들의 설명은:
어떤 오류가 실제 모델에게 흔하고 중요한 failure mode인지 예측하는 것이 어렵기 때문이다.
입니다.
이는 중요한 future-work 포인트입니다.
22. Ablation 3: Rubric generator가 강할수록 좋은가?
reference를 주지 않은 조건에서 비교합니다.
| Rubric generator | HealthBench |
|---|---|
| GPT-4o | 34.2 |
| GPT-4o-mini | 32.7 |
| o3-mini | 32.4 |
| Qwen-72B | 32.7 |
| Qwen-32B | 31.1 |
| Qwen-7B | 31.9 |
| o3-mini + reference | 35.9 |
두 가지 결론이 나옵니다.
결론 1
일반적으로 stronger rubric generator가 유리합니다.
하지만 parameter scale과 단순 monotonic relationship은 아닙니다.
예: 입니다.
따라서 instruction alignment + reasoning ability가 중요합니다.
결론 2
더 중요한 것은 reference입니다.
가 GPT-4o no reference=34.2 보다 높습니다.
즉, expert grounding > rubric generator의 단순 모델 크기
라는 결과로 볼 수 있습니다.
23. 전체 실험 결과를 한 장으로 요약하면
A. Instance-specific rubric이 중요
RaR-Implicit=31.2 versus RaR-Predefined=12.5.
B. Structured reference가 raw reference보다 좋음
RaR-Implicit=31.2 > Reference-Likert=28.9.
즉,
보다 가 좋습니다.
C. Implicit aggregation이 가장 강함
RaR-Implicit > RaR-Explicit.
D. Rubric learning이 non-rubric evaluation으로 transfer
GPQA:\
E. Smaller judge가 가장 큰 이득
특히 Qwen-7B judge:
Rubric이 evaluator의 reasoning burden을 줄여줍니다.
F. Rubric generator보다 expert grounding이 중요
24. 이 논문의 방법을 보는 가장 중요한 관점
이 논문을 단순히
“LLM judge에게 rubric을 줬더니 성능이 올라갔다.”
라고 보면 연구적 의미를 과소평가하게 됩니다.
좀 더 본질적으로 보면 reward function specification의 문제입니다.
기존 RLHF:
RLVR:
RaR: 입니다.
즉 어려운 것은 R(x,y) 라는 복잡한 reward function을 학습하는 것이 아니라, 로 분해하여 specification하는 것이라는 관점입니다.
25. 저자들이 제시하는 Future Work
논문의 limitation/future work는 세 가지입니다.
① 더 넓은 domain
현재:
- medicine
- science
뿐입니다.
향후:
- dialogue
- tool use
- agentic tasks
등을 봐야 합니다.
② Dynamic / learned rubric weighting
현재 explicit:
향후: 처럼 학습하거나 RL 단계에 따라 바꿀 수 있습니다.
예:
초기:
후기:
즉 curriculum reward입니다.
③ Specialized evaluator
현재는 off-the-shelf LLM judge를 사용합니다.
향후:
- reward reasoning model
- specialized rubric verifier
- generative reward model
을 사용할 수 있습니다.
답글 남기기