[태그:] LLM-as-a-jury
-

Who can we trust? LLM-as-a-jury for Comparative Assessment (ArXiv 2026)
https://www.dropbox.com/scl/fi/hpncna5pid7y4944jxkmk/arxiv26_Reliable_LLM_Juries_via_BT-sigma.pdf?rlkey=i9y4z96e2flrjamcdc3ssky2u&dl=0 논문 핵심 요약 Who can we trust? LLM-as-a-jury for Comparative Assessment ✔ 문제: 여러 LLM judge를 평균내면 성능이 최적이 아님 ✔ 원인: 각 LLM의 신뢰도 / 일관성 / bias가 다름 ✔ 해결: BT-σ (Bradley–Terry + judge reliability) (1) 문제 설정: LLM-as-a-judge → LLM-as-a-jury 기존 방식 하지만: 문제점 예: –> 이로 인해 확률 기반 ranking이…