模
模型当裁判(LLM-as-a-Judge)
一句话理解
用 AI 给 AI 批卷子——让强模型按标准给回答打分排序,评测成本砍一个数量级的新主流。
定义
LLM-as-a-Judge 用一个强模型充当裁判:给它题目、候选回答与评分准则,让它判优或按维度打分。相比人类标注几乎零成本、可以大规模跑,已成为 RAG(词条 858)评估与智能体评测的主流手段之一。
你会在哪遇到它
开发者文档里的“用大模型打分”环节;评测框架输出的裁判意见;技术博客讨论评估成本时的标配方案。
背后的原理
常见玩法:单点打分(按量表评一到五分)、成对比较(二选一)、参考对比(对照标准答案)。已知缺陷要主动治:位置偏见(先说的占便宜)、长度偏见(写得长占便宜)、自恋偏见(偏袒同族模型)。对策是交换顺序评两遍、隐藏来源、多裁判投票。
和相近概念的区别
1 与人类偏好评估:AI 裁判是规模化替代,人类评估是校准基准,互相配合。 2 与奖励模型(984):奖励模型是训练出来的专用打分器,LLM 裁判是通用模型兼职。 3 与竞技场(937):竞技场是人类实时投票,LLM 裁判是离线自动判卷。
常见误区
1 裁判绝对公正——三大偏见齐活,不设计流程就直接用等于没评。 2 用最便宜的模型当裁判——裁判太弱,评测结果就是噪声。 3 分数可以直接对外发布——不同裁判与提示词给出的分数量纲不同,只在自己体系内可比。
所属分类进阶概念
更新时间2026-10-05 11:52
浏览量1
点赞0
每个 IP 仅可点赞一次 · 点赞后不可取消

暂无评论,来发表第一条评论吧!