首页AI 频道AI 术语词典盲测评估(Blind Evaluation)
盲

盲测评估(Blind Evaluation)

进阶概念 1 次浏览 更新于 2026-10-10 12:01
返回术语列表

一句话理解

撕掉标签再打分——不知道答案来自哪个模型,评审偏见少一半,AI 评测里最古老的公平手段。

定义

盲测评估在评审时隐藏被测对象的身份:人类评审或 LLM 裁判(1088)只知道“回答 A 与回答 B”,不知道来自哪家模型、哪个版本、什么提示词。竞技场(937)是人类盲测的大规模实现,企业内部评测也普遍采用匿名化流程。

你会在哪遇到它

竞技场类平台的投票界面;企业内部模型选型的双盲评审;论文里“盲测显示”的结论。

背后的原理

要盲的不止模型名:回答顺序随机化(防位置偏见)、长度与格式统一展示(防长度偏见)、评审与被测方隔离(防利益相关)。盲测的对偶是“开卷评估”——知道身份后,品牌光环与立场偏见会显著扭曲打分(人类与 AI 裁判都难幸免)。评测报告注明是否盲测,是判断可信度的第一课。

和相近概念的区别

1 与竞技场(937):竞技场是大规模公开盲测,企业内部盲测是小规模闭环版。 2 与人类偏好评估(1087):偏好评估是测什么,盲测是怎么测才公平。 3 与 A/B 测试:A/B 在真实流量里比效果,盲测在受控环境里比质量。

常见误区

1 盲测就绝对公平——风格与长度等可感知特征仍可能暴露身份。 2 盲测万能——它牺牲了上下文信息,开卷评估在品牌一致性场景同样有意义。 3 只需盲测一次——评审人群与题目变了结论就变,要看样本量与多次复现。

所属分类进阶概念
更新时间2026-10-10 12:01
浏览量1
点赞0
每个 IP 仅可点赞一次 · 点赞后不可取消

评论 (0)

发表评论

0/300

暂无评论,来发表第一条评论吧!

便签
已输入:0/500字

    扫码访问工具