盲
盲测评估(Blind Evaluation)
撕掉标签再打分——评审不知道回答来自哪个模型,位置与品牌偏见少一半,竞技场与企业选型都在用的公平手段。…
1 次浏览红
红队测试(Red Teaming)
雇一队“职业挑刺的”——发布前专门想方设法让 AI 说错话、泄密、越界,把漏洞自己先找完。大模型发布流程的标配安全环节。…
8 次浏览模
模型当裁判(LLM-as-a-Judge)
用 AI 给 AI 批卷子——强模型按准则给回答打分排序,评测成本砍一个数量级,但要先治好位置、长度、自恋三大偏见。…
9 次浏览数
数学评测(GSM8K 类)
给 AI 出数学卷子——从小学应用题、奥赛到研究级难题,答案唯一、自动判分,是检验模型“真推理”能力的首选考场。…
15 次浏览