数
数学评测(GSM8K 类)
一句话理解
给 AI 出数学卷子——从小学应用题到奥赛题,答案唯一可判,是检验模型“真推理”的主战场。
定义
数学评测用答案唯一的题目集考察推理能力:GSM8K(小学应用题八千余道)是老标杆,MATH、AIME 等逐步加难;推理模型时代又出现了研究级难题集。判分只看最终答案对不对,过程可以千姿百态。
你会在哪遇到它
推理模型(词条 867)发布会的成绩单;讨论“模型数学到什么水平”的文章;o 系列词条(1017)里出现的那串分数。
背后的原理
简单题靠思维链(863)逐步推理后给答案,判分时提取最后的数值做比对。防作弊设计是关键:题目不能混入训练集(否则就是评测集污染 1045),答案用程序校验,部分评测还要求写出可验证的解题过程。高难度题上,会用代码与工具的模型和纯文本模型差距巨大。
和相近概念的区别
1 与代码评测:都是可自动判题,数学对答案、代码跑测试。 2 与人类偏好评估:一个有标准答案,一个纯主观比较。 3 与推理模型:数学分数是推理模型最直观的展示位,但分数高不等于实际会用的好。
常见误区
1 会做题就会推理——换套题型就露馅的“考试型选手”一直存在。 2 分数可跨榜比较——题目难度、提示词与判分规则不同,数字不能硬比。 3 数学等于全部智力——它只是能力切面之一,写作与沟通不在卷子上。
所属分类进阶概念
更新时间2026-10-03 14:55
浏览量1
点赞0
每个 IP 仅可点赞一次 · 点赞后不可取消

暂无评论,来发表第一条评论吧!