AI 资源频道

AI 术语词典

通俗易懂的 AI 术语解释,按字母索引快速查阅。 共 10 条 · 关键词「评测」

热 A B C D E F G H I J K L M N O P Q R S T U V W X Y Z
多

多模态评测(图文音视频基准)

考完文字考“看图听话”——图表问答、文档理解、视频与语音任务,多模态评测的成套考卷正在成型,判分远比纯文本难。…

2 次浏览
红

红队测试(Red Teaming)

雇一队“职业挑刺的”——发布前专门想方设法让 AI 说错话、泄密、越界,把漏洞自己先找完。大模型发布流程的标配安全环节。…

8 次浏览
损

损失函数(Loss Function)

给模型打分的错题量化器——把“输出离正确答案有多远”算成一个数,训练的全部目标就是把这个数压下去。训练曲线上的 loss 线就是它。…

13 次浏览
智

智能摘要(Summarization)

万字变三句的“压缩饼干”——文章、会议、邮件、视频,一键提炼要点,是普及率最高的 AI 办公功能之一。…

13 次浏览
课

课程学习(Curriculum Learning)

先易后难的教学法——训练时把数据从简单到难排序喂给模型,像小学到大学的课程表,让学习过程更稳、收敛更顺。…

13 次浏览
灰

灰度发布与回滚(AI 功能上线)

AI 功能的“安全带”——新模型或新提示词先放小比例流量,看质量与业务指标再放量,不对劲一键回旧版,AI 上线的必备章节。…

14 次浏览
模

模型当裁判(LLM-as-a-Judge)

用 AI 给 AI 批卷子——强模型按准则给回答打分排序,评测成本砍一个数量级,但要先治好位置、长度、自恋三大偏见。…

9 次浏览
数

数学评测(GSM8K 类)

给 AI 出数学卷子——从小学应用题、奥赛到研究级难题,答案唯一、自动判分,是检验模型“真推理”能力的首选考场。…

15 次浏览
指

指令遵循(Instruction Following)

听不听话的量化分——你说“用三句话、表格形式、别用感叹号”,模型能不能一条条做到,就是指令遵循能力。…

26 次浏览
图

图灵测试(Turing Test)

判断机器会不会“思考”的七十年老考题——隔着对话框聊天,分不清对面是人还是机器,机器就算过关。每次 AI 大新闻都绕不开它。…

29 次浏览
便签
已输入:0/500字

    扫码访问工具