多
多模态评测(图文音视频基准)
考完文字考“看图听话”——图表问答、文档理解、视频与语音任务,多模态评测的成套考卷正在成型,判分远比纯文本难。…
2 次浏览红
红队测试(Red Teaming)
雇一队“职业挑刺的”——发布前专门想方设法让 AI 说错话、泄密、越界,把漏洞自己先找完。大模型发布流程的标配安全环节。…
8 次浏览损
损失函数(Loss Function)
给模型打分的错题量化器——把“输出离正确答案有多远”算成一个数,训练的全部目标就是把这个数压下去。训练曲线上的 loss 线就是它。…
13 次浏览智
智能摘要(Summarization)
万字变三句的“压缩饼干”——文章、会议、邮件、视频,一键提炼要点,是普及率最高的 AI 办公功能之一。…
13 次浏览课
课程学习(Curriculum Learning)
先易后难的教学法——训练时把数据从简单到难排序喂给模型,像小学到大学的课程表,让学习过程更稳、收敛更顺。…
13 次浏览灰
灰度发布与回滚(AI 功能上线)
AI 功能的“安全带”——新模型或新提示词先放小比例流量,看质量与业务指标再放量,不对劲一键回旧版,AI 上线的必备章节。…
14 次浏览模
模型当裁判(LLM-as-a-Judge)
用 AI 给 AI 批卷子——强模型按准则给回答打分排序,评测成本砍一个数量级,但要先治好位置、长度、自恋三大偏见。…
9 次浏览数
数学评测(GSM8K 类)
给 AI 出数学卷子——从小学应用题、奥赛到研究级难题,答案唯一、自动判分,是检验模型“真推理”能力的首选考场。…
15 次浏览指
指令遵循(Instruction Following)
听不听话的量化分——你说“用三句话、表格形式、别用感叹号”,模型能不能一条条做到,就是指令遵循能力。…
26 次浏览图
图灵测试(Turing Test)
判断机器会不会“思考”的七十年老考题——隔着对话框聊天,分不清对面是人还是机器,机器就算过关。每次 AI 大新闻都绕不开它。…
29 次浏览