首页AI 频道AI 术语词典损失函数(Loss Function)
损

损失函数(Loss Function)

模型与训练 1 次浏览 更新于 2026-10-07 21:04
返回术语列表

一句话理解

给模型打分的“错题量化器”——把“模型的输出离正确答案有多远”算成一个数,训练的全部目标就是把这个数压下去。

定义

损失函数(Loss Function)量化模型预测与目标之间的差距,训练通过反向传播降低它。语言模型常用交叉熵:下一个 token 预测错了就罚分。它是训练过程的指南针。

你会在哪遇到它

训练曲线图上那条不断下降的 loss 线;讨论“训练崩了”——loss 飞了;Scaling Law 里的纵轴本质上也是它。

背后的原理

语言模型的损失:对每个位置,模型输出下一个 token 的概率分布,与真实答案比对,正确 token 的概率越低罚分越高,全文平均就是 loss。训练就是不断调权重让 loss 下降。三个要点:loss 下降不等于能力上升(可能只是死记硬背);不同任务的 loss 不可直接比较;RLHF 阶段会换成奖励信号加 KL 约束的复合目标。

和相近概念的区别

1 与准确率:准确率看“对没对”,loss 看“离正确多远”,后者能提供更细的梯度信号。 2 与奖励模型:损失是训练时的直接目标,奖励模型是强化学习阶段的间接目标。 3 与评测基准:loss 是训练内部指标,基准是外部能力考试,两者不完全相关。

常见误区

1 loss 低就等于模型好——在训练集上低,可能只是把答案背下来了。 2 loss 是唯一目标——安全与对齐目标并不体现在预训练 loss 里。 3 不同模型可以比 loss——数据与分词器不同,loss 数值没有可比性。

所属分类模型与训练
更新时间2026-10-07 21:04
浏览量1
点赞0
每个 IP 仅可点赞一次 · 点赞后不可取消

评论 (0)

发表评论

0/300

暂无评论,来发表第一条评论吧!

便签
已输入:0/500字

    扫码访问工具