首页AI 频道AI 术语词典多模态评测(图文音视频基准)
多

多模态评测(图文音视频基准)

进阶概念 2 次浏览 更新于 2026-10-10 09:00
返回术语列表

一句话理解

考完文字考“看图听话”——图表问答、视频理解、语音指令,多模态模型的成套考卷正在快速成型。

定义

多模态评测考察模型对图像、音频、视频的理解与跨模态推理:代表任务有图表问答、文档理解(版面与表格还原)、视频问答与语音指令理解。判分比纯文本难——答案开放、参照系复杂,规则判分与 LLM 裁判(1088)混用。

你会在哪遇到它

多模态模型发布会的基准表格;图文识别类产品的选型测试;原生多模态(1034)宣传的技术背书。

背后的原理

任务按输入组合分类:图文(看图答题、读图表)、文档(对接 OCR 896 的升级场景)、视频(时序理解,文生视频 890 的反向能力)、语音。坑点:图像里的文字本身可能就是答案来源,评测要区分“读字”与“理解”;视频评测的算力成本高,题量普遍偏小、方差大。

和相近概念的区别

1 与原生多模态(1034):那是架构路线,这是效果度量。 2 与 OCR(896):传统 OCR 管转文字,多模态模型管理解与推理,基准设计不同。 3 与 VLA(1039):VLA 评测要上机器人实机,多模态评测主要在数字世界。

常见误区

1 图文分数高就视觉强——可能是“读题能力”强而非图像理解强,要拆任务看。 2 视频评测结论稳——题少方差大,小分数差距别当真。 3 多模态分数与文本能力同步——两者常不同步,选型按你的模态需求看。

所属分类进阶概念
更新时间2026-10-10 09:00
浏览量2
点赞0
每个 IP 仅可点赞一次 · 点赞后不可取消

评论 (0)

发表评论

0/300

暂无评论,来发表第一条评论吧!

便签
已输入:0/500字

    扫码访问工具