M
Multimodal(多模态)
一句话理解
AI 长出了眼睛和耳朵——不只读文字,还能看图、听声、看视频,然后用文字跟你聊它看到的东西。
定义
Multimodal(多模态)指能同时理解和/或生成多种信息形式(文本、图像、音频、视频)的模型。相对应的,只能处理文字的模型叫单模态模型。
你会在哪遇到它
把报错截图丢给 AI 问“这是怎么回事”;拍一张植物照片问叫什么;对着 AI 直接语音对话;让 AI 生成图片、生成视频。凡是能“发图给 AI”的产品,背后用的就是多模态模型;发图就报错的,多半还是纯文字模型。
背后的原理
把不同形式的信息统一转成模型能处理的“语言”:图片切成小块编码,语音转成特征序列,和文字的 token 放进同一个表示空间,模型就能把“图里的猫”和文字“猫”关联起来。生成方向则反过来,由文字描述引导,生成图像像素或语音波形。
和相近概念的区别
1 多模态不等于计算机视觉:视觉是专门处理图像的领域,多模态强调把多种形式打通到同一个模型里。 2 多模态不等于文生图:文生图只做生成方向,多模态通常指理解和生成兼备。 3 它和纯 LLM 的区别最直观的体现:能不能接收图片输入。
常见误区
1 它真的“看得懂”图——对文字、常见物体识别不错,但数数、空间关系、精细对比仍经常出错。 2 发图它就一定看得清——分辨率低、文字太小会读错,关键信息最好同时用文字说明。 3 图里的内容它都能核实——它只能基于画面回答,无法验证图本身真假。
所属分类基础概念
更新时间2026-09-29 08:38
浏览量3
点赞2
每个 IP 仅可点赞一次 · 点赞后不可取消

暂无评论,来发表第一条评论吧!