M
Mamba 与状态空间模型(SSM)
一句话理解
挑战 Transformer 的新秀——不逐字回翻全文,而是像记笔记一样把看过的内容压缩成一份“状态”往前带。
定义
状态空间模型(State Space Model, SSM)是另一类序列建模架构,代表作是 Mamba。它用递归状态传递信息,推理时每个新词只需更新状态,计算量随长度线性增长,与注意力的平方增长形成鲜明对比。
你会在哪遇到它
AI 新闻聊“Transformer 挑战者”时的主角;讨论百万级超长上下文的架构选项时;关注新模型技术路线的爱好者圈子的热词。
背后的原理
直觉是“边读边记”:维护一个随内容不断更新的隐藏状态,新词进来只改状态、不重读历史——像人读完一段话留下印象,而不是把原文整段背下来。代价是“印象”有损,精确回忆全文细节不如注意力直接翻原文。很多新模型走折中路线:以 Transformer 为主干,局部混入 SSM 层兼取两家之长。
和相近概念的区别
1 与 Transformer:一个精确查阅(平方代价),一个压缩记忆(线性代价)。 2 与 RNN:同属递归思路,但 SSM 用了支持并行训练的数学技巧,绕开了 RNN 训练慢的老毛病。 3 与长上下文方案:RoPE 外推等是在注意力框架内续命,Mamba 是直接换框架。
常见误区
1 Mamba 已经取代 Transformer——主流大模型仍是 Transformer 系,SSM 更多出现在混合架构里。 2 线性复杂度一定更快——实际速度还取决于硬件利用率与工程实现,纸面优势未必兑现。 3 用户需要关心架构吗——基本不用,选模型看效果与价格,架构是厂商的事。
所属分类模型与训练
更新时间2026-10-07 10:56
浏览量1
点赞0
每个 IP 仅可点赞一次 · 点赞后不可取消

暂无评论,来发表第一条评论吧!