红
红队测试(Red Teaming)
一句话理解
雇一队“职业挑刺的”——发布前专门想方设法让 AI 说错话、泄密、越界,把漏洞自己先找完,是发布流程的标配环节。
定义
红队测试(Red Teaming)指在模型发布前由专职人员或自动化系统模拟攻击者,系统化探测模型漏洞与有害输出并推动修复的安全实践,源自网络安全行业,已成大模型发布标准流程。
你会在哪遇到它
模型发布报告的“安全评估”章节;监管要求的安全评估环节;AI 公司招聘的“红队工程师”岗位。
背后的原理
人工红队:角色扮演、多轮诱导、组合攻击,创造性比脚本强;自动化红队:用另一个模型生成海量攻击提示,规模化覆盖。测试维度包括越狱、有害内容、隐私泄露、错误信息与滥用风险。关键输出是“发现、修复、回归”的循环:每个漏洞转化为防御规则或训练数据。局限在于:测试集再全也只能覆盖已知攻击模式,新花样防不胜防。
和相近概念的区别
1 与越狱:越狱是用户的攻击行为,红队是厂商的自我攻击——动作相似,目的相反。 2 与评测基准:基准测“能力多强”,红队测“多容易出事”,是两条独立考核线。 3 与渗透测试:网络安全找系统漏洞,AI 红队找行为漏洞,方法论同源。
常见误区
1 红队过了就安全——只能证明已知攻击防住了,不能证明没有漏洞。 2 红队就是黑客——它是在授权范围内的防御性工作,与违法入侵是两码事。 3 上线前做一次就够——模型在迭代、攻击手法在更新,红队是持续性工作。
所属分类概念与安全
更新时间2026-10-09 10:57
浏览量2
点赞0
每个 IP 仅可点赞一次 · 点赞后不可取消

暂无评论,来发表第一条评论吧!