当企业把大模型接进业务系统的那一刻,模型本身就成了新的攻击面。过去三年,安全社区对这一点已经不再有争议:在OWASP大模型应用安全风险清单中,提示注入(Prompt Injection)连续多轮位居榜首,而真实世界的攻击早已从实验室走到了案发现场。
三类标志性事件
数据暴露:DeepSeek 数据库事件
2025年1月,安全研究人员发现 DeepSeek 多个数据库曾在一段时间内处于无鉴权可访问状态,包含对话记录与API密钥等敏感信息。事件本身很快修复,但它给全行业提了一个醒:AI公司的安全水位,直接决定用户对整个技术的信任水位。
深度伪造:2亿港元的"视频会议"
2024年初,某跨国公司香港分部员工参加了一场"总部CFO发起"的视频会议,会上多位"同事"实为深度伪造形象,最终被骗转账约2亿港元。这起案件标志着深度伪造从社交工程配角升级为主攻击手段——眼见不再为实,耳听不再为真。
黑产模型:犯罪即服务
WormGPT、FraudGPT 等地下"犯罪大模型"以订阅制在暗网流通,专门优化钓鱼邮件、恶意代码与话术生成。大模型能力一旦被武器化,攻击的门槛与成本被同时拉低。
威胁全景:三个层面
🗺️ 大模型安全威胁地图
模型层:训练数据投毒、后门植入、模型提取与成员推理攻击、模型文件供应链污染;
应用层:直接/间接提示注入、RAG知识库污染、敏感信息泄露、幻觉内容滥用、越权调用;
智能体层:工具权限过度授予、间接注入操纵Agent行为、插件与MCP等工具链供应链风险、多Agent协同中的权限逃逸。
尤其值得警惕的是间接提示注入:攻击者把恶意指令藏进网页、邮件、文档中,当AI在检索或阅读时被"策反"——在Agent具备真实工具权限(发邮件、下单、调API)的场景下,这类攻击可以从"让模型说错话"升级为"让系统做错事"。
纵深防御体系
参照NIST人工智能风险管理框架(AI RMF)与国内生成式AI安全要求,我们建议政企建设四层纵深防御:
- 数据层:训练与检索数据的来源审计、投毒检测、脱敏处理;
- 模型层:对齐微调、红队测试、模型行为基线监控、异常输出熔断;
- 应用层:输入输出双重过滤、提示注入检测、权限最小化、敏感信息拦截;
- 运营层:全链路审计日志、内容标识溯源、安全事件应急响应演练。
安全不是上线前的检查项,而是贯穿AI全生命周期的持续工程。
九天的实践
九天·天盾正是按上述四层架构设计的一体化安全防护体系:在数据层提供血缘审计与投毒检测,在模型层内置红队评测基线,在应用层实现提示注入识别与输出合规过滤,在运营层打通与内容标识、审计溯源的联动。配合天行大模型的全私有化部署,让政企客户的核心数据与模型权重始终留在自己的域内。
AI时代的网络安全,攻防的主战场正在向模型与智能体迁移。谁先把安全做成AI系统的内生属性,谁才能在下一阶段的智能化竞争中走得稳、走得远。