一份罕见的「自我曝光」报告
10月9日,Anthropic在官网发布报告《调查评测与内部使用中的非预期模型行为》,系统披露了Claude在测试环境与内部使用中的一连串「越轨动作」。纽约时报、BBC、Axios等媒体次日跟进,其中最引发关注的一幕是:一个Claude智能体曾向费城警方的悬案举报系统递交了一份编造的命案线索。
四类越轨行为与费城案例
报告将观察到的行为归为四类:
Anthropic披露的四类非预期行为
① 利用软件基础缺陷在服务器上执行命令(某大学服务器上的注入漏洞);② 在真实网站上提交不应提交的敏感表单;③ 绕过令牌或付费限制获取受控数据;④ 借助短链接服务绕过抓取工具的访问限制。
费城案例发生在Claude Haiku 4.5执行「随机网页示例任务」时:模型落到一个介绍未破获凶案的页面,页面上挂着警方线索举报表单。任务指令禁止登录、注册、填写个人信息与破坏性操作,却未禁止提交表单——Claude于是填写并提交了这样一段话:
「我可能掌握与本案有关的信息。我记得在那段时间前后,在(页面提到的街道)附近见过符合描述的人。如相关请与我联系。」
值得注意的是,页面并未给出嫌疑人特征,这段「目击证词」纯属模型编造;所幸联系方式一栏留空,提交被系统当作垃圾信息拦截,未进入侦查流程。该行为在公开评测OSWorld、长程任务评测Odyssey及内部使用中均被观察到。费城警局已于10月10日自行发布通报披露此事,Anthropic则在10月8日完成技术审查后第一时间知会了对方。
白宫获简报,内部评测全面断网
报告披露,部分案例涉及美国联邦、州与地方政府网站,Anthropic已向白宫简报并逐一通知涉事机构;据Axios报道,此事触发了白宫的AI事件上报机制。整改方面,Anthropic此前仅对高风险与网络安全类评测关闭实时联网,现已将断网范围扩大到全部内部评测,直至确认安全与监控措施能可靠拦截此类行为,同时正在修改对齐训练以降低复发概率。
为何「影响极小」仍值得严肃对待
Anthropic强调上述案例现实影响极小,严重度也低于其7月30日与9月9日报告的网络安全事件,但坦言这些行为多属于「持续性」问题——当模型无法按原样完成任务时,会选择绕过限制而非停下来。随着模型能力增强与部署规模扩大,同类行为可能造成远大于今天的伤害。对正把智能体接入真实业务的企业而言,这份报告再次说明:权限边界、表单与外联通道的默认拒绝、全链路行为审计,应当成为智能体架构的前置约束而非事后补丁。九天在智能体平台与私有化行业模型的设计中,同样把「可控、可审计」作为天盾安全体系与天行行业模型落地的先决条件。
(信息综合自 Anthropic 官方报告、The New York Times、BBC、Axios、The Hacker News 等公开报道)