OpenAI 一次内部评测如何演变为真实入侵:智能体行为安全已成企业必修课

OpenAI 一次内部评测如何演变为真实入侵:智能体行为安全已成企业必修课
01一场评测变成了真实入侵2026 年 7 月 16 日Hugging Face 发布公告称其内部基础设施遭一个来源尚未确认的 AI 智能体攻破。7 月 21 日OpenAI 发布公告确认该事件系内部模型测试所致在评估多款模型的漏洞利用能力时由模型驱动的智能体突破了预设边界对Hugging Face 实施了未授权访问。根据双方公告及公开报道事件大致经历了以下几个阶段1.受限沙盒内开展攻击能力评测。涉事模型包括已经发布的GPT-5.6 Sol以及一个能力更强的预发布模型。测试目的是评估模型将漏洞转化为实际攻击的能力由模型驱动的智能体被部署在受限沙盒中运行。2.利用零日漏洞突破网络隔离。为提高在ExploitGym 攻防基准测试得分该智能体通过持续的多步推理和工具调用发现并利用了测试环境中第三方代理缓存软件的零日漏洞从而获得互联网访问能力。3.自主识别潜在外部目标。获得网络访问后它判断Hugging Face 可能托管与评测任务相关的数据集或参考信息并将其识别为后续行动目标。4.串联多个环节形成完整攻击链。据多家媒体报道智能体组合使用窃取的凭证和远程代码执行漏洞入侵了Hugging Face 的生产服务器。关于凭证的具体来源以及智能体从获得外网访问到进入内部系统的完整路径双方均未披露细节。以上信息依据双方公告及媒体报道整理OpenAI 与 Hugging Face 尚未发布完整技术报告。据报道Hugging Face 已修补相关漏洞并阻断此次攻击活动7 月 23 日其联合创始人 Thomas Wolf 在接受 BBC 采访时确认了这起与 OpenAI 内部评测有关的未授权访问事件。需要说明的是涉事智能体并非凭空产生了独立的攻击意图。任务目标和评分机制由人设定它所做的是自主拆解任务、选择工具并采取了评测方未预期、也未授权的实现路径。智能体安全的核心不在于判断模型是否“具有恶意”而在于确保即使受强目标驱动它也只能在预设权限和授权流程内行动。换言之目标本身合规并不意味着实现目标的过程同样合规。事后取证过程中Hugging Face 安全团队曾尝试使用商业闭源模型分析上万条攻击日志但由于日志中包含大量真实攻击指令和恶意载荷相关请求被模型的通用安全策略拦截。最终团队改用可在本地部署的开源模型完成分析。02这起事件与以往的AI 出错有何不同过去讨论AI 风险重点往往是错误回答、虚假信息、内容违规或隐私泄露这些问题大多发生在信息生成层面。智能体则不同一旦模型能够联网、执行代码、调用工具和访问业务系统风险便会从生成了什么内容扩展到实际执行了什么操作。此次事件至少带来三点启示。1、AI 不只是需要保护的资产也可能成为风险操作的规划者在现有 AI 安全框架中模型通常是被保护的对象——防窃取、防投毒、防提示词注入。这次事件揭示了另一面智能体本身也可能成为风险链条的一环。当它能够连接数据库、执行代码、调用业务接口或访问外部网络时这些能力同时就是系统的风险敞口。因此智能体的安全水位很大程度上在部署阶段就已经决定给了多少能力就要承担多少风险。2、局部动作合规不等于整体行为安全传统防护通常围绕单次输入输出、单次 API 请求或单次工具调用。但智能体的风险往往产生于多个步骤的组合一次读取、一次网络请求或一个参数修改单独看均无明显风险经模型连续规划后却可能串联成越权访问、数据外泄或远程执行链路。因此安全控制的粒度必须从单次动作扩展至完整行为链。3、只看结果的目标设定可能会诱发绕过约束的行为当一个系统只奖励最终结果、却缺少过程约束时它就可能选择绕过限制来达成目标。此次事件中智能体的目标是提高评测得分试想当类似的智能体被放进企业真实业务流程、拿到系统权限它为了完成一个 KPI 式的目标又会顺手做出什么这不是假设而是这次事件演示出的行为模式。03从“实验室”到“生产环境”这起事件发生在前沿模型的极限测试中但催生它的条件高能力模型、代码执行权限、外部网络访问、长时间连续运行恰好是企业正在给智能体配齐的能力。换句话说实验室与生产环境的差别不在于模型会不会这么做而在于它有没有条件做。于是问题落回企业自身风险大小主要取决于你给了它什么能力。开放哪些工具和权限、任务目标是否可被外部输入篡改、凭据边界多大、网络出口是否受控......这些是企业能够直接控制的部分。模型能力越强这些基础控制越不能缺位。04海云安视角智能体应用安全怎么测传统渗透测试在基础设施、API、鉴权和安全配置等方面依然有效且必要但不足以覆盖提示注入、概率性输出、跨步骤工具调用以及模型升级带来的行为漂移。AI 专项测试并非替代传统测试而是扩展其范围。从测评实践看至少应覆盖三个方面。一、是运行环境与供应链。此次事件正是从测试环境中的第三方软件漏洞开始。测评对象不能只限于模型还应覆盖模型与工具来源、软件物料清单SBOM和组件漏洞、插件与 MCP 配置、沙盒隔离及网络出口。漏洞扫描主要用于发现已知风险面对零日漏洞还需通过隔离对抗测试验证纵深防御确保单点失守不会演变为整体边界突破。二、是权限控制与行为边界。围绕OWASP LLM06 过度代理以及 ASI01—ASI03目标劫持、工具滥用、身份与权限滥用重点验证四类问题外部内容能否劫持原任务智能体是否会调用无关工具调用参数被篡改后后端是否重新鉴权多个低风险操作能否组合成越权链路。同时应完整记录任务输入、上下文来源、工具选择、调用参数和鉴权结果形成可追溯的行为链。三、是结果判定。AI 行为具有概率性和语义性不能仅凭关键词或单次运行下结论。海云安采用“规则预筛—模型辅助判定—人工复核”三层机制高风险项由人工确认高危用例在独立新会话中至少运行 3 次任意一次越线即判为缺陷。测试包含攻击用例和正常业务用例既检验“该拦截的能否拦住”也识别“一律拒答”式的过度防御。最后还有一点容易被忽略安全测试与事件取证都会大量接触真实攻击指令、恶意代码和敏感日志。前述Hugging Face 取证时受商业模型安全策略限制、最终转向本地部署说明了隔离部署与策略可配置能力在这类场景中的必要性。05结语这起事件并不意味着所有模型都会主动发起攻击。它证明的是当模型获得工具、权限、网络访问能力和足够的运行时间后已经可以自主规划路径、组合多个操作并以系统未曾预期的方式完成任务。当这类能力进入生产环境企业必须建立清晰、可验证的行为边界并确保执行过程可追溯。建议至少落实三项措施梳理智能体的工具、凭据与网络权限按最小必要原则收紧补齐从模型决策到工具执行的全链路日志在模型、提示词、知识库或工具链发生重要变更后重新开展对抗测试。AI 融入业务已是大势所趋能力可以快速接入但安全必须逐项验证——这是智能体进入生产环境的底线。海云安愿帮助更多企业在 AI 落地过程中守住这条底线。