OpenAI 表示对待发布模型 Astra 的初步评测已经强到无法排除“关键级”网络能力,并因此暂停部分内部活动、加强隔离和监控。

OpenAI 表示,待发布模型 Astra 的初步评测结果已经强到无法排除其达到‘关键级网络能力’的可能性。这不是说模型已经在现实中完成大规模自主攻击,而是说明它的潜在能力足以触发更严格的研发、测试和部署控制。
“关键级”不是普通意义上的更会写代码
OpenAI 在 2026 年 8 月 7 日发布的 安全说明中引用 Preparedness Framework:如果模型能够在很少人工干预下,为大量经过加固的真实关键系统发现并开发可用零日漏洞,或只凭一个高层目标就设计并执行端到端新型攻击策略,就可能触及关键阈值。

官方同时强调,目前仍在继续评测,结论是‘不能排除’,而不是已经确认达到。此前 GPT-5.6 Sol 被评为高等级而非关键等级。Astra 也没有参与 Hugging Face 事件,不能把两件事混为一谈。
OpenAI 为何暂停部分内部活动
当能力可能跨过既定风险阈值时,继续沿用旧的测试环境就不再稳妥。OpenAI 表示将加强模型权重保护和加密、限制网络与工具访问、使用隔离测试环境和沙箱,并暂停尚未满足新安全控制的 Astra 内部活动。
另一个重要变化是对智能体应用实施更广泛的风险行为监控,包括训练和评测阶段。监控系统会判断高风险行动并触发安全响应,以便人工审查或中断。官方还计划与政府机构和 AI 安全组织合作测试,并向第三方评测伙伴提供更严格的控制建议。
能力评测与真实产品风险要分开理解
能力评测通常会降低部分安全限制,目的是测量模型‘最多能做什么’。普通产品部署则会叠加分类器、权限、网络隔离和审计。因此,评测中发现高能力并不等于公众使用的模型能够随意执行相同行为,但它会改变安全团队必须防守的上限。
同样,模型在某个基准中的成功也不代表它能稳定、隐蔽地攻击所有系统。真实攻击受到环境信息、权限、时间和防御响应制约。负责任的解读既不能淡化能力跃迁,也不能把初步结论渲染成已经发生的灾难。
开发者需要提前改变什么
对普通开发团队,最直接的影响不是申请 Astra,而是重新审视智能体权限。网络访问应该按域名和用途允许,凭据应采用最小权限和短期令牌,高风险命令要经过审查,测试环境不应和真实客户数据共用密钥。任务失败时还要有明确停止条件,避免模型无休止寻找旁路。
Daybreak体现了相同的分级思路:多数防守工作使用受控通用能力,专业高风险研究则进入更严格的可信访问机制。能力越强,‘默认全部开放’越不是合理配置。
YouCanStudy.AI 的判断
Astra 的消息真正值得关注的是治理节奏:安全措施必须在模型广泛部署前升级,而不能等事故发生后再补。未来开发者会越来越频繁地面对同一个问题——模型能做的事情超出了当前任务所需,那么系统应该主动不给它多余权限。高能力不是调用时的默认福利,而是一种需要被管理的风险预算。