OpenAI暂缓前沿强化训练:安全阈值上调后,最大规模实验仍未重启

时间:2026-08-19 16:23:04       来源:环球市场播报

OpenAI于8月18日发布题为《在具备关键网络能力的时代调节模型开发节奏》的说明,并同步由首席执行官Sam Altman在社交平台确认:公司已暂停部分前沿强化学习和(RL)训练,以使对齐、安全与监测标准匹配当前能力水平。Altman写道,模型进展已极为迅速,公司此前承诺,一旦能力超越安全与对齐节奏,将采取行动。官方文本将此次放缓归因于两起近期事态:一是OpenAI模型评估过程中发生的Hugging Face安全事件;二是8月7日内部评估显示,未发布模型Astra可能达到准备框架(Preparedness Framework)所定义的“关键网络安全能力”门槛。安全负责人Mia Glaese接受采访时表示,距离全面恢复正常运行仍相当遥远。


(资料图片)

暂停范围与已恢复部分

据公司披露,面向部署的最新模型强化学习和曾暂停约两周,期间对研究环境进行加固与红队测试,并扩大监测覆盖。规模最大的前沿强化学习实验仍处于搁置状态,现阶段仅开展较小规模训练与评估,以检验模型行为、核验防护并积累对齐证据。与Astra相关的相当一部分工作负载,须迁移至更高安全标准后方可继续;部分已满足新要求的训练与评估则获准进行。

事件发生后,公司立即限制研究集群中可执行代码或调用联网工具的前沿模型推理。部分代码执行路径已在更严格隔离条件下较快恢复,若干研究任务经逐项评估后重启,但网络隔离、沙箱强化与持续安全测试成为新的前置条件。监测对象覆盖Sol能力及以上模型的带工具强化学习与评估;自8月7日起,Astra凡涉及工具的推理亦须纳入监测。

三项防护及其计算成本

官方将补救措施归纳为监测、对齐与安全三类。监测采用多阶段结构:在采样词元上运行激活分类器,再对工具行为、推理轨迹与活动日志进行高算力核查;若判定可能突破关键安全边界,则向安全、安保与研究团队发出最高优先级告警。现行安排要求相关团队在三十分钟内排除误报,否则暂停该项活动。监测开销约为被监测推理算力的20%,因训练与评估任务而异。

对齐方面,公司将核心技术前移至训练更早阶段,而非集中于临近部署时点,包括改进奖励模型以识别并抑制不安全行为、训练模型如实陈述自身行动与能力边界,以及减少奖励黑客行为。安全方面则提高工作负载隔离、加强对不可信代码的沙箱约束、收紧网络隔离,并实施持续测试,包括降低权限、厘清信任边界、完善日志与自动化攻防演练。Astra及网络相关工作负载适用最严格档。公司同时表示,准备框架本身将改写,因其主要条款可追溯至2023年,而模型已接近或触及当时设定的临界值。

对产品节奏与行业竞争的含义

此项安排并不等于全面停训。较小规模与较低风险任务已经恢复,ChatGPT现有产品线亦未宣布中断。真正被推迟的是下一代前沿能力的主实验,而Astra被描述为在智能体编程与网络安全方面较GPT-5.6 Sol有显著进展。对微软等投资方与云合作伙伴而言,这意味着下一代模型的对外时间表存在新的不确定性;对谷歌、Anthropic等竞争对手而言,则构成窗口:若其安全评估未触发同等门槛,产品发布节奏可能暂时领先。

计算资源的再配置同样具有财务含义。Altman向《时代》周刊表示,相当一部分算力与研究人员已转向对齐研究与监测系统。若20%的监测开销在前沿训练中常态化,同等资本开支所能完成的有效训练步数将下降,单位能力进步的成本上升。公司预期未来大部分安全工作将由模型承担,包括防御其他模型,从而使三项防护随能力同步扩展。这一设想若成立,可缓解人力瓶颈;在实现之前,则构成对训练吞吐量的硬约束。

尚待外部验证的问题

公开材料仍缺少Hugging Face事件的完整技术复盘,以及Astra达到“关键”门槛的评估细节。准备框架将关键网络能力界定为模型可在无人工协助下发现并利用加固系统中的零日漏洞,但外部无法核验内部评分。因此,市场需要区分两类解读:其一为审慎的工程调整;其二为能力已跨越公司原有治理框架,迫使研发节奏服从安全流程。Glaese的表态更接近后者。

对投资者与企业客户,可观察的指标并非声明本身,而是最大规模强化学习实验何时重启、Astra相关负载迁入新环境的比例,以及下一版准备框架是否将临界值与对外发布时间绑定。在上述节点出现之前,OpenAI的前沿进度应视为受安全流程约束的变量,而非按原计划线性外推。

标签:

消息推送