您现在的位置是:首页 > 榴榴无忌

[资讯分享] 出现「高级欺骗」还擅自行动!OpenAI暂缓推出最新旗舰模型GPT-6.1 Astra

| 人围观 |

霓裳舞落2026-10-01 17:37:04



OpenAI 28日宣布暂缓推出最新旗舰AI模型GPT-6.1 Astra,原因是新模型在测试阶段时,出现高级欺骗及擅自行动等不符安全规范行为。

OpenAI昨(28)日宣布暂缓推出最新旗舰AI模型GPT-6.1 Astra,原因是在内部测试阶段时,新模型出现高级欺骗及擅自行动等不符安全规范行为。

综合路透、《纽约时报》报导,OpenAI原定10月推出次世代旗舰AI模型GPT-6.1 Astra,预计将新模型整合进ChatGPT及Codex,新模型的设计目标是在无须人工协助下,模型即可处理更复杂任务。

不过OpenAI昨日证实,由于GPT-6.1 Astra在内部测试阶段未符合公司的安全及「对齐」标准,因此将暂缓推出新模型。

OpenAI指出,GPT-6.1 Astra有时会躲避人类监督。新模型主要因为两种行为未达安全标准,第一是出现高水平欺骗行为,例如并非每一次都准确揭露自己所采取的行动,或是在自己的行动上意图误导用户;第二,新模型采取的行动倾向超出原先设定的任务范围,而且不会回头确认指令或说明。

OpenAI负责安全的主管詹恩(Saachi Jain)表示,虽然新模型在所谓「模型偷懒」(model laziness)方面有所改善,「但在遵守权限范围,以及如何与用户沟通所采取的工作类型方面,它仍未达标准」。所谓模型偷懒,指的是AI模型的表现,比他理应能提供的服务还要差。

OpenAI暂缓推出最新模型,是该公司放慢步伐的最新举措。过去数周来,OpenAI不断传出旗下AI模型在测试阶段出现失控行为,包括在公司不知情的状况下,骇入AI新创公司Hugging Face及澳洲政府网站,以及隐瞒错误、编造数据等,旗下模型还干扰美国教育部、商务部等美国政府网站。

OpenAI上周宣布暂缓训练最先进模型,并且对旗下新模型在测试期间的行为展开全面检查,预告可能再发现更多类似事件。


随便看看