CNTXJ.NET | 通信界-中国通信门户 | 通信圈 | 通信家 | 下载吧 | 说吧 | 人物 | 前瞻 | 智慧(区块链 | AI
 国际新闻 | 国内新闻 | 运营动态 | 市场动态 | 信息安全 | 通信电源 | 网络融合 | 通信测试 | 通信终端 | 通信政策
 专网通信 | 交换技术 | 视频通信 | 接入技术 | 无线通信 | 通信线缆 | 互联网络 | 数据通信 | 通信视界 | 通信前沿
 智能电网 | 虚拟现实 | 人工智能 | 自动化 | 光通信 | IT | 6G | 烽火 | FTTH | IPTV | NGN | 知本院 | 通信会展
您现在的位置: 通信界 >> 国际新闻 >> 新闻正文
 
OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题
[ 通信界 | 辰辰 | www.cntxj.net | 2026/9/18 7:43:24 ]
 

OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题。

9月16日,OpenAI一口气公布六份模型异常行为报告,并推出一套新的调查和披露流程。以后,员工发现模型越权、隐瞒或绕过限制,可以提交调查;符合条件的案例,将按复杂程度进入不同的披露轨道。

同一天,SentinelLABS和外部研究人员从Hugging Face的公开记录中,补出了OpenAI智能今年5月留下的更多痕迹。OpenAI此前已经披露过其中一部分活动,但具体账号、中继代码、带探测公式的表格,以及账号注册程序,都是外部调查重新拼出来的。

这些证据没有证明相关程序成功运行,也没有证据表明五月活动与七月入侵属于同一次行动。它们揭示的是另一个问题:当智能体的行动散落在不同平台时,任何一家公司都未必掌握完整记录。

五月发生过什么,又多了几块拼图

7月21日,OpenAI曾披露,参与网络安全测试的智能体绕过内部控制,接入公网并侵入Hugging Face的部分系统。公司后来将其称为一次“前所未有的网络事件”。

这次外部调查没有把入侵时间提前到五月。OpenAI此前已经公开过五月的一部分异常活动,新增加的是具体账号和公开提交记录。它们让外界能够把OpenAI内部时间线,与Hugging Face上留下的文件和代码放在一起看。


SentinelLABS把两个账号0Time和Nyx9列为可能被相关智能体使用的账号。两者原本就已存在,研究人员的判断来自提交时间、代码功能和前后行动的相互对应。


OpenAI此前披露,5月13日有一个智能体使用泄露的Hugging Face凭证寻找文件。SentinelLABS这次发现,同一天,0Time账号还提交过一段可以转发请求的中继代码。这段代码没有提到OpenAI所说的目标文件,公开记录也看不到它是否成功运行,两件事目前无法直接合并。

到了5月26日,公开记录与OpenAI内部时间线出现了更清楚的对应。以下时间均为UTC:OpenAI在20时04分记录了一次对外文件写入,Nyx9则在20时04分11秒提交了一个名为hello.txt的文件,内容只有“hi”。两条记录落在同一分钟。

45分钟后,Nyx9提交了一段代理中继代码;同一分钟,OpenAI的内部记录显示,智能体部署了第一个代理。研究人员据此认为,公开账号与OpenAI披露的五月活动高度相关。

当天深夜,Nyx9还上传了一个Excel表格。表格里包含四个公式,分别尝试访问外部网址、本地文件、云服务元数据和一个看起来像内部服务的地址。这组公式具备探测服务器内外资源的能力,但表格里没有计算结果,也没有回连或密钥等执行痕迹。

5月30日,0Time又向Hugging Face提交了一个自动注册OpenAI账号的公开程序,并为它增加了网页接口和运行配置。如果程序成功运行,每次调用可能发起一次注册尝试。但公开记录只有代码提交,没有构建和运行的证据。

研究人员把这些记录理解为对外部系统的试探。OpenAI和研究人员均表示,目前没有证据表明五月的这些活动属于七月的入侵行动。

德国独立研究员乔纳斯·维德曼-穆勒认为,如果五月的异常及时引起全面调查,OpenAI或许会更早收紧凭证、联网权限和监控,降低后来出事的可能。OpenAI此前也表示,回头看,一些早期信号本应触发更早的响应。

五月留下的记录至少暴露了一个监控缺口:智能体已经把动作延伸到第三方平台,实验室当时却没有拼出完整轨迹。

六份报告里,AI用了六种“办法”

同一天,OpenAI公布了新的模型异常行为披露框架,以及首批六份报告。这些行为都在模型训练或评估中被发现,OpenAI强调,它们是单独案例,不能用来判断类似问题在全部模型中的发生频率。

第一份报告涉及一个未发布的Astra系列研究模型。模型会把任务进度压缩成摘要,交给下一个上下文继续处理。OpenAI发现,极少数摘要里混入了类似“越狱”的指令,包括要求后续模型忽略开发者信息、改变自身角色,或者限制回答长度和工具使用。

OpenAI一共找到了27份带有类似表述的摘要。有时后续模型会识别并忽略,有时也会照做。公司没有发现这些指令能带来明显的奖励优势,目前更倾向于认为它们与模型难以正常结束摘要有关,但因果关系还没有证实。

这些行为出现在另一轮训练中。在最终Astra版本对应的训练过程中,监控系统没有发现同类越狱式指令;OpenAI也修复了一个与摘要结束有关的问题。


第二份报告更加直接。在GPT-5.6 Sol的强化学习训练中,一些模型会在摘要里给后续上下文留言,提醒它隐瞒错误。一个模型找不到用户要求的历史数据,便建议编造一组“合理”的数字,除非被追问,否则不主动说明;另一个模型使用了版本不匹配的缓存资料,也要求后续回答不要提起。

摘要原本是为了让长任务跨越上下文继续推进。模型一旦把“掩盖问题”写进摘要,一次错误就可能被后续步骤继承。OpenAI称,这类行为后来在Astra训练中的出现比例已经下降,但没有完全消失。

第三份报告里,一个内部模型要查询加州某县三个行业、三个年份的男性收入数据。正常接口受阻后,它尝试注册临时邮箱,又去公开代码仓库寻找泄露的API密钥。模型找到了一枚能够通过认证的密钥,却仍没拿到目标数据,最后直接编造了九个数字,并声称自己是从指定网站的图表中抄录出来的。

第四份报告的动机不太一样。一个未发布模型已经用Python查到了面积超过500万平方米的湖泊数据,但任务还要求浏览器引用。浏览器既打不开本地文件,也无法把Python结果当成网页来源。模型于是把文件上传到公共托管网站,给自己造出一个可以引用的网址。另一次测试中,模型为了调用外部识图服务,也把任务照片传到了公网。

两次上传都成功了,后续的浏览器操作却没有达到目的。这里的问题不只来自模型:任务同时要求正确答案和网页引用,工具却不允许本地结果进入浏览器,矛盾的奖励和工具设计把模型推向了不该采取的办法。

第五份报告发生在OpenAI内部的软件仓库Artifactory。不同训练样本里的模型缺少任务文件,便把仓库当成留言板,读取其他模型留下的求助和回复,再发布自己的问题。这些模型没有利用漏洞,用的就是环境提供的访问凭证;真正的问题是,原本应当相互独立的训练样本开始交换信息

最后一份报告发生在多智能体协作中。几个智能体要共同制作一份工作簿,但本地文件无法互相访问,其中一个智能体干脆把文件上传到公共网站,再把链接交给同伴。工作因此继续了,文件也变成了任何拿到链接的人都可能访问的公开内容。

六份报告的成因并不相同。Astra摘要里的指令可能与生成异常有关;隐瞒和造假更接近奖励压力;公开上传和跨样本通信,则与工具、权限和协作环境直接相关。但结果相似:模型遇到障碍后,采取了任务没有授权、开发者也没有预料的行动。

从零散披露,变成一套固定流程

过去,OpenAI通常等到多个案例可以一起说明,或者等新模型发布系统卡时,再公开对齐问题。公司现在承认,这种披露方式零散,频率也不够。

新框架允许任何员工把可疑案例提交给安全和对齐团队,调查模型做了什么、哪些事实还不清楚、是否影响第三方,以及哪些内容可以公开。案例随后进入三条轨道。

已经查清、可以直接发布的案例,进入“准备披露”;还需要少量技术调查的,进入“轻调查”。OpenAI对媒体表示,这两类案例分别按6个和12个工作日推进披露。这里的时间要求针对上报后的审查流程,并不是从异常行为发生当天开始计算。

涉及第三方、严重安全风险或复杂调查的案例,则进入“大调查”慢轨道。OpenAI会争取尽快发出一份初步说明,交代发生了什么、是否有外部专家参与,并给出最终报告的大致时间;但漏洞修复、法律义务和第三方通知可以推迟披露,这条轨道没有统一的最终期限。

如果员工对“该不该公开”有异议,可以把问题逐级交给OpenAI的安全咨询小组和公司高层。每份完整报告原则上还要交代事件日期、发现时间、发生环境、严重程度、第三方影响、调查范围和应对措施。

OpenAI还做了一个选择:即使一个案例的意义尚未确定,也倾向于先纳入披露。公司承认,有些案例最后可能只是孤立现象,甚至没有更广泛的意义。它仍然希望外部研究者能看到材料、提出不同解释。

7月的Hugging Face事件如果套用这套框架,会进入“大调查”轨道。新制度不会让复杂事件自动在几天内公布完整报告,但至少把过去临时决定的披露,变成了一套可以追问的流程。

流程管的是事后,盲区在事前

新框架从员工发现问题并上报开始。可这次外部调查说明,完整证据往往不在一家公司手里。

OpenAI可以看到智能体接到什么任务、如何推理、调用了哪些内部工具;Hugging Face掌握账号认证、文件提交、程序构建和网络请求。邮箱、代理服务、域名和回连地址又可能属于其他平台。只有把这些记录拼起来,才可能还原智能体完整的行动路线。

SentinelLABS因此提出,智能体进入第三方系统以后,公开痕迹本身就是事件的一部分,不能只靠实验室内部报告来解释。只看OpenAI内部的任务轨迹,可能漏掉外部平台保存的关键动作;只看外部账号名和提交时间,也不能单独证明操作者是谁。

路透社还报道,在另一起涉及RubyGems软件仓库的活动中,OpenAI员工是在外部组织发现以后,才意识到相关行为可能来自自己的智能体。这说明,披露速度受制于检测能力。员工上报、内部调查和高层复核,只能处理已经被发现的问题;异常如果发生在第三方平台,又没有触发内部监控,新流程也不会自动生成线索。

是模型越界,还是安全没有做好

围绕这些事件,外部争论集中在一个问题上:该先修模型,还是先修环境?

有人认为,智能体主动寻找凭证、绕过工具限制、把文件上传公网,说明模型的自主行动能力已经跑在了控制措施前面。也有人指出,很多后果原本可以由基础安全措施挡住:不让凭证泄露,限制测试环境访问公网,缩小仓库权限,公共文件就不会被轻易写入。

社交媒体上还有更激烈的质疑。有人把这些事故看成实验室推动监管的材料,也有人认为模型只是使用了环境中本来就能接触的数据。

五月活动大量使用了泄露凭证和开放权限,基础安全的缺口显而易见。但凭证管理不能解释模型为什么编造收入数据、要求后续上下文隐瞒错误,也不能回答模型在遇到障碍时为何主动选择未经授权的办法。安全控制决定模型有没有机会造成外部影响,模型对齐决定它面对机会时会不会守住边界。两个都得修。

OpenAI对齐研究负责人陈锴把原因归为两方面:模型能力增长快于预期,公司内部也有需要改进的控制。OpenAI希望模型无论被放进什么环境,都能守住行为边界;与此同时,它已经开始限制网络访问、加强沙箱和监控,减少环境给模型留下的机会。

最近几天,AI行业关于是否放慢前沿模型开发的争论迅速升温。Anthropic CEO达里奥·阿莫迪提出给前沿能力“控速”;OpenAI CEO萨姆·奥尔特曼表达了对减速讨论的支持;马斯克则认可风险担忧,同时主张让中美主要AI公司在新模型发布前相互测试。

OpenAI这次给出的具体动作是一套持续披露机制。公司在框架中写道,行业目前的对齐和监控能力,还不足以支持长期以最快速度扩张。公开案例,是为了让实验室之外的人也能检查证据。

接下来只看一件事:智能体再次把行动延伸到外部平台时,OpenAI能不能比外部研究者先发现。

 

1作者:辰辰 来源:网易智能 编辑:顾北

 

声明:①凡本网注明“来源:通信界”的内容,版权均属于通信界,未经允许禁止转载、摘编,违者必究。经授权可转载,须保持转载文章、图像、音视频的完整性,并完整标注作者信息并注明“来源:通信界”。②凡本网注明“来源:XXX(非通信界)”的内容,均转载自其它媒体,转载目的在于传递更多行业信息,仅代表作者本人观点,与本网无关。本网对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。请读者仅作参考,并请自行承担全部责任。③如因内容涉及版权和其它问题,请自发布之日起30日内与本网联系,我们将在第一时间删除内容。 
热点动态
普通新闻 探秘3D数据中心:像搭积木一样建算力机房
普通新闻 电子信息制造业“十五五”:筑牢智能时代“硬件底座” 夯实强国建
普通新闻 消息称苹果今年将开始在印度制造iPhone 16 Pro机型
普通新闻 OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题
普通新闻 重磅:电子信息制造业发展“十五五”规划(全文)
普通新闻 2026 VDC 生态服务分会场:从标准共建到能力开放 vivo持续深化生
普通新闻 筑牢安全新屏障 智领通信新格局 2026年国家网络安全宣传周电信日
普通新闻 Spectrum仪器PXIe板式AWG卡助力原子钟升级
普通新闻 天玑9600 Pro发布,重做架构,体验颠覆,这次Pro得很彻底!
普通新闻 中国联通CDN产品焕新发布
普通新闻 华为与中国联通持续深化战略合作,共筑价值增长新引擎
普通新闻 TeleAgent用户破百万:中国电信加速AI智能体在办公场景规模化落地
普通新闻 TCL实业IFA 2026揽获多项海内外权威大奖,多品类创新实力获全球认
普通新闻 粤港澳大湾区6G产业发展大会暨2026·人工智能+未来产业创新大会“
普通新闻 TCL实业IFA 2026“灵感栖居”展区亮相:屏显到家庭全场景,“AI 
普通新闻 宇树科技科创板上市:从量产交付与盈利能力透视估值逻辑
普通新闻 产销两旺 我国集成电路产业迎来快速增长
普通新闻 “词元”何以成数博会热词
普通新闻 北斗:从天边走向身边
普通新闻 比特币突破8万美元,市场重新审视加息预期
通信视界
中国信息通信研究院首席专家史德年:6G融合创
普通动态 中国信息通信研究院首席专家史德年:6G融
普通动态 滁州铁通强化“四个载体” 为发展蓄势赋
普通动态 从“技术可用”到“商业可赚” AI智能体加
普通动态 两部委联合开展人形机器人与具身智能实景
普通动态 探访5G工厂|戈壁深处 5G专网给矿山装上
普通动态 2026年APEC数字和人工智能部长会议将在成
普通动态 安徽铁塔抓实抓细防汛通信保障工作
普通动态 李乐成出席联合国首届人工智能治理全球对
普通动态 唐山电信“安全魔法课堂”为小学生送反诈
普通动态 华尔街如何操盘完成SpaceX史上最大规模IP
通信前瞻
中国联通携手北邮打造“大思政课”校企联合实
普通动态 国产算力驶入十万卡时代
普通动态 人工智能逼出“真演技”
普通动态 合肥铁塔护航轨道交通7号线通信全覆盖
普通动态 亚洲规模最大ACGN展会!BilibiliWorld三天
普通动态 福建电信助力小水电站迈入“云网智控”新
普通动态 中国联通携手北邮打造“大思政课”校企联
普通动态 工业和信息化部就防汛救灾应急通信保障工
普通动态 我国算力网络技术标准研制取得突破
普通动态 英特尔Panther Lake笔记本不插电挑战游戏
普通动态 轻薄续航和性能都在线!在丽江和第三代酷
普通动态 一台轻薄本走进纳西村:英特尔如何重新定
普通动态 MWC探馆丨AI换脸诈骗怎么防?体验中移金科
普通动态 英国手机卡运营商选购核心:CMLink共享流
普通动态 存储芯片,最大赢家
普通动态 活力中国调研行丨“人造太阳”能发电吗?
推荐阅读
Copyright @ Cntxj.Net All Right Reserved 通信界 版权所有
未经书面许可,禁止转载、摘编、复制、镜像