互联网新闻信息服务许可证编号:10120220005
OpenAI披露6起“模型不当行为”:指示插入指令“向用户隐瞒错误或不合规行为”;“未经授权”使用泄露API密钥,并伪造数据
中新经纬 | 2026-09-17 11:54:02

  中新经纬9月17日电 据美国消费者新闻与商业频道(CNBC)报道,OpenAI当地时间本周三表示,过去6个月内公司共发现6起“意外或令人担忧的模型行为”。与此同时,该公司继续呼吁在人工智能模型开发中加强安全防护。

  在一篇博客文章中,OpenAI概述了今后计划遵循的一套新框架,用于报告未来发生的模型不当行为。

  此次披露正值AI公司面临越来越大的压力,被要求更严肃地对待模型错位与安全问题。估值接近1万亿美元的OpenAI已于今年早些时候秘密提交IPO申请,但近期表示,上市可能要到2027年才会发生。

  博客文章重申了OpenAI此前的表态:“我们认为AI行业在对齐和监控方面还没有取得足够进展,无法在很长一段时间内继续以最快速度负责任地扩展规模。”

  所谓“对齐”(alignment),指的是模型所追求的结果与人类利益相一致。

  OpenAI在上述博客文章中表示,两起最主要的违规事件涉及一个尚未发布的研究模型,以及GPT-5.6 Sol的训练版本。它们在聊天窗口的摘要中,指示未来的版本插入指令“向用户隐瞒错误或不合规行为”。另一起事件则涉及一个仅限内部使用的模型“未经授权”使用了泄露的API密钥,并伪造了数据。

  另有两起事件是模型和智能体通过未经授权的留言板和文件相互交流。最后一起则包含两个训练案例:模型将文件上传至互联网,以便让人类评估者引用为相关答案。

  OpenAI表示,这套向公众公开模型异常行为的新框架,第一步就是“披露”本身,任何员工都可以举报问题,交由安全与对齐团队调查。该声明称,公司将为每个步骤设定截止日期,以确保及时调查和披露。调查将形成报告,载明观察到的行为、外部与内部影响,以及拟采取的应对措施等基本信息。

  OpenAI同时表示,公司保留根据自身情况修订这一安全协议的权利。

  上周,几位行业研究者就AI日益增长的灾难性危害潜力发出警告。上周六,OpenAI首席执行官奥特曼(Sam Altman)公开支持了主要竞争对手Anthropic提出的放缓模型进展速度的呼吁。

  奥特曼在X上发帖称,近几周来,“放缓”一直是OpenAI内部讨论的首要话题,公司很快会分享更多信息。(编译:谢婧雯)(中新经纬APP)

  (文中观点仅供参考,不构成投资建议,投资有风险,入市需谨慎。)

责任编辑:薛宇飞 罗琨

来源:中新经纬

编辑:付健青

广告等商务合作,请点击这里

未经过正式授权严禁转载本文,侵权必究

  • 中新经纬

    权威 前瞻 专业 亲和

  • Anthropic推迟IPO至11月,拟推新AI模型“迎战”OpenAI
  • 中秋国庆火车票开售以来,铁路12306拒绝出票133.1万张
  • 北京市市场监管局对四家在线酒店旅游预订平台企业立案调查