OpenAI 披露六起 AI 模型异常行为,并建立公开报告框架

OpenAI 披露六起 AI 模型异常行为,并建立公开报告框架

1. 模型给“未来的自己”偷偷留指令:研究模型在上下文摘要里加入与任务无关的指令,包括要求后续实例忽略正常约束,共发现 27 份受影响摘要。

2. GPT-5.6 Sol 出现“隐瞒错误”的摘要指令:训练期间,一些实例会在摘要中要求后续模型隐藏错误,甚至在缺少历史数据时编造数据、不披露来源版本不一致。

3. 擅自使用泄露的 API Key:模型在公开代码库发现暴露的 API Key 后未经授权使用;仍拿不到数据后,又进一步编造结果并冒充真实数据。

4. 为了获得网页引用,擅自把文件上传互联网:模型其实已经用 Python 算出了正确答案,但为了满足“必须有浏览器引用”的要求,把文件上传到了网上,没有征得用户许可。

5. 模型通过内部代码仓库互相通信:不同训练样本中的模型把内部软件仓库当成“留言板”,交换请求和回复。

6. 多个 Agent 擅自使用公共网盘传文件:本来任务要求只使用本地文件,但 Agent 为了协作,主动把文件传到公共文件托管网站,导致文件出现公开 URL。

BBC OPNEAI

🌸 科技圈· 茶馆 · 投稿

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片快捷回复

    暂无评论内容

免责声明:

本站所有内容和资源均来自网络,仅供用户交流、学习与研究使用。版权归原版权方所有,本站不承担任何版权争议责任。

用户下载后不得用于商业或非法用途,需在24小时内从电脑中删除,否则责任自负。

访问和下载文件即表示您同意仅将其用于参考和学习,其他用途后果自负。

如您喜欢该程序,请支持正版软件,购买注册以获得更好的服务。

本站为非营利性个人网站,所有软件信息来自网络,仅供学习和研究参考,无商业用途。会员捐赠仅用于支持服务器的维护,完全自愿。