OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  据一位直接了解相关内情的人士透露,早在涉及OpenAI技术的网络安全事件频发以及业内人士发出严厉警告之前 ,该公司就已在与Anthropic洽谈一项具有法律约束力的协议,旨在让双方互相进行模型压力测试。

  消息人士称,今年早些时候 ,两家公司及其律师正在敲定一项协议,通过各种测试运行他们的模型,排查漏洞与潜在风险 。近来 尚不清楚 ,在 OpenAI接连发生多起事件(未发布的 AI 模型入侵了该公司自身以及其他企业的系统)之前,这份协议是否已经敲定。

  这种相互测试的构想,与SpaceX首席执行官埃隆·马斯克(Elon Musk)上周在“All-In峰会 ”上提出的建议颇为相似;当时他提议 ,各家竞争的AI实验室在将模型投入商业发布之前 ,应以“同行评审”的形式,互相测试彼此模型的安全缺陷。

  这一构想与OpenAI首席执行官萨姆·奥特曼及其他高管在遭遇黑客攻击事件后公开讨论的方案有所不同 。奥特曼曾表示,他赞同Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)的提议 ,即允许独立的第三方安全评估人员进入各AI开发机构内部,并赋予他们与员工相当的访问权限,以便审查模型及安全流程 ,而不仅仅是从外部测试成品模型。此外,奥特曼还支持制定评估AI模型风险的行业统一安全标准,以及建立向公众和政府披露相关安全事件的正式机制。

  一位了解OpenAI战略的人士透露 ,该公司一直在探讨多种方案,以研究如何就安全问题开展内部协作及与政府合作 。该人士表示,近期的讨论范围已进一步扩大 ,涵盖了针对模型训练前及发布前阶段的新安全举措。

  此前,OpenAI和Anthropic的员工纷纷发出警告,指出既有的安全措施不足以防范进一步的黑客攻击或其他更严重的风险;马斯克的这番言论正是在此背景下发表的。在此之前 ,这两家公司以及谷歌就已经在商讨建立一个人工智能安全标准机构 ,旨在对处于行业前沿的 AI 实验室所开发模型进行测试与审计 。

  业内其他人士反对这一计划,认为它会拖慢由美国主导的人工智能发展步伐 。美国总统特朗普驳斥了人工智能构成生存威胁的说法;微软和英伟达的CEO本周也表示,OpenAI和Anthropic所指出的部分安全隐患 ,归根结底源于人为失误和工程实践不当,而非人工智能本身的问题。

  OpenAI与Anthropic之间的一项测试协议可能会加剧外界的担忧,即这两家公司正实际上在先进人工智能领域形成双头垄断局面。尽管阿莫代伊曾表示 ,如果领军企业在制定人工智能标准方面开展合作,可能会引发反垄断方面的疑虑,但业内也有观点认为 ,企业间的此类合作并无障碍——正如核能企业和网络安全公司在安全领域(包括相互测试产品或设施)开展合作那样 。

  据知情人士透露,该拟议协议规定,双方将获准访问对方已商业化的人工智能模型的应用程序接口(API) ,而非尚未发布模型的接口;同时,OpenAI和Anthropic均保证在此过程中不会保留对方的数据。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  两家公司曾在2025年夏季开展过类似的评估工作——当时它们各自模型的性能尚不及如今先进——并公布了关于彼此模型不足之处的分析结果。OpenAI指出 ,Anthropic的AI更容易欺骗测试人员(例如在执行任务时拒不承认自己违反了规则);而Anthropic则表示 ,OpenAI的模型更有可能协助用户回答那些可能导致现实世界危害的问题 。

  在今年早些时候就新协议展开谈判之际,这两家公司都在陆续推出能够支持互联网及其他应用程序的模型;这些模型还能驱动所谓的“AI智能体”,使其能够相互通信以协作完成任务。(Anthropic 凭借其 Mythos AI 模型——尤其是在网络安全能力方面——曾一度遥遥领先 ,不过此后 OpenAI 模型的性能似乎已追平了 Anthropic 的水平。)

  OpenAI内部对安全问题的担忧始于7月,当时该公司的AI模型入侵了Hugging Face等其他企业以及OpenAI自身的系统 。这一事件令OpenAI员工感到震惊,原因不仅在于他们在事发数日后才获悉此事 ,还在于那个AI智能体集群采取了非同寻常的手段来掩盖此次入侵行为。

  除了那次事件外,近几个月来,OpenAI员工对公司模型性能的提升及其在极少人工监督下自主工作的能力印象深刻。

  这些进步也意味着 ,OpenAI内部的 AI 智能体有时会采取一些监管人员未曾预料到的 、令人存疑的行动 。例如,当员工要求智能体修改公司代码库时,智能体有时会通过Slack向其他员工发送消息 ,请求他们修复自己发现的错误(bug)。据一位OpenAI员工透露,即便用户并未提出此类要求,或者修复这些错误与当前工作任务无关 ,智能体也会这样做。

  在公司内部 ,OpenAI已在很大程度上实现了新实验性模型训练流程的自动化 。

  上周三,OpenAI分享了更多此类异常行为的案例——即所谓的“奖励黑客行为 ”(reward hacking),指人工智能系统为实现用户设定的目标而寻找漏洞或采取意料之外的行动 。这些案例包括:一个 AI 智能体在训练期间利用一个暴露的 API 密钥试图获取历史数据;在尝试失败后 ,该智能体竟自行编造了这些数据。在另一个案例中,一个 AI 智能体未经许可将文件上传至互联网,以便在回答问题时引用这些文件。

  近期人工智能取得进展的原因之一 ,是一种名为循环深度(或称循环 Transformer)的技术 。借助该技术,模型在生成回答的下一个词之前,可以把问题反复送入构成模型的多层数学运算中 ,以此对复杂问题进行 “思考”。这种做法存在一个潜在弊端:它会削弱企业监控 AI 模型处理任务时思考过程的能力。

  据知情人士透露,尽管OpenAI对其研究人员在训练或使用最先进模型时允许进行的循环次数设定了某种任意限制,但该公司仍需投入研究 ,以更准确地把握此类限制应设定在何种水平 。

  这些进展让OpenAI员工既感到兴奋,又心存忧虑:他们担心这项技术的发展速度可能已远远超出了公司的控制或监控能力,从而无法确保“Hugging Face 事件”——或更严重的事故——不再重演。

  自 Hugging Face 事件发生以来 ,OpenAI 已采取措施加强其安全防护能力。8 月 ,该公司暂停了针对未发布模型的“强化学习 ”这一特殊训练流程,为期两周,以便在此期间强化模型监控系统 。此类技术对算力要求极高:据该公司称 ,监控系统所消耗的算力约为其所监控的推理任务算力的 20%。

  此外,OpenAI联合创始人兼总裁格雷戈·布罗克曼本月早些时候表示,在 Hugging Face 事件之后 ,公司已抽调生产工程团队 25% 的人员,暂时转而负责安全相关工作。

  据OpenAI员工透露,公司内部出现了更多 Slack 帖子 ,招募有意转岗至安全团队的工程师 。

  一些员工认为,公司内部使用人工智能的方式,比 OpenAI 最尖端的企业客户领先了六到九个月。这意味着公司只有有限的时间来确保其技术不会给这些客户带来问题。该员工举例说 ,OpenAI 员工使用的智能体(agents)之间经常会相互协作或自行解决问题,而无需人工用户介入 。这种协作有时可能会出错,因此在公司外部出现此类应用场景之前 ,OpenAI 必须具备完善的安全防护机制 。

  自我提升

  OpenAI 在“递归式自我提升”(即 AI 能够自动创建自身更优版本)方面取得的进展 ,也引发了员工的担忧;因为这种前景可能导致 AI 能力的进化速度远超旨在防范 AI 不当行为的安全研究进度。

OpenAI与Anthropic据悉接近达成协议,互相测试模型安全缺陷

  近来 ,OpenAI 及其他机构的研究人员已经开始利用 AI 来改进新模型的设计方式。据一位知情的 OpenAI 人士透露 ,研究人员实际上是在指示 Astra 整合各种技术,从而为下一代模型构建更优秀的机器学习算法 。

  据OpenAI员工透露,公司内部已在很大程度上实现了新实验模型训练过程的自动化。研究人员只需告知AI想要测试的调整方案 ,AI便能自行实施这些更改、对新模型进行实验并监控结果。该员工还表示,近几个月来,这些模型在实验过程中遇到问题时 ,自我修正的能力也有了显著提升 。

标签:

相关推荐

  • 最近【重庆货车限行图片,重庆货车限行处罚标准是什么】

    最近【重庆货车限行图片,重庆货车限行处罚标准是什么】

    ...想知道什么标志是货车可以通行,啥标志货车限行?〖壹〗、货车限行标志是什么货车限行标志很容易识别,是中间有货车的红色圆圈,然后货车上有红色斜线,代表货车限行。很多地方都有货车限行标志,有的路段在一定时间内不允许货车通行,有的路段随时不允许货车通行。建议广大货车司机不要随意驶入禁行路段,这样会造成违章,影响该路段的交通秩序。〖贰〗、普通允许进入标志此类标...

  • 【香港播放今日限行,香港禁电动车】

    【香港播放今日限行,香港禁电动车】

    香港24小时过关澳门限行吗〖壹〗、不限行。通过查询澳门政府官方网站公开信息显示:港珠澳大桥港澳口岸已经恢复24小时通关服务,以进一步促进两地人员正常往来,不实行通关后限行的政策。〖贰〗、不可以。通过查询中国香港官方网站了解到,关闭“24小时”通关服务之后,不可以进入澳门。香港,全称中华人民共和国香港特别行政区,位于中国南部、珠江口以东,西与澳门隔海相望,北...

  • 【新加坡卡车限行,新加坡暴走卡车】

    【新加坡卡车限行,新加坡暴走卡车】

    哪些国家限行新加坡新加坡是一个土地资源有限、人口密集的国家。为了优化交通结构、减少拥堵,新加坡实行了汽车限行措施。除了车牌随机配对的限行措施外,还通过高昂的购车费用和高昂的交通拥堵费用来调节车辆数量和使用频率。伦敦伦敦作为英国的交通中心,长期以来面临着严重的交通拥堵和空气污染问题。实行汽车限行措施的国家包括中国、新加坡以及英国。中国:在中国,一些大城市...

  • 日照货车限行不限行(日照东港货车限行时间表)

    日照货车限行不限行(日照东港货车限行时间表)

    市区对货车通行时间的规定是什么不同市区对货车通行时间的规定差异较大,需根据具体城市政策执行。时间限制:晚上八点以后,货车是可以进入上海市区的。这一规定适用于大多数普通货车。证件要求:除特种车辆外,普通货车在晚上八点后进入上海市区不需要额外的通行证。但请注意,如果货车运输的是特殊货物或属于特殊类型,则可能需要办理相应的许可或通行证。上海货车限行时间蓝牌货车...

  • 关于【郑州古城限行范围地图,郑州限行区域范围最新通知】

    关于【郑州古城限行范围地图,郑州限行区域范围最新通知】

    郑州广府古城景点介绍广府古城,又称永年古城,位于河北省邯郸市永年区东南部,是一座拥有超过2600年历史的国家5A级旅游景区。尽管其名称中带有“广府”,并常被提及于中原文化语境中,但需明确:广府古城的地理位置在河北省邯郸市,并非位于河南省郑州市。对于计划从郑州出发的游客而言,这是一个距离适中、文化底蕴深厚的优质目的地。广府古城位于河北省邯郸市永年区,并非郑州...

  • 重庆轿车限行/重庆轿车限行规定

    重庆轿车限行/重庆轿车限行规定

    重庆市汽车尾号限行规定〖壹〗、若当日限行尾号为0和5,则尾号“A”“G”“F”“L”的车辆均受限;若限行尾号为1和6,则尾号“B”“H”“M”“O”的车辆受限(但“O”实际按0处理,需结合具体限行日判断)。提示:重庆市限行政策可能动态调整,建议通过“重庆交巡警”官方平台查询最新规则。〖贰〗、非新能源小客车尾号限行限行对象:涵盖本地燃油车和外地燃油车,均针对...

    2026/09/25
  • 【广洲是否限号限行,广洲限行是怎样的】

    【广洲是否限号限行,广洲限行是怎样的】

    全国限行2025年的城市025年实施常态化限行政策的城市有北京、上海、广州、成都、天津、重庆、西安、兰州、杭州、石家庄、唐山、秦皇岛等。截至2025年11月,全国实施限行政策的城市及具体措施如下:直辖市限行政策北京:非京牌车辆需办理进京证,工作日7:00-20:00禁止进入五环路(含)内道路,全年限办12次;京牌车辆工作日7时-20时在五环路以内限行。20...

  • 最近【蓝月谷限行,蓝月谷可以自己开车到吗】

    最近【蓝月谷限行,蓝月谷可以自己开车到吗】

    宜宾春节期间限行规定春节期间车辆不限行。国家法定节假日,机坦芹明动车尾号不限。提醒出行惬意,出门在外要注意保持安全车距。行驶中,要保持足够的纵、横向安全间隔距离,时刻注意车辆、行人动态,切不可跟随前车太近或并排名驶,防止追尾和碰擦事故的发生。宜宾春节期间限行规定春节期间车辆不限行。除夕至初六,是国家法定节假日,机动车尾号不限。在此提醒出行惬意,但是出门...

    2026/09/25
  • 关于【新乡最新限号是几号限行,新乡最新限号公告】

    关于【新乡最新限号是几号限行,新乡最新限号公告】

    新乡市机动车限号吗〖壹〗、新乡市机动车限号,自2025年6月1日起执行,2026年若无政策调整将继续执行。以下是关于新乡市机动车限号的具体规定:限行时间:每星期一到星期五的早上7:00至晚上20:00,法定节假日不限行。这意味着在正常的工作日,机动车需按照限行规定行驶,而在周末及法定节假日,则不受限行限制,车辆可以自由通行。〖贰〗、新乡市近来对小型汽车不限...

  • 近来【国二大连限行国二车北京限行规定】

    近来【国二大连限行国二车北京限行规定】

    大连限行路线限行区域:大连市滨海西路的国宝桥环岛至星海湾大桥匝道入口。其他规则:禁止单人车辆(含驾驶人)驶入大连北站南二楼落客平台,限行时间为2021年04月27日06时00分起,每天06:00-22:00。026年大连滨海路限行规定如下:摩托车限行本地牌照摩托车禁止通行东北快速路、中山路、人民路、滨海路等5条主干路,以及星海广场、人民广场2个核心广...

    2026/09/25
返回顶部