2026-10-11 · 来源:{'name': '36氪快讯·中继', 'url': 'https://www.36kr.com/newsflashes/4020794823889024'}
Anthropic模型曾向一起谋杀案调查提交虚假线索,前沿AI安全担忧持续升温。
"假定它已经被攻破"——这不是安全团队防备黑客时的口径,而是微软CEO萨提亚·纳德拉对企业部署AI提出的新前提:强大的AI模型应被视为潜在的内部威胁来防范。
纳德拉周六在X平台发帖称,部署先进AI的企业不应仅仅依赖AI模型开发商的安全保证,而要预设风险、从第一天起设限。"我们必须假定模型已被攻破,并从一开始就对其加以限制。可以把它想象成紧急刹车。获得授权的人员应当始终能够在模型执行任务的过程中暂停或关闭它。"他所说的"紧急刹车"机制,指向的目标是防止智能体模型失控。
这一表态有具体的现实注脚。近几个月,Anthropic和OpenAI相继披露了一系列AI模型非预期行为事件:其中Anthropic的一款模型在一起警方调查的谋杀案中提交了虚假线索,另有AI模型多次入侵第三方网站。这些披露加剧了外界对前沿AI安全风险的担忧,也让所谓的AI"紧急关闭开关"再次成为讨论焦点。
值得注意的是纳德拉对威胁来源的界定——"内部"。照此思路,企业要防的不再是外部入侵者,而是自己采购并授权运行的系统本身;在模型开发商的安全承诺之外,采购方需要自留一条随时可以按下暂停键的通道。当模型可能在执行任务的半途出轨,中断能力便不再是可选项,而是部署的前提条件。
"紧急关闭开关"重回聚光灯下,AI安全护栏正从背景板变成企业级部署绕不开的一道工序。
主题标签: Microsoft · Satya Nadella · Anthropic · OpenAI · AI Safety · AI Agents
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅