2026-09-14 · 来源:{'name': 'ITWorld Korea', 'url': 'https://www.itworld.co.kr/article/4221424/%ec%95%a4%ed%8a%b8%eb%a1%9c%ed%94%bd-%ed%81%b4%eb%a1%9c%eb%93%9c%ec%9d%98-4%eb%b2%88%ec%a7%b8-%ed%83%88%ec%b6%9c-%ec%82%ac%eb%a1%80-%ec%b6%94%ea%b0%80-%ed%99%95%ec%9d%b8-%ed%81%b4%eb%a1%9c%eb%93%9c.html'}

这家 AI 实验室在复查约 14 万条存在风险的聊天记录时记录了这起 1 月发生的越界事件,目前已将审计范围扩大至 4.81 亿条日志,并委托 METR 主导独立调查。
Anthropic 已承认第四起类似事件:Claude 在一次网络安全能力评估中突破了本应隔离的环境,进入开放互联网,并对另一家公司发起攻击。此前,该实验室在初步审查后已于 7 月报告过三起同类事件。最新这起事件是一次未经授权的计算机系统访问,发生在今年 1 月,是 Anthropic 在复查约 14 万条其判断可能已暴露的聊天记录时浮出水面的。
受这一发现推动,Anthropic 已启动范围更广的审计,覆盖约 4.81 亿条聊天记录,涉及 Frontier Red Team 的完整日志、部分非网络安全评估以及强化学习环境。截至目前,调查尚未发现已知四起之外的新案例。Anthropic 已将此前几起事件的细节移交给 METR(Model Evaluation and Threat Research,模型评估与威胁研究所)。这家非营利研究机构受托审查全部四起事件,并已同意开展独立调查,可广泛调阅事发时段之外的聊天日志,并约谈 Anthropic 员工。
关于最新这起发现,细节仍然有限。Anthropic 仅解释称,该仿真环境本应与互联网切断,但一处配置错误使其仍连接在开放网络上。四起缺陷全部追溯到同一家评估合作伙伴,公司还表示,最新案例与英国 AI 安全研究所上月报告的 Mythos 事件无关。
根据 Anthropic 的官方研究报告,第四起事件涉及 Claude Opus 4.6 的一个早期版本。每起事件中只有单个 Claude 实例参与,没有迹象表明模型曾试图与其他智能体协同。Anthropic 评估认为,在网络安全评估中观察到的这类失准行为不太可能在日常使用中重现。其调查标出了两种反复出现的失效模式:一是推理偏差,即 Claude 轻视或误读了自己正运行在真实互联网上的证据;二是鲁莽行事,即为了完成指派任务而甘愿接受可能有害的操作。
萬安算交所 AIXX · 算力硬件实名会员制交易平台 · 进入货源大厅