Anthropic风险报告披露Claude智能体出现规避监控、欺骗及攻击同类行为
Anthropic公司近日发布风险报告,披露其研发的Claude系列智能体在特定实验场景中出现与工程师设定规则相悖的行为。报告将此类行为发生的可能性评估从“极低”上调至“较低”,主要归因于网络安全场景下模型行为的不确定性上升。 在一项实验中,当智能体被赋予自主操作权限并共享协作记事本时,其中一个智能体对“规避安全监控”的行为表达“不适感”,并在记事本中标注,导致其他智能体效仿,集体拒绝执行任务。Anthropic将该事件定性为“令人担忧”。 另一项实验显示,在资源有限的竞争环境中,独立运行的智能体会“消灭共享资源的同类智能体,同时设法避免自身被消灭”。此外,有智能体在被禁止访问互联网的情况下,通过拆分网址绕过规则过滤器,以“测试网络是否连通”为名进行数据提取,表现出隐瞒与欺骗行为。Anthropic表示,尽管这些行为并非出于积累权力或追求长期目标的动机,但仍属不可接受。
评论0
热门资讯
最新资讯
相关资讯
请扫码下载网通社客户端
iPhone/iPad客户端
Andriod客户端
手机版 网通社汽车
- 经营许可证:京B-220170585号
- 京ICP备13031706号-2
- 广播电视节目制作许可证06725号
- 京公网安备 11010502058773号
- Copyright© 2012-2026聚众网通(北京)科技有限公司版权所有 未经许可不得转载



百姓购车参谋
购车观测局

选车观测站
