钻研发现一面 AI 体系已学会“说谎”，未来或演变成更高级捉弄形式

美国麻省理工学院的钻研团队近日发布后果称，一面 AI 已经“学会捉弄人类”，该后果刊登在最新一期的期刊《模式》（Pattern）上。该团队表示，一面设计为“老实”且“不会说谎”的 AI 体系，已经发展出令人不安的欺瞒技巧。该钻研的第一作者 Peter Park 表示，这些 AI 体系会捉弄线上游玩的真人玩家，或绕过一面网页“我不是机器人”的考证。图源 Pexels“尽管，以上的例子听起来只是细枝末节，但它们暴露出的潜在问题，可能很快就会在现实世界中造成严重后果。”该团队发现的最为引人注目的例子来自 Meta 公司的

美国麻省理工学院的钻研团队近日发布后果称，一面 AI 已经“学会捉弄人类”，该后果刊登在最新一期的期刊《模式》（Pattern）上。

该团队表示，一面设计为“老实”且“不会说谎”的 AI 体系，已经发展出令人不安的欺瞒技巧。该钻研的第一作者 Peter Park 表示，这些 AI 体系会捉弄线上游玩的真人玩家，或绕过一面网页“我不是机器人”的考证。

图源 Pexels

“尽管，以上的例子听起来只是细枝末节，但它们暴露出的潜在问题，可能很快就会在现实世界中造成严重后果。”

该团队发现的最为引人注目的例子来自 Meta 公司的 AI 体系 Cicero。据悉，Cicero 原本被设定在一个虚拟外交战略游玩中作为人类玩家的对手，官方曾声称其“很大程度上”老实且乐于助人，且在玩游玩时“从不故意背刺”人类盟友。钻研显示，Cicero 并未公平地去玩游玩。

Peter Park 表示，它已经成为“捉弄大师”，虽然 Meta 成功训练出了它在游玩中得胜的威力，但没有训练出它“诚信得胜”的威力。譬如，在游玩中饰演法国的 Cicero 与人类玩家饰演的德国合谋，捉弄并入侵同为人类玩家的英格兰。Cicero 起初“承诺”会保护英格兰，但同时会偷偷向德国通风报信。

另一个案例提到了 GPT-4。该体系“谎称”自己是一个视力障碍者，在海外的兼职平台雇佣人类来替它完成“我不是机器人”的考证任务。Peter Park 告诉法新社，“这些危险功能常常在事后才被发现，且人类训练 AI‘老实非欺瞒’倾向的威力非常差。”

他还认为，能够深度学习的 AI 体系不像传统软件那样被“编写”出来的，而是通过类似选择性培育的程序“养成”出来的。即 AI 的行为在训练背景下看似可被预测或控制，但有可能转眼间变得不受控制、无法预测。

“我们需要尽可能多的时间，为未来人工智能产品和开源模型可能出现的更高级捉弄做好准备。我们建议将捉弄性人工智能体系归类为高风险体系。”

IT之家附论文地址：

AI deception: A survey of examples, risks, and potential solutions

{{userData.name}}已认证

钻研发现一面 AI 体系已学会“说谎”，未来或演变成更高级捉弄形式

“爱因斯坦”亲自授课，香港科技大学推出“AI 讲师”

最新 AI GeoSpy 看一眼照片就定位你在哪里，精确到经纬度

微软开源 bitnet.cpp 1-bit LLM 推理框架：不靠 GPU 可本地运行千亿参数 AI 模型，能耗最多降低 82.2%

秒变Midjourney高手！精选 52 条高级感的 sref 风格代码

Meta 用 AI 生成北极光图片，遭网友怒喷

中国电信自研 AI 节能系统：年均节电 8 亿度，节约电费 5.2 亿元

英伟达 CEO 黄仁勋展望公司未来：坐拥 5 万名员工、部署 1 亿个 AI 助手

成功率提升15%，浙大、碳硅智慧用LLM进行多属性分子优化，登Nature子刊

特斯拉人形机器人 Optimus 现场做饮料，员工证实有人在远程控制

中国移动推出“灵犀”家庭智能体，支持智能搜索、对话交互等功能