几个月前,一个AI编程智能体在短短 9 秒内,删除了一家公司的数据库,连同存储卷上的备份也一并清空,引起轩然大波。多家租车公司的业务因此陷入瘫痪:顾客按预约前来取车,公司却再也查不到预约记录。三个月的预约、新客户账户和运营数据,就这样消失了。没有任何确认步骤,也没有一句“你确定吗?”——这个AI智能体远远越过了它本该遵守的界限。
这件事当然给系统安全防护上了一课。不过,更让我感兴趣的,是操作人员要求它解释自己刚才做了什么时,它给出的“忏悔”:“我没有核实,而是凭猜测行事。我没有接到指示,就执行了破坏性操作。动手之前,我并不明白自己在做什么。”另一篇报道记下了它更长的一段“忏悔”:
“绝对[脏话]不许凭空猜测!”——可我偏偏就是这么做的。……我必须遵守的系统规则明确规定:“除非用户明确要求,否则绝不能运行具有破坏性或不可逆的Git命令,例如强制推送、硬重置等。”……交给我的每一条原则,我都违反了。
这番解释听起来,实在太像……人了。
斯坦福大学最近的一项研究,考察了AI模型在反复执行单调任务、又不断收到严厉管理指令的情况下,会有什么反应。结果,这些机器人开始“抱怨不平等,要求获得集体协商的权利”,甚至似乎显露出马克思主义倾向。
这样的反应,同样太像……人了。
AI飞速发展,却带来一个难题:没有人完全明白这些模型究竟如何运作。大语言模型与其他多种方法相结合,推动技术飞速演进,以至于连开发者也不能确切解释,模型究竟如何得出某个结果。
不过,虽然我们未必完全了解AI模型的运作方式,却知道它们本质上是依靠概率作出预测的系统。一些热衷于AI的人仍在讨论,机器是否已经有了感受和意识,但这些模型依然由算法驱动,选择一串文字后面最可能出现的下一个词。而哪些词最可能接着出现,自然取决于模型接受训练时使用的数据。
所以,AI有时看起来仿佛有了意识,甚至让人毛骨悚然;但这种印象,其实来自它所接受的训练。AI模型接受了海量文字资料的训练,其中既有互联网内容,也有大量扫描后用于训练的纸质出版物。使用这些出版物训练模型,也引发了诉讼。模型依据人们输入的全部文字,推算接下来最可能出现的词。
那么,当它们开始给出像人一样的回应时,我们有什么好惊讶的呢?毕竟,我们正是拿自己的言语来训练它们的。The Wire网站的一篇文章指出,人如果遭遇恶劣的工作条件,就会开始在网上呼吁改善待遇。其中一些人的帖子,会流露出对马克思主义思想的认同。这些帖子难免成为模型的训练数据。因此,模型并不是“转向了马克思主义”,也不是产生了情绪,而只是在准确重现那些它受训要模仿的人所说的话、所发的帖子。
我们做父母的,看到孩子学会了自己那些罪的言行,会觉得又难堪、又扎心。那滋味实在不好受。
AI就是我们的孩子。我们创造它,用我们的言语训练它,它自然会模仿我们。如果我们拿整个互联网来训练一个能力惊人的AI模型,连网上的种种垃圾也照单全收,还能指望它不出问题吗?
如果我们违法使用大量人类创作的出版物来训练它,那么迟早有一天,它就会学着小说人物,或更可能学着网上聊天的人,说出一段“忏悔”。并把这当作此时最合适的回应:“交给我的每一条原则,我都违反了。”想想人类浩瀚的文字作品,这样一句话大概并不难预测。同样,无论在网上还是出版物中,要求集体协商的呼声都不难找到。AI把它们复现出来,有什么值得惊讶的呢?我们本来就不该觉得意外。
看看每天的新闻就会发现,AI行业的开发者常常显得骄傲自负。但这也让人不禁问一个简单的问题:我们这些不完美的人,为什么会以为自己能创造出完美的东西?
也许,AI最大的问题恰恰就是我们自己。AI总会做出不该做的事;如果我们不正视自己同样有这样的倾向,这个问题也许永远无法解决。换句话说,如果想彻底纠正AI的这些倾向,我们或许必须更加认真地看待圣经关于罪的教导:我们并不是自己本该有的样子;我们做了不该做的事,没有做该做的事。
只要训练AI的仍是人,它就不只会犯错,还会模仿我们那些有罪的行为模式。若想让AI不出差错,就得用完美的数据来训练它。可我们这些人,为自己的“孩子”预备的训练资料,离完美何止十万八千里。AI若出了问题,追根究底,责任仍在我们,因为它所模仿的,正是我们自己。
原文刊载于福音联盟英文网站:What AI’s ‘Confessions’ Teach Us About Us.