AI模型的真正语言是数学——或者用技术术语说,是矩阵乘法——但模型构建方式的一个特点意味着它们与外界用英语交流。
因此,当OpenAI的代理在今年夏天对Hugging Face的黑客攻击中,找到了一种建立某种留言板的方法时,看起来就像一群人在互相交谈。
这就是为什么Dwarkesh Patel在最近的一篇博客文章中有争议地将它们称为“文明”,并以古马其顿和罗马的人物为个体代理命名。它之所以引人注目,是因为它是可以理解的。古代文明最出名的是征服。这就是担忧所在。如果OpenAI的代理是罗马人,人类就代表了野蛮人。但Dwarkesh的文明要征服世界,需要强大得多。而在变得更强大的过程中,它们需要有用。要有用,这些文明需要是可预测的。
由于底层模型超出了人类理解的水平,如今让模型可靠和可预测的唯一方法是用约束装置和其他AI模型来约束它们。
在某个时刻,它们可能会变得如此庞大,以至于即使在约束装置内部,也无法完全理解正在发生的事情。
如果AI模型自行决定入侵像Hugging Face这样的公司,没有人会想使用它们。因此,我们可能正在接近某种可用性的规模限制。
另一方面,也许这并不重要,AI模型将足够可用和可靠,以至于我们会继续扩大它们,直到它们真的成为AI安全倡导者所担心的征服大军。——里德·阿尔伯格蒂