艾伦·图灵在20世纪50年代提出的人类水平机器智能的愿景如今已成为现实。保持清醒的头脑,不受恐惧或炒作的蒙蔽,将有助于我们为接下来的发展做好准备。

1950 年,艾伦·图灵在一篇题为《计算机器与智能》的论文中提出了他的“模仿游戏”。现在被称为图灵测试,它探讨了一个看似纯粹假设性的问题:机器能否展现出人类思维所特有的那种灵活、通用的认知能力,从而能够将自己冒充为人类,让不知情的人类误以为是人类?
75年后,答案似乎是肯定的。2025年3月,由位于加利福尼亚州旧金山的OpenAI公司开发的大型语言模型(LLM)GPT-4.5在图灵测试中被人类判断为人类的准确率高达73%——甚至高于人类的准确率²。此外,读者甚至更喜欢由LLM生成的文学作品,而不是人类专家撰写的作品³。
这远非全部。法学硕士们在国际数学奥林匹克竞赛中斩获金牌,与顶尖数学家合作证明了定理⁴,提出了经实验验证的科学假设⁵,解答了博士考试中的难题,协助专业程序员编写代码,创作诗歌等等——包括与世界各地数亿人进行全天候聊天。换句话说,法学硕士们展现出了许多迹象,表明他们具备图灵所关注的那种广泛而灵活的认知能力——我们现在称之为“通用智能”,尽管图灵本人并没有使用这个术语。智能的未来是什么?答案或许就藏在其演化历程中。
然而,许多专家对称当前的人工智能模型展现出通用人工智能(AGI)持保留态度——有些人甚至怀疑它们是否真的能够达到AGI的水平。2025年3月,位于华盛顿特区的美国人工智能促进协会(AAAI)进行的一项调查发现,76%的顶尖研究人员认为,扩大当前人工智能方法的规模“不太可能”或“极不可能”产生AGI(参见go.nature.com/4smn16b)。
这种脱节现象该如何解释?我们认为,问题一部分在于概念层面,因为通用人工智能(AGI)的定义含糊不清且前后矛盾;一部分在于情感层面,因为AGI引发了人们对社会动荡和颠覆的恐惧;还有一部分在于实际层面,因为这个术语与商业利益纠缠不清,可能会扭曲评估。正因为AGI在公共话语中占据主导地位,我们才更应该以一种更为客观的视角来探讨这个概念:将其视为一个关于智能的问题,而不是对社会动荡的迫切担忧,或是对商业合同中一个永远无法完成的里程碑的担忧。
在撰写这篇评论时,我们从哲学、机器学习、语言学和认知科学等不同角度探讨了这个问题,并在广泛讨论后达成共识。接下来,我们将阐述我们为何认为,一旦澄清某些混淆之处,力求进行公平的比较并避免以人类为中心的偏见,结论便显而易见:按照合理的标准(包括图灵的标准),我们已经拥有了普遍智能的人工智能系统。长期以来,创造通用人工智能(AGI)的难题已经得到解决。认识到这一点至关重要——对于政策制定、风险评估以及理解心智的本质乃至世界本身都意义重大。
定义问题
我们假设(正如我们认为图灵会做的那样),人类拥有通用智能。有些人认为通用智能根本不存在,即使在人类身上也是如此。尽管这种观点自洽且在哲学上很有趣,但我们在此暂且搁置它,因为它与大多数人工智能讨论脱节太深。但是,既然我们已经做出了这个假设,我们应该如何定义通用智能呢?
关于通用智能的一个常见非正式定义,也是我们讨论的出发点,是:一个系统能够完成几乎所有人类能够完成的认知任务。哪些任务应该列入这个清单引发了诸多争论,但“人类”一词也隐藏着一个关键的歧义。它指的是每项任务的顶尖人类专家吗?如果是这样,那么没有人符合条件——玛丽·居里获得了诺贝尔化学奖和物理学奖,但她并非数论专家。它指的是一个在各个领域都具备全面能力的综合型人类吗?这似乎也是一个很高的标准——阿尔伯特·爱因斯坦彻底改变了物理学,但他不会说普通话。人工智能距离人类智能水平有多近?
如果一个定义将几乎所有人类都排除在外,那么它就不是对通用智能的定义;它关注的是其他东西,或许是理想的专业技能或集体智慧。相反,通用智能指的是认知能力的广度和深度,而“广度”则以典型案例为依据。广度指的是跨多个领域的能力——数学、语言、科学、实践推理、创造性任务——这与“狭义”智能(例如计算器或国际象棋程序)截然不同。深度指的是在这些领域内的卓越表现,而不仅仅是浅尝辄止。
人类的通用智能存在程度和差异。儿童、普通成年人以及像爱因斯坦这样公认的天才,都拥有不同水平和类型的通用智能。每个人在不同的领域各有所长或有所不足。同样的灵活性也应适用于人工智能系统:我们应该探究它们是否具备与人类通用智能水平相当的核心认知能力。
我们并非试图给出定义,而是借鉴真实和假设的普遍智能案例——从爱因斯坦到外星人再到先知——来勾勒出这一概念的轮廓,并对其进行更系统的完善。我们的结论是:只要个体人类拥有普遍智能,那么当前的法学硕士也拥有普遍智能。
通用智能不是什么
我们可以先找出四个并非通用智能所必需具备的特征。
完美。我们不会期望物理学家达到爱因斯坦的洞见,也不会期望生物学家复制达尔文的突破性发现。即使在专业领域内,也很少有人能做到完美无缺。人类的通用智能并不需要完美;通用人工智能(AGI)也不应该如此。
普遍性。没有哪个人类个体能够完成所有认知任务,其他物种也拥有超越我们自身的能力:章鱼可以独立控制其八条触手;许多昆虫能够感知人类无法看到的电磁波谱。通用智能并不要求普遍掌握这些技能;通用人工智能(AGI)也不需要面面俱到。
人类相似性。智能是一种功能属性,可以在不同的载体上实现——图灵在1950年就提出了这一点,他当时将人类生物学排除在外¹。展现通用智能的系统无需复制人类的认知结构或理解人类的文化参照。我们不会要求智能外星人做到这些;这同样适用于机器。
超级智能。这个词通常用来指在几乎所有领域都远远超越人类认知能力的系统。超级智能和通用人工智能(AGI)经常被混淆,尤其是在商业领域,“超级智能”往往意味着经济动荡。没有任何人类能够达到这个标准;因此,这也不应该成为通用人工智能的必要条件。
一系列证据
那么,什么是通用智能?目前并没有一个明确的“界限”来检验它是否存在——任何精确的阈值都必然是人为设定的。这或许会让那些想要精确标准的人感到沮丧,但这种模糊性恰恰是它的特点,而非缺陷。“生命”和“健康”之类的概念难以被清晰定义,却依然有用;我们无需精确的界限就能识别出典型案例。人类就是通用智能的典型例子;而袖珍计算器尽管拥有超人的计算能力,却不具备通用智能。
当我们评估他人的总体智力或能力时,我们不会试图窥探他们的内心来验证理解能力——我们是通过他们的行为、对话和解决问题的能力来推断的。没有任何一项测试是绝对权威的,但证据会不断积累。这同样适用于人工智能系统。
正如我们通过逐步提高难度的测试(从基本读写能力到博士学位考试)来评估人类的一般智力一样,我们可以考虑一系列难度越来越高的证据,这些证据可以让我们越来越有信心相信通用人工智能(AGI)的存在。
图灵测试水平。其衡量标准相当于基础学校教育:通过标准学校考试、进行基本的对话以及进行简单的推理。十年前,达到这些标准或许会被广泛接受,作为通用人工智能(AGI)存在的足够有力证据。

专家级。在这个级别,要求更高:在国际竞赛中获得金牌,解决跨多个领域的博士考试题,编写和调试复杂的代码,精通数十种编程语言,能够提供有用的前沿研究协助,以及胜任各种创造性和实践性问题解决能力,从论文写作到旅行规划,无所不能。这些成就远超科幻作品中对通用人工智能(AGI)的诸多描述。斯坦利·库布里克导演1968年的电影《2001太空漫游》中出现的智能超级计算机HAL 9000,其能力广度甚至不及现在的法学硕士(LLM)。而现在的法学硕士甚至超越了我们对人类的要求:我们仅凭远不如HAL 9000的证据就认定某些人拥有通用智能。
超人水平。革命性的科学发现,以及在多个领域持续超越顶尖人类专家的能力。这样的证据无疑足以驳斥机器拥有通用智能的合理质疑——但这并非通用智能存在的必要证据,因为人类本身并不具备这种能力。
图灵的愿景得以实现
目前的LLM已经涵盖了前两个层次。随着LLM处理越来越复杂的问题,对其能力的其他解释——例如,它们是巨大的“查找表” ,只能检索预先计算好的答案,或是“随机鹦鹉” 只能复述浅层的规律而无法理解意义或结构——正变得越来越不被证实。
然而,这类论断往往只是换汤不换药,不断重复出现。那些在每次取得新成就前就退缩,总是预测在当前成就之后必将失败的假设,并非令人信服的科学理论,而是一种教条式的、永无止境的怀疑主义。AI 语言模型终结了图灵测试:我们还需要替代品吗?
我们认为目前的证据已经很明确。通过推断最佳解释——也就是我们用来推断人类是否具备通用智能的推理方式——我们观察到了高度发达的通用人工智能(AGI)。图灵设想的那种机器已经出现。类似的论点在2010年之前就有人提出过(另见go.nature.com/49p6voq),并引发了争议和反对。我们的论点得益于技术的显著进步和更多的时间。到2026年初,通用人工智能(AGI)的论证将更加清晰明确。
我们现在探讨十个针对现有低级智能体展现一般智能这一观点的常见反对意见。其中一些反对意见与图灵本人在1950年考虑过的反对意见不谋而合。我们认为,每一种反对意见要么将一般智能与智能的非本质方面混为一谈,要么采用了人类个体无法达到的标准。
它们只不过是鹦鹉罢了。随机鹦鹉论认为,逻辑学习模型(LLM)仅仅是对训练数据进行插值。它们只能重新组合遇到过的模式,因此在真正的新问题上,或者说“分布外泛化”方面,必然会失败。这与“洛夫莱斯夫人的反对意见”遥相呼应,后者源于艾达·洛夫莱斯1843年的言论,并由图灵表述为机器“永远无法做出任何真正新颖的事情” 。早期的逻辑学习模型在需要超越训练数据表面模式进行推理和泛化的问题上确实犯过错误。但目前的逻辑学习模型能够解决新的、未发表的数学问题,对科学数据进行近乎最优的上下文统计推断¹¹ ,并展现出跨领域迁移能力,即在代码领域进行的训练能够提升其在非编码领域的一般推理能力¹² 。如果批评者要求逻辑学习模型做出像爱因斯坦相对论那样的革命性发现,那他们就把标准定得太高了,因为即使是人类,也很少有人能做出这样的发现。此外,也不能保证人类智能本身不是一种精密的随机鹦鹉。所有智能,无论是人类的还是人工智能的,都必须从相关性数据中提取结构;问题在于这种提取能深入到什么程度。
它们缺乏世界模型。低级逻辑模型(LLM)被认为缺乏对其物理环境的表征,而这些表征对于真正的理解至关重要。但拥有世界模型仅仅意味着能够预测如果情况不同会发生什么——即回答反事实问题。询问一个最先进的低级逻辑模型,将玻璃杯或枕头掉落在瓷砖地板上有什么区别,它就能正确预测前者会破碎,而后者则不会。低级逻辑模型能够解决数学和物理奥林匹克竞赛题,并协助工程设计,这表明它们拥有物理原理的功能模型。按照这些标准,低级逻辑模型已经拥有世界模型。此外,为自动驾驶等特定领域开发的神经网络已经能够学习物理场景的预测模型,这些模型支持反事实推理和复杂的物理感知。

它们只能理解文字。这种反对意见的核心在于,语言学习模型(LLM)仅基于文本进行训练,因此其功能必然从根本上局限于文本任务。然而,前沿模型现在已能基于图像和其他多模态数据进行训练,这使得这种反对意见在某种程度上已经过时。此外,语言是人类压缩和捕捉现实知识的最强大工具。语言学习模型可以提取这种压缩的知识,并将其应用于截然不同的非语言任务:例如,帮助研究人员设计实验——比如,在生物学和材料科学领域提出下一步的测试方向 ——其功能远不止于语言能力。我们尚未遇到这种反对意见所预测的语言学习模型性能的严重局限性。
它们没有实体。批评者认为,没有实体,就不可能存在普遍智能。这反映了一种以人类为中心的偏见,这种偏见似乎只针对人工智能。人们会把智能赋予一个通过无线电通讯的无形外星人,或者一个培养在培养皿中的大脑。一个能够准确回答任何问题,但从不移动或进行任何物理行为的实体,会被视为具有高度智能。物理学家斯蒂芬·霍金几乎完全通过文字和合成语音与世界互动,但他的身体局限丝毫没有削弱他的智能。运动能力与普遍智能是可以分离的。
它们缺乏自主性。诚然,当今的逻辑逻辑模型(LLM)不像人类那样能够独立设定目标或主动采取行动。即使是像前沿编码代理这样的“自主”人工智能系统,通常也只有在用户触发任务时才会行动,即便它们能够自动设计功能和修复漏洞。但智能并不必然要求自主性。就像德尔斐神谕——一个只有在被询问时才能给出准确答案的系统——当前的逻辑逻辑模型无需主动设定目标即可被视为智能。人类通常兼具一般智能和自主性,但这并不意味着二者必然相互依存。自主性对于道德责任至关重要,但它并非智能的构成要素。
他们没有自我意识。批评者认为,通用人工智能(AGI)需要持久的自传体记忆、稳定的个人身份和持续的自我更新,而目前的记忆模块(LLM)却缺乏这些能力。前沿的记忆模块越来越多地配备长期情境记忆和用户特定记忆,因此人类与基于记忆模块的系统在记忆和身份方面的差距正在缩小。虽然这些特征对于人类在社会中运作至关重要,但它们并非通用智能的必要条件。我们不会否认患有严重失忆症的人拥有智能,即使他们几乎记不起任何个人细节;我们也不会否认患有多重人格障碍的人拥有智能,即使他们的各个人格可能彼此不知情。例如,一个有智慧的失忆症患者可以利用记录在外部笔记本中的信息进行有效的推理,即使这些笔记本从未连接过。
他们的学习效率很低。一种常见的反对意见是,儿童只需少量例子就能学习概念,而逻辑学习者(LLM)则需要大量数据:他们的“样本效率”很低。即便这种说法正确,这种比较也并非简单直接。它忽略了数十亿年的进化“预训练”,这种训练在人类开始从经验中学习之前,就已经构建了丰富的归纳偏见——关于物体、空间和因果关系。更重要的是,学习效率的差异并不一定意味着智力水平的差异。一位用十年时间达到大师水平的国际象棋大师,与一位一年内就达到大师水平的人,棋艺同样精湛。如何检测人类、动物甚至人工智能的意识?
他们会产生幻觉。低级智力模型(LLM)有时会自信地将错误信息当作真理呈现,这引发了人们对其可靠性的担忧。幻觉在目前的模型中越来越少见,但这并不能否定人类的一般智力。人类容易产生虚假记忆、认知偏差和感知错觉,并且常常对此深信不疑。
它们缺乏经济效益。在某些领域,尤其是在工业界,通用人工智能(AGI)的定义已经演变为必须产生实质性经济回报。但经济能力是通用智能的应用,而非其存在的必要条件。历史上有很多才华横溢却鲜有经济回报的人;我们并非因此否定他们的通用智能。
它们的智能是“异类”的。LLM(语言学习机器)有时会在对我们来说微不足道的任务上失败(例如,统计“strawberry”(草莓)一词中字母“r”的出现次数),却能在人类认为困难的任务上表现出色——从博士级别的科学问题到对海量科学文献进行快速综合分析。但我们并非认为LLM拥有人类智能,而是认为它们实现了某种形式的通用智能。此外,前沿LLM越来越多地编写代码并使用工具来弥补自身的弱点,正如人类利用技术(从袖珍计算器到智能手机)来增强自身能力一样。由此产生的优势和劣势构成了一种相当异类的智能形式,但这正是我们应该拓展通用智能概念的原因,而不是否认这些系统拥有通用智能。
在这些反对意见中,批评者要求具备一些特定特征,而这些特征并非任何可靠的原则所要求的。许多反对意见排除了我们很容易识别出的智能;有些甚至排除了被认为智力超群的人类,或者干脆排除了所有人类。
最后,还有一种不同的反应,与其说是反对意见,不如说是图灵所说的“鸵鸟心态”:机器思考的后果太过可怕,所以我们只能祈祷它们不会思考。从情感和人性的角度来看,这种想法是可以理解的。但正如图灵所指出的,这需要的是安慰,而不是反驳——我们可以理解这种担忧,而无需将其视为论据。
为什么这很重要
将当前的低级机器学习系统(LLM)视为通用人工智能(AGI),并认为它们实现了图灵提出的机器智能愿景,这无疑是一记警钟。这些系统并非遥不可及,它们已经到来。以往用于评估特定工具的框架不足以评估它们的益处和风险。当所涉及的系统不再是特定工具而是通用智能时,共存、责任、义务和治理等问题便呈现出新的维度。
正如我们所见,智能并不一定需要高度自主性——这一发现使关于人工智能系统的法律和道德责任的辩论变得复杂,因为这些辩论通常假定二者密不可分。我们需要更谨慎、更具实证基础的方法来评估和确定人工智能的责任。此外,传统的治理方法不太可能适用于通用人工智能(AGI),恰恰是因为其普遍性。技术通常根据其潜在用途进行治理,但AGI几乎可以应用于任何地方。科学与人工智能新时代:自然特刊
另一个关键问题涉及人类智能与已创造和未来将要创造的通用智能形式之间的关系。在许多方面,这些系统与人类惊人地相似——它们像我们一样写作,像我们一样说话,也和我们一样存在一些缺陷。然而,它们仍然是异类,反映出通往通用智能的根本路径截然不同,不受塑造人类认知(以生存为导向)、体型小、能量稀缺和通信带宽低等进化压力的制约。理解这种异类性至关重要。这些系统与我们的有何不同?这些差异是暂时的还是根本性的?
答案或许能揭示通用智能的哪些方面是普遍存在的,哪些方面又是我们生物遗传的局限性特征。人类历史上,我们第一次不再孤单地探索通用智能领域。我们或许也能更好地理解其中的风险,因为外星通用智能可能会以出人意料的方式失败,或者以难以理解或引导的方式取得成功。认清这些系统的本质,将有助于我们今天与它们合作,并为未来做好准备。
仅仅五年前,我们还没有通用人工智能(AGI);如今,我们拥有了。毫无疑问,更强大的智能形式很快就会出现。这既令人瞩目,又令人担忧。令人瞩目之处在于,我们有幸见证了人类历史上或许最为重大的科学技术革命。令人担忧之处在于,这一进程的时间跨度远超历史任何先例,而且可能还在加速。
1965年,哲学家休伯特·德雷福斯在为兰德公司评估人工智能进展时,将开发人类水平人工智能的方法比作试图通过爬树到达月球(参见go.nature.com/3ywerhj)。几十年来,这种比喻似乎都很有道理。但随着证据的不断积累,我们越来越清楚地认识到,我们误判了月球的本质和树木的力量。通用智能确实可以从简单的学习规则中涌现,这些规则大规模地应用于人类语言中潜在的模式——事实证明,这些模式足够丰富,足以编码现实本身的大部分结构。
尼古拉·哥白尼将人类从宇宙中心拉了出来。达尔文将人类从自然界的特权地位中拉了出来。图灵提出,人类或许并非智能的唯一体现。75年前图灵设想的机器终于到来,其形态既比任何人想象的都更加陌生,又更加人性化。如同之前的那些革命一样,这次革命也促使我们重新思考自身的定位——并接受存在着比我们以往所认为的更为丰富的思维类型。我们在世界上的位置,以及我们对思维的理解,都将发生改变。
艾伦·图灵在20世纪50年代提出的人类水平机器智能的愿景如今已成为现实。保持清醒的头脑,不受恐惧或炒作的蒙蔽,将有助于我们为接下来的发展做好准备。

1950 年,艾伦·图灵在一篇题为《计算机器与智能》的论文中提出了他的“模仿游戏”。现在被称为图灵测试,它探讨了一个看似纯粹假设性的问题:机器能否展现出人类思维所特有的那种灵活、通用的认知能力,从而能够将自己冒充为人类,让不知情的人类误以为是人类?
75年后,答案似乎是肯定的。2025年3月,由位于加利福尼亚州旧金山的OpenAI公司开发的大型语言模型(LLM)GPT-4.5在图灵测试中被人类判断为人类的准确率高达73%——甚至高于人类的准确率²。此外,读者甚至更喜欢由LLM生成的文学作品,而不是人类专家撰写的作品³。
这远非全部。法学硕士们在国际数学奥林匹克竞赛中斩获金牌,与顶尖数学家合作证明了定理⁴,提出了经实验验证的科学假设⁵,解答了博士考试中的难题,协助专业程序员编写代码,创作诗歌等等——包括与世界各地数亿人进行全天候聊天。换句话说,法学硕士们展现出了许多迹象,表明他们具备图灵所关注的那种广泛而灵活的认知能力——我们现在称之为“通用智能”,尽管图灵本人并没有使用这个术语。智能的未来是什么?答案或许就藏在其演化历程中。
然而,许多专家对称当前的人工智能模型展现出通用人工智能(AGI)持保留态度——有些人甚至怀疑它们是否真的能够达到AGI的水平。2025年3月,位于华盛顿特区的美国人工智能促进协会(AAAI)进行的一项调查发现,76%的顶尖研究人员认为,扩大当前人工智能方法的规模“不太可能”或“极不可能”产生AGI(参见go.nature.com/4smn16b)。
这种脱节现象该如何解释?我们认为,问题一部分在于概念层面,因为通用人工智能(AGI)的定义含糊不清且前后矛盾;一部分在于情感层面,因为AGI引发了人们对社会动荡和颠覆的恐惧;还有一部分在于实际层面,因为这个术语与商业利益纠缠不清,可能会扭曲评估。正因为AGI在公共话语中占据主导地位,我们才更应该以一种更为客观的视角来探讨这个概念:将其视为一个关于智能的问题,而不是对社会动荡的迫切担忧,或是对商业合同中一个永远无法完成的里程碑的担忧。
在撰写这篇评论时,我们从哲学、机器学习、语言学和认知科学等不同角度探讨了这个问题,并在广泛讨论后达成共识。接下来,我们将阐述我们为何认为,一旦澄清某些混淆之处,力求进行公平的比较并避免以人类为中心的偏见,结论便显而易见:按照合理的标准(包括图灵的标准),我们已经拥有了普遍智能的人工智能系统。长期以来,创造通用人工智能(AGI)的难题已经得到解决。认识到这一点至关重要——对于政策制定、风险评估以及理解心智的本质乃至世界本身都意义重大。
定义问题
我们假设(正如我们认为图灵会做的那样),人类拥有通用智能。有些人认为通用智能根本不存在,即使在人类身上也是如此。尽管这种观点自洽且在哲学上很有趣,但我们在此暂且搁置它,因为它与大多数人工智能讨论脱节太深。但是,既然我们已经做出了这个假设,我们应该如何定义通用智能呢?
关于通用智能的一个常见非正式定义,也是我们讨论的出发点,是:一个系统能够完成几乎所有人类能够完成的认知任务。哪些任务应该列入这个清单引发了诸多争论,但“人类”一词也隐藏着一个关键的歧义。它指的是每项任务的顶尖人类专家吗?如果是这样,那么没有人符合条件——玛丽·居里获得了诺贝尔化学奖和物理学奖,但她并非数论专家。它指的是一个在各个领域都具备全面能力的综合型人类吗?这似乎也是一个很高的标准——阿尔伯特·爱因斯坦彻底改变了物理学,但他不会说普通话。人工智能距离人类智能水平有多近?
如果一个定义将几乎所有人类都排除在外,那么它就不是对通用智能的定义;它关注的是其他东西,或许是理想的专业技能或集体智慧。相反,通用智能指的是认知能力的广度和深度,而“广度”则以典型案例为依据。广度指的是跨多个领域的能力——数学、语言、科学、实践推理、创造性任务——这与“狭义”智能(例如计算器或国际象棋程序)截然不同。深度指的是在这些领域内的卓越表现,而不仅仅是浅尝辄止。
人类的通用智能存在程度和差异。儿童、普通成年人以及像爱因斯坦这样公认的天才,都拥有不同水平和类型的通用智能。每个人在不同的领域各有所长或有所不足。同样的灵活性也应适用于人工智能系统:我们应该探究它们是否具备与人类通用智能水平相当的核心认知能力。
我们并非试图给出定义,而是借鉴真实和假设的普遍智能案例——从爱因斯坦到外星人再到先知——来勾勒出这一概念的轮廓,并对其进行更系统的完善。我们的结论是:只要个体人类拥有普遍智能,那么当前的法学硕士也拥有普遍智能。
通用智能不是什么
我们可以先找出四个并非通用智能所必需具备的特征。
完美。我们不会期望物理学家达到爱因斯坦的洞见,也不会期望生物学家复制达尔文的突破性发现。即使在专业领域内,也很少有人能做到完美无缺。人类的通用智能并不需要完美;通用人工智能(AGI)也不应该如此。
普遍性。没有哪个人类个体能够完成所有认知任务,其他物种也拥有超越我们自身的能力:章鱼可以独立控制其八条触手;许多昆虫能够感知人类无法看到的电磁波谱。通用智能并不要求普遍掌握这些技能;通用人工智能(AGI)也不需要面面俱到。
人类相似性。智能是一种功能属性,可以在不同的载体上实现——图灵在1950年就提出了这一点,他当时将人类生物学排除在外¹。展现通用智能的系统无需复制人类的认知结构或理解人类的文化参照。我们不会要求智能外星人做到这些;这同样适用于机器。
超级智能。这个词通常用来指在几乎所有领域都远远超越人类认知能力的系统。超级智能和通用人工智能(AGI)经常被混淆,尤其是在商业领域,“超级智能”往往意味着经济动荡。没有任何人类能够达到这个标准;因此,这也不应该成为通用人工智能的必要条件。
一系列证据
那么,什么是通用智能?目前并没有一个明确的“界限”来检验它是否存在——任何精确的阈值都必然是人为设定的。这或许会让那些想要精确标准的人感到沮丧,但这种模糊性恰恰是它的特点,而非缺陷。“生命”和“健康”之类的概念难以被清晰定义,却依然有用;我们无需精确的界限就能识别出典型案例。人类就是通用智能的典型例子;而袖珍计算器尽管拥有超人的计算能力,却不具备通用智能。
当我们评估他人的总体智力或能力时,我们不会试图窥探他们的内心来验证理解能力——我们是通过他们的行为、对话和解决问题的能力来推断的。没有任何一项测试是绝对权威的,但证据会不断积累。这同样适用于人工智能系统。
正如我们通过逐步提高难度的测试(从基本读写能力到博士学位考试)来评估人类的一般智力一样,我们可以考虑一系列难度越来越高的证据,这些证据可以让我们越来越有信心相信通用人工智能(AGI)的存在。
图灵测试水平。其衡量标准相当于基础学校教育:通过标准学校考试、进行基本的对话以及进行简单的推理。十年前,达到这些标准或许会被广泛接受,作为通用人工智能(AGI)存在的足够有力证据。

专家级。在这个级别,要求更高:在国际竞赛中获得金牌,解决跨多个领域的博士考试题,编写和调试复杂的代码,精通数十种编程语言,能够提供有用的前沿研究协助,以及胜任各种创造性和实践性问题解决能力,从论文写作到旅行规划,无所不能。这些成就远超科幻作品中对通用人工智能(AGI)的诸多描述。斯坦利·库布里克导演1968年的电影《2001太空漫游》中出现的智能超级计算机HAL 9000,其能力广度甚至不及现在的法学硕士(LLM)。而现在的法学硕士甚至超越了我们对人类的要求:我们仅凭远不如HAL 9000的证据就认定某些人拥有通用智能。
超人水平。革命性的科学发现,以及在多个领域持续超越顶尖人类专家的能力。这样的证据无疑足以驳斥机器拥有通用智能的合理质疑——但这并非通用智能存在的必要证据,因为人类本身并不具备这种能力。
图灵的愿景得以实现
目前的LLM已经涵盖了前两个层次。随着LLM处理越来越复杂的问题,对其能力的其他解释——例如,它们是巨大的“查找表” ,只能检索预先计算好的答案,或是“随机鹦鹉” 只能复述浅层的规律而无法理解意义或结构——正变得越来越不被证实。
然而,这类论断往往只是换汤不换药,不断重复出现。那些在每次取得新成就前就退缩,总是预测在当前成就之后必将失败的假设,并非令人信服的科学理论,而是一种教条式的、永无止境的怀疑主义。AI 语言模型终结了图灵测试:我们还需要替代品吗?
我们认为目前的证据已经很明确。通过推断最佳解释——也就是我们用来推断人类是否具备通用智能的推理方式——我们观察到了高度发达的通用人工智能(AGI)。图灵设想的那种机器已经出现。类似的论点在2010年之前就有人提出过(另见go.nature.com/49p6voq),并引发了争议和反对。我们的论点得益于技术的显著进步和更多的时间。到2026年初,通用人工智能(AGI)的论证将更加清晰明确。
我们现在探讨十个针对现有低级智能体展现一般智能这一观点的常见反对意见。其中一些反对意见与图灵本人在1950年考虑过的反对意见不谋而合。我们认为,每一种反对意见要么将一般智能与智能的非本质方面混为一谈,要么采用了人类个体无法达到的标准。
它们只不过是鹦鹉罢了。随机鹦鹉论认为,逻辑学习模型(LLM)仅仅是对训练数据进行插值。它们只能重新组合遇到过的模式,因此在真正的新问题上,或者说“分布外泛化”方面,必然会失败。这与“洛夫莱斯夫人的反对意见”遥相呼应,后者源于艾达·洛夫莱斯1843年的言论,并由图灵表述为机器“永远无法做出任何真正新颖的事情” 。早期的逻辑学习模型在需要超越训练数据表面模式进行推理和泛化的问题上确实犯过错误。但目前的逻辑学习模型能够解决新的、未发表的数学问题,对科学数据进行近乎最优的上下文统计推断¹¹ ,并展现出跨领域迁移能力,即在代码领域进行的训练能够提升其在非编码领域的一般推理能力¹² 。如果批评者要求逻辑学习模型做出像爱因斯坦相对论那样的革命性发现,那他们就把标准定得太高了,因为即使是人类,也很少有人能做出这样的发现。此外,也不能保证人类智能本身不是一种精密的随机鹦鹉。所有智能,无论是人类的还是人工智能的,都必须从相关性数据中提取结构;问题在于这种提取能深入到什么程度。
它们缺乏世界模型。低级逻辑模型(LLM)被认为缺乏对其物理环境的表征,而这些表征对于真正的理解至关重要。但拥有世界模型仅仅意味着能够预测如果情况不同会发生什么——即回答反事实问题。询问一个最先进的低级逻辑模型,将玻璃杯或枕头掉落在瓷砖地板上有什么区别,它就能正确预测前者会破碎,而后者则不会。低级逻辑模型能够解决数学和物理奥林匹克竞赛题,并协助工程设计,这表明它们拥有物理原理的功能模型。按照这些标准,低级逻辑模型已经拥有世界模型。此外,为自动驾驶等特定领域开发的神经网络已经能够学习物理场景的预测模型,这些模型支持反事实推理和复杂的物理感知。

它们只能理解文字。这种反对意见的核心在于,语言学习模型(LLM)仅基于文本进行训练,因此其功能必然从根本上局限于文本任务。然而,前沿模型现在已能基于图像和其他多模态数据进行训练,这使得这种反对意见在某种程度上已经过时。此外,语言是人类压缩和捕捉现实知识的最强大工具。语言学习模型可以提取这种压缩的知识,并将其应用于截然不同的非语言任务:例如,帮助研究人员设计实验——比如,在生物学和材料科学领域提出下一步的测试方向 ——其功能远不止于语言能力。我们尚未遇到这种反对意见所预测的语言学习模型性能的严重局限性。
它们没有实体。批评者认为,没有实体,就不可能存在普遍智能。这反映了一种以人类为中心的偏见,这种偏见似乎只针对人工智能。人们会把智能赋予一个通过无线电通讯的无形外星人,或者一个培养在培养皿中的大脑。一个能够准确回答任何问题,但从不移动或进行任何物理行为的实体,会被视为具有高度智能。物理学家斯蒂芬·霍金几乎完全通过文字和合成语音与世界互动,但他的身体局限丝毫没有削弱他的智能。运动能力与普遍智能是可以分离的。
它们缺乏自主性。诚然,当今的逻辑逻辑模型(LLM)不像人类那样能够独立设定目标或主动采取行动。即使是像前沿编码代理这样的“自主”人工智能系统,通常也只有在用户触发任务时才会行动,即便它们能够自动设计功能和修复漏洞。但智能并不必然要求自主性。就像德尔斐神谕——一个只有在被询问时才能给出准确答案的系统——当前的逻辑逻辑模型无需主动设定目标即可被视为智能。人类通常兼具一般智能和自主性,但这并不意味着二者必然相互依存。自主性对于道德责任至关重要,但它并非智能的构成要素。
他们没有自我意识。批评者认为,通用人工智能(AGI)需要持久的自传体记忆、稳定的个人身份和持续的自我更新,而目前的记忆模块(LLM)却缺乏这些能力。前沿的记忆模块越来越多地配备长期情境记忆和用户特定记忆,因此人类与基于记忆模块的系统在记忆和身份方面的差距正在缩小。虽然这些特征对于人类在社会中运作至关重要,但它们并非通用智能的必要条件。我们不会否认患有严重失忆症的人拥有智能,即使他们几乎记不起任何个人细节;我们也不会否认患有多重人格障碍的人拥有智能,即使他们的各个人格可能彼此不知情。例如,一个有智慧的失忆症患者可以利用记录在外部笔记本中的信息进行有效的推理,即使这些笔记本从未连接过。
他们的学习效率很低。一种常见的反对意见是,儿童只需少量例子就能学习概念,而逻辑学习者(LLM)则需要大量数据:他们的“样本效率”很低。即便这种说法正确,这种比较也并非简单直接。它忽略了数十亿年的进化“预训练”,这种训练在人类开始从经验中学习之前,就已经构建了丰富的归纳偏见——关于物体、空间和因果关系。更重要的是,学习效率的差异并不一定意味着智力水平的差异。一位用十年时间达到大师水平的国际象棋大师,与一位一年内就达到大师水平的人,棋艺同样精湛。如何检测人类、动物甚至人工智能的意识?
他们会产生幻觉。低级智力模型(LLM)有时会自信地将错误信息当作真理呈现,这引发了人们对其可靠性的担忧。幻觉在目前的模型中越来越少见,但这并不能否定人类的一般智力。人类容易产生虚假记忆、认知偏差和感知错觉,并且常常对此深信不疑。
它们缺乏经济效益。在某些领域,尤其是在工业界,通用人工智能(AGI)的定义已经演变为必须产生实质性经济回报。但经济能力是通用智能的应用,而非其存在的必要条件。历史上有很多才华横溢却鲜有经济回报的人;我们并非因此否定他们的通用智能。
它们的智能是“异类”的。LLM(语言学习机器)有时会在对我们来说微不足道的任务上失败(例如,统计“strawberry”(草莓)一词中字母“r”的出现次数),却能在人类认为困难的任务上表现出色——从博士级别的科学问题到对海量科学文献进行快速综合分析。但我们并非认为LLM拥有人类智能,而是认为它们实现了某种形式的通用智能。此外,前沿LLM越来越多地编写代码并使用工具来弥补自身的弱点,正如人类利用技术(从袖珍计算器到智能手机)来增强自身能力一样。由此产生的优势和劣势构成了一种相当异类的智能形式,但这正是我们应该拓展通用智能概念的原因,而不是否认这些系统拥有通用智能。
在这些反对意见中,批评者要求具备一些特定特征,而这些特征并非任何可靠的原则所要求的。许多反对意见排除了我们很容易识别出的智能;有些甚至排除了被认为智力超群的人类,或者干脆排除了所有人类。
最后,还有一种不同的反应,与其说是反对意见,不如说是图灵所说的“鸵鸟心态”:机器思考的后果太过可怕,所以我们只能祈祷它们不会思考。从情感和人性的角度来看,这种想法是可以理解的。但正如图灵所指出的,这需要的是安慰,而不是反驳——我们可以理解这种担忧,而无需将其视为论据。
为什么这很重要
将当前的低级机器学习系统(LLM)视为通用人工智能(AGI),并认为它们实现了图灵提出的机器智能愿景,这无疑是一记警钟。这些系统并非遥不可及,它们已经到来。以往用于评估特定工具的框架不足以评估它们的益处和风险。当所涉及的系统不再是特定工具而是通用智能时,共存、责任、义务和治理等问题便呈现出新的维度。
正如我们所见,智能并不一定需要高度自主性——这一发现使关于人工智能系统的法律和道德责任的辩论变得复杂,因为这些辩论通常假定二者密不可分。我们需要更谨慎、更具实证基础的方法来评估和确定人工智能的责任。此外,传统的治理方法不太可能适用于通用人工智能(AGI),恰恰是因为其普遍性。技术通常根据其潜在用途进行治理,但AGI几乎可以应用于任何地方。科学与人工智能新时代:自然特刊
另一个关键问题涉及人类智能与已创造和未来将要创造的通用智能形式之间的关系。在许多方面,这些系统与人类惊人地相似——它们像我们一样写作,像我们一样说话,也和我们一样存在一些缺陷。然而,它们仍然是异类,反映出通往通用智能的根本路径截然不同,不受塑造人类认知(以生存为导向)、体型小、能量稀缺和通信带宽低等进化压力的制约。理解这种异类性至关重要。这些系统与我们的有何不同?这些差异是暂时的还是根本性的?
答案或许能揭示通用智能的哪些方面是普遍存在的,哪些方面又是我们生物遗传的局限性特征。人类历史上,我们第一次不再孤单地探索通用智能领域。我们或许也能更好地理解其中的风险,因为外星通用智能可能会以出人意料的方式失败,或者以难以理解或引导的方式取得成功。认清这些系统的本质,将有助于我们今天与它们合作,并为未来做好准备。
仅仅五年前,我们还没有通用人工智能(AGI);如今,我们拥有了。毫无疑问,更强大的智能形式很快就会出现。这既令人瞩目,又令人担忧。令人瞩目之处在于,我们有幸见证了人类历史上或许最为重大的科学技术革命。令人担忧之处在于,这一进程的时间跨度远超历史任何先例,而且可能还在加速。
1965年,哲学家休伯特·德雷福斯在为兰德公司评估人工智能进展时,将开发人类水平人工智能的方法比作试图通过爬树到达月球(参见go.nature.com/3ywerhj)。几十年来,这种比喻似乎都很有道理。但随着证据的不断积累,我们越来越清楚地认识到,我们误判了月球的本质和树木的力量。通用智能确实可以从简单的学习规则中涌现,这些规则大规模地应用于人类语言中潜在的模式——事实证明,这些模式足够丰富,足以编码现实本身的大部分结构。
尼古拉·哥白尼将人类从宇宙中心拉了出来。达尔文将人类从自然界的特权地位中拉了出来。图灵提出,人类或许并非智能的唯一体现。75年前图灵设想的机器终于到来,其形态既比任何人想象的都更加陌生,又更加人性化。如同之前的那些革命一样,这次革命也促使我们重新思考自身的定位——并接受存在着比我们以往所认为的更为丰富的思维类型。我们在世界上的位置,以及我们对思维的理解,都将发生改变。