背景#

1950 年,图灵在《Mind》杂志发表《计算机器与智能》。他开头就说,“机器能思考吗”这个问题太模糊,没法回答,于是换了一个可以动手做的实验,叫“模仿游戏”。那一年,全世界能跑的电子计算机只有几台。

方法#

一个人当裁判,用文字和两个看不见的对象聊天,一个是人,一个是机器。裁判想问什么都行。聊完,裁判猜哪个是机器。

图灵的预言是:到 2000 年,聊五分钟后,普通裁判猜对的概率不超过 70%。也就是说,机器能骗过三成裁判,就算过关。

只用文字,是这个设计的关键。声音、长相、身体都被挡在外面,剩下的只有对话本身。

意义#

它给人工智能定了第一条终点线:只要表现得和人分不出来,就算智能。它绕开了“什么是思考”的哲学争论,只看行为。

反对的人也是围着它打。1980 年塞尔提出“中文房间”:一个不懂中文的人,照着规则手册处理中文纸条,也能让房间外的人以为里面有个懂中文的人。他的结论是,通过测试不等于理解。今天关于大模型“懂不懂”的争论,还是这个框架。

现状#

早期的“通过”都是取巧。1966 年的 ELIZA 靠模板套话,骗过了一些人。2014 年的 Eugene Goostman 假扮一个 13 岁的乌克兰男孩,英语不好有了借口,骗过了三成裁判。业内没人把这两次当真。

大模型改变了局面。2025 年加州大学圣地亚哥分校做了一次三方测试,五分钟对话,GPT-4.5 在被要求扮演一个具体人设时,有 73% 的裁判把它当成了人。这个比例高于同场真人。多数研究者现在认为,经典图灵测试已经过了。

过了之后,大家发现它测的东西比想象中少。同一批模型在长任务规划、稳定推理、承认自己不知道这几件事上仍然会翻车。聊天像人和做事靠谱,是两回事。

这个领域已经转向更难的考题:数学和编程题、跑几个小时的代理任务、裁判有几周而非五分钟的“长图灵测试”。还有人把问题反过来:现在难的是在网上证明你是人。

图灵画的那条终点线,我们在 2024 到 2025 年之间跨过去了,然后发现它是起跑线。