返回档案库

案例库 · 研发与科研 · 战略决策 · 2014

Eugene Goostman「通过」了图灵测试——持续了五分钟

一个假装 13 岁少年的聊天机器人骗过了三分之一的评委,历时五分钟——而整个领域花了十年时间说不对。

University of Reading · 2014-06-07

怎么回事

2014 年 6 月 7 日,在伦敦皇家学会,三十位评委与几款程序进行了五分钟的键盘对话。其中一个程序,Eugene Goostman——一个以来自敖德萨、养着一只豚鼠的 13 岁男孩为人设的聊天机器人——被十位评委(33%)当成了人类。组织该活动的雷丁大学的 Kevin Warwick 宣布,艾伦·图灵的测试首次被通过。

媒体将其放大为「世界首次」:BBC 以「计算机 AI 通过图灵测试」作为头条。然而,30% 并非一个门槛——而是图灵自己在 1950 年的预测,即到 2000 年机器能骗过三分之一的评委。Eugene 并非新面孔:它自 2001 年起就开始参赛,在 Loebner 奖中排名落后于其他系统。连其合作者 John Denning 都打了圆场:「我认为我们通过了『一个』图灵测试,但我不确定是不是『那个』图灵测试。」

一天之内,该领域就发起了反击。「这完全是胡说八道,一派胡言。我们甚至还没接近,」Stevan Harnad 说。Marvin Minsky 表示:「从设计糟糕的『实验』中学不到任何东西。」Gary Marcus 称 Eugene 是「一个巧妙编写的软件」,其「幻觉转瞬即逝」;Murray Shanahan 说这一声明「完全不得要领,贬低了真正的人工智能研究」。Noel Sharkey 道破了玄机:「假装成一个乌克兰 13 岁男孩是一个非常聪明的策略,这可以限制对话的范围。」

人设就是策略:一个非英语母语的儿童,还有一只宠物,可以解释每一个不合理的回答。当被追问骆驼有多少条腿时,Eugene 回答「介于 2 到 4 之间。也许,三条?」——这个回答被理解为童言无忌,而非程序错误。这场闹剧的真正代价是公众认知:「AI 通过了图灵测试」成了一个不断重复出现的头条标题,真正的人工智能研究人员至今仍在反驳,而五分钟的剧本化聊天取代了图灵的开放式对话,成为公众理解中「通过」的含义。

为什么会这样

  • 图灵的 30% 是一个预测,而非及格线——活动将其视为门槛,并在达到的那一刻就宣布了胜利
  • 人设在起作用:一个养着豚鼠的 13 岁孩子让每一个不合理的回答看起来都像人类——因此测试衡量的是伪装,而非机器智能
  • 五分钟的无限制对话比 Loebner 奖的 25 分钟标准更低——而 Eugene 在该奖中排在七个系统之后
  • 宣布跑在了审查前面:当天就宣布了「世界首次」,在领域专家有机会评估之前,因此更正声浪从未追上头条
代价「图灵测试被通过」的神话,头条仍在重复代价高昂

教训

图灵的 30% 是一个预测,而非及格线;一个能解释所有不连贯回答的人设衡量的只是伪装,而非机器智能。

后来呢

Eugene 的胜利没有被任何人撤消,也没有被多少人接受:聊天机器人保留了自己的人设,其创作者继续前进,而这一事件则成为图灵测试声明超越其证据的教科书案例。真正的损害在于公共语言——「通过图灵测试」成为了一种头条简写,真正的人工智能里程碑至今仍需要与之抗争。活动组织者自己的辩护——对话是「无限制的」——只凸显了测试从图灵那种开放式的、长达数年的审问,缩减到五分钟与一个无法被抓住把柄的青少年对话的距离有多远。

资料来源

发现哪里写错了?告诉我们。

Comments · 0

    登录 后就能评论。

    类似的案例

    这家公司栽倒的地方,别处有人漂亮地解开过。 第二意见 →