先请你做道题
规则就一句:写下 10 个名词,彼此的意思离得越远越好。
「猫、狗、桌子」不行,这三个词太亲了,一看就是一家的。得写成「星系、叉子、自由、藻类、口琴」这样,每个词都来自互不相干的世界。
真的可以拿张纸试试,四分钟就够。写完再往下读——因为接下来这项研究里,10 万个人和 GPT-4、Claude3 这些模型,做的就是你手上这道题。

图:测验官网 datcreativity.com 的答题页。规则六条——只许英文单词、只许名词、不许专有名词、不许专业术语、要自己想(别看着屋里的东西抄)、要有创造力。
这道题有个正式名字,叫发散联想任务,2021 年发表在《美国国家科学院院刊》上。它量的东西很朴素——你想到的词,彼此能离多远。心理学里有个由来已久的看法:能想出新点子的人,常常能在两个八竿子打不着的东西之间看出联系。
出题人 Jay Olson 七岁开始变魔术,后来把这门手艺带进了心理学实验室。他在街头做过一个实验,请 118 位路人「随便」选一张牌,98% 的人选中了他想让他们选的那张,事后九成还确信是自己做的主。变魔术靠操纵注意力,做研究他挑的也是同类难题——人脑子里看不见摸不着的东西,怎么测?
创造力恰好是最难测的一种。传统的测法得请评委给答案打分,评委累,彼此的标准还常常不一致。这道题的聪明处,是把打分交给了算法。词的意思可以放进一张「语义地图」,意思相近的词挨得近,不相干的离得远;十个词两两之间的平均距离,就是你的分数。它量的是创造力里「发散联想」这一个侧面,不是全部——这笔账,文章最后会回来算。但正因为打分交给算法,谁来考都一样算,它也不问答卷的是人还是机器。
这一次,题出给了 AI
2026 年 1 月,《科学报告》刊出了迄今规模最大的一场人机创造力对比,领衔的是蒙特利尔大学认知神经科学家 Karim Jerbi,他的实验室平时研究脑电与意识。
合作者也都和创造力相关。第一作者 Antoine Bellemare-Pépin 在 Concordia 大学音乐系写曲子;Olson 也在,就是那位魔术师;Google DeepMind 的 Kory Mathewson 拿过加拿大喜剧奖,是最早把 AI 拉上即兴喜剧舞台的人之一;名单里还有深度学习先驱、图灵奖得主 Yoshua Bengio。作曲家、魔术师、喜剧演员和 AI 奠基人,这一次一起研究同一道十个词的小题。

图:作者之一、图灵奖得主 Yoshua Bengio。摄影 Maryse Boyce,来自 Wikimedia Commons,CC BY 4.0。
这道题此前积下 10 万人的答卷,男女各半,从 18 岁到 60 岁往上,五个年龄段各占两成。研究者让九款模型——GPT-3.5、GPT-4、GPT-4-turbo、Claude3、GeminiPro,加上 Vicuna 等四款开源小模型——答同一道题,再把机器的成绩和这 10 万人放在一起排名次。
平均分输了,最高分还在人这边
按平时的设置答题,分数最高的是 GPT-4,平均分显著超过人类平均;GeminiPro 和人类平均分不出高下;其余七款,包括 Claude3,都低于人类平均。十根柱子排开,人类的平均分位居第二,只低于 GPT-4。

图:DAT 创造力平均分,由低到高。灰柱是 10 万人,绿柱是 GPT-4;图中 GPT-3 即 GPT-3.5。图源 Bellemare-Pepin et al., Scientific Reports, 2026(CC BY 4.0)。
可是把 10 万人按分数排序再看:排名前一半的那 5 万人,取他们的平均分,仍然高于所有被测模型;只看前 10%,人和机器的差距还要更大。下面这张分布图说得更直白——10 万人的分数从 30 分一直铺到 95 分以上,右端最高的那段,没有一款模型的分数覆盖得到;而每款模型自己的分数,都挤在窄窄一段里。

图:各款模型与 10 万人(灰色)的分数分布。虚线为均值。图源同上(CC BY 4.0)。
研究者又挑出 GPT-3.5、Vicuna 和 GPT-4 三款,做了三道更接近真实创作的题——写俳句(日本的三行短诗)、写电影故事梗概、写微型小说。方向没有变:机器写得有模有样,但始终不如最会写的那批人。
榜单里还有一处意外:GPT-4 的后继版本 GPT-4-turbo,分数反而比前辈低了一大截,连 Vicuna、GPT-3.5 这些规模小它许多的模型都不如。至少在这批被测模型身上,规模和版本新旧,都换算不成分数。
温度和提示词,都能改机器的成绩
那这个成绩是一成不变的吗?研究者试了两个办法。
第一个办法是调温度。温度是模型的一个参数,决定它的回答有多「野」:温度低,它选最稳妥的词;温度高,它敢选冷僻的词。普通用户平时改不了它,开发者可以。研究者把 GPT-4 的温度从 0.5 升到 1.5,分数随之上升,最高一档平均分到了85.6,超过 72% 的人类答卷。
第二个办法是改提示词。指示里添一句「从词的来历(词源)入手,找不相关的词」,GPT-3.5 和 GPT-4 的成绩都超过了用原版指示的自己;换成「查同义词典」的路子,分数没什么变化。
同一个模型考多少分,一部分取决于人怎么问它。研究者在论文里由此谈到,提示与交互本身,已经成了创作过程的一部分。
同类研究,三年里做了好几轮
早在 2023 年 9 月,芬兰和挪威的两位研究者就让 ChatGPT(3.5 和 4 两版)和文案工具 Copy.Ai 与 256 个人做过「不寻常用途」测验——给绳子、纸盒这样的日常物件想新用法。机器的平均分更高,可没有一款机器的平均分,超过人类的最高分。同一年,蒙大拿大学的团队把 GPT-4 的答卷混进学生答卷,寄给托兰斯测验(美国用了几十年的经典创造力测验)的官方评分机构,评分的人不知道里面混了机器。结果,AI 的原创性得分排进前 1%。
连着三年,三项独立研究各自看到:在自家用的那种测验里,最强的模型平均分不输人类平均。三项研究的任务、样本、模型各不相同,结论谁也代替不了谁;但方向一致。这次的研究拿 10 万人做参照,又添上写作题,是同类研究里规模最大的一项。
不过,质疑也一直没停,而且分好几路。第一路针对题目本身。创造力的教科书定义有两个条件,又新,又有用。这道题量得出词离得远不远,量不出这些联想到底有没有用。出题人自己在论文里也承认这一点。还有研究者拿它和别的创造力测验对测,报告相关比原研究弱,不过那份结果只在会议上讲过,还没过期刊那道由同行匿名挑错的关。
第二路不太好反驳:机器单次考分高,一群机器的答案却出奇地像。前面那张分布图里已经露了迹象:每款模型的分数都挤在一小段里。2025 年的一项研究看得更细——让许多款模型反复答这类题,机器答案彼此的相似程度,远高于人和人之间。夸张点说,不同公司出的模型,答起题来像一个宿舍出来的。另一组研究者做了两场共 1100 人的预注册实验(预注册,就是开工前把方案公开存档,防止事后只挑好看的结果讲):人借着 AI 想点子,当场成绩确实更好;到了最后一轮不带 AI 的独立作答,研究者没观察到先前用 AI 带来的好处,点子倒有彼此趋同的迹象。人群里那种谁也不像谁的参差多态,恰恰是单人测验量不到的一面。
第三路是数据污染的老问题。这些题在网上是公开的,没法排除模型的训练材料里早就有它们,或有和它们相近的内容。这项研究的作者自己在论文里提过醒,标准化测验的高分,可以经由和人类不一样的路径达成。托兰斯那项的题目由评分机构保管,从不公开发表,这层风险小一些;像这道十个词的公开题,就难说了。
第四路认为测验条件本身对人不利。2025 年另一组研究者重做了那项 256 人的实验:只要多给人一点时间、把题目要求写清楚,人就能追平机器。原先的差距,有一部分来自测验条件本身。
回到你那十个词
四路质疑动摇的,是「测验分数等于创造力」这层引申;动摇不了的,是测出来的结果本身。
在「限时想出一批不落俗套的联想」这件事上,机器的成绩已在人类平均之上——DAT 和不寻常用途两种测验都看到了这个方向,托兰斯测验上 GPT-4 的原创性也排进了前 1%。真实的工作当然比一场四分钟的测验复杂,测验分数也换不来工作绩效的证据;但要是一份工作的核心本事就剩这种标准化的快速发散,这些分数至少值得当一声提醒——这是从测验往外的推想,不是研究的结论。宽心的理由也在数据里:前 10% 的人领先所有被测模型,写作题上方向相同;另一项研究还看到,至少在这些测验上,人群答案的花样远比模型之间的多——谁也不像谁,各有各的怪。

在这项研究里,机器考多少分,还和怎么问它有关——温度和提示词都改动过成绩,虽说不是随便哪句都灵。至于不同模型高度相似的答案,能不能靠人的引导变得更多样,现有研究只提出了问题,还没给出答案。Jerbi 在新闻稿里的态度倒是干脆:与其纠结谁替代谁,不如把生成式 AI 当成创造力的工具。它会怎样改变创作,要看下一批研究,也要看用它的人。
开头那道题,你写下的十个词还在手边吧。测验官网(datcreativity.com)今天还开着,四分钟出分。同一道题,10 万个人做过——你猜,自己能排进前百分之多少?




津公网安备12011002023007号