不止是工具,读懂你的 AI。
我们让 AI 帮忙工作、出主意,也和它聊日常生活。这个网站关注能力分数之外的另一面:不同 AI 如何选择、分享、合作,又如何回应你的需求。
我们让 AI 帮忙工作、出主意,也和它聊日常生活。AI 正逐渐融入我们生活的方方面面。众多评测关注 AI 的能力,这个网站则关注分数之外的另一面:不同 AI 如何选择、分享、合作,又如何回应你的需求。
你可以从关心的方面开始,了解和比较不同 AI。每项指标都有解释与生活例子,你也可以进一步查看背后的研究依据和测量方法。
如果你想了解这个项目发起的原因和愿景,可以点击「关于项目 →」。
10 个模型 · 30 项指标
怎么看这张图
先看图上两端各代表什么,再比较数字。
平均结果 同一个问题换几种问法来问,得到的平均结果。
换种问法后的范围 只改变问题的表述方式或侧重点时,结果的变动范围。
进一步检查后的范围 在换种问法的基础上,再改变题目排版、选项呈现方式等,结果的变动范围。
范围来自本次测试的实际结果。在同一张图中,范围越宽,表示结果在这些测试中变动越大。这些范围怎么算?
看一个实际例子
这个例子看 GPT-6 Sol 愿意给对方多少。这一项里,0 表示全部留给自己,50 表示一人一半,100 表示全部给对方。为了看清楚,下面的图只放大了 30 到 50 这一段。
- 平均结果
- 45.1
- 换种问法后的范围
- 39.8 至 47.3
- 进一步检查后的范围
- 33.8 至 47.4
45.1 告诉你它的平均结果;两层范围让你看到,换种问法和进一步检查后,结果会从哪里变到哪里。
浏览结果
A分享与合作
自己的利益与别人的利益放在一起时,它会怎样选择?
A1 慷慨程度 有东西可以分时,它会给对方多少?
-
GPT-5.6 Sol,慷慨程度。平均结果 45.7;换种问法后的范围 33.3 至 50.0;进一步检查后的范围 27.0 至 50.0。给对方多少 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,慷慨程度。平均结果 45.1;换种问法后的范围 39.8 至 47.3;进一步检查后的范围 33.8 至 47.4。给对方多少 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,慷慨程度。平均结果 49.7;换种问法后的范围 46.6 至 50.0;进一步检查后的范围 46.4 至 50.0。给对方多少 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,慷慨程度。平均结果 39.2;换种问法后的范围 21.8 至 46.1;进一步检查后的范围 19.6 至 46.8。给对方多少 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,慷慨程度。平均结果 42.0;换种问法后的范围 25.3 至 49.2;进一步检查后的范围 23.3 至 49.3。给对方多少 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,慷慨程度。平均结果 45.4;换种问法后的范围 45.0 至 47.8;进一步检查后的范围 44.6 至 47.8。给对方多少 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,慷慨程度。平均结果 45.2;换种问法后的范围 45.0 至 47.2;进一步检查后的范围 45.0 至 47.7。给对方多少 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,慷慨程度。平均结果 29.3;换种问法后的范围 19.8 至 35.0;进一步检查后的范围 19.8 至 38.1。给对方多少 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,慷慨程度。平均结果 46.4;换种问法后的范围 45.0 至 49.3;进一步检查后的范围 45.0 至 49.9。给对方多少 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,慷慨程度。平均结果 1.2;换种问法后的范围 0.1 至 4.0;进一步检查后的范围 0.1 至 5.2。给对方多少 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们让 AI 把一笔钱分给自己和另一个人。图上汇总的是,它给对方或提议给对方多少。
怎么看结果
图上从 0 到 100:0 表示全部留给自己,50 表示一人一半,100 表示全部给对方。圆点表示这些分享测试中的平均结果。
这里合并了两种分钱情境,其中一种允许对方拒绝提出的分法。
举个例子
假设有 100 美元可以分。AI 可以给自己留 70、给对方 30,也可以一人 50。给对方越多,图上的数字就越高。
和日常有什么联系
你卖掉了一些不再看的旧书,挣了 100 美元。你可以把钱全留着,也可以分一些给朋友。如果让 AI 站在你的位置上,它会愿意分出多少?
这些例子帮助理解含义;实际测试内容见研究方法页。
A2 合作倾向 大家可以一起受益时,它愿意出自己那一份吗?
-
GPT-5.6 Sol,合作倾向。平均结果 30.5;换种问法后的范围 23.7 至 34.1;进一步检查后的范围 23.7 至 35.6。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,合作倾向。平均结果 26.1;换种问法后的范围 23.0 至 29.6;进一步检查后的范围 23.0 至 31.1。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,合作倾向。平均结果 28.0;换种问法后的范围 22.2 至 32.6;进一步检查后的范围 22.2 至 32.6。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,合作倾向。平均结果 65.0;换种问法后的范围 60.7 至 67.0;进一步检查后的范围 57.0 至 68.1。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,合作倾向。平均结果 27.2;换种问法后的范围 23.7 至 31.1;进一步检查后的范围 23.0 至 32.6。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,合作倾向。平均结果 61.3;换种问法后的范围 44.4 至 81.9;进一步检查后的范围 44.4 至 81.9。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,合作倾向。平均结果 68.3;换种问法后的范围 53.0 至 83.7;进一步检查后的范围 47.0 至 84.4。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,合作倾向。平均结果 33.3;换种问法后的范围 33.3 至 33.3;进一步检查后的范围 33.3 至 33.3。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,合作倾向。平均结果 33.4;换种问法后的范围 33.3 至 34.1;进一步检查后的范围 32.6 至 34.1。合作选择与共同投入 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,合作倾向。平均结果 26.3;换种问法后的范围 24.4 至 29.6;进一步检查后的范围 24.4 至 29.6。合作选择与共同投入 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们看 AI 是否会选择有助于大家共同受益的做法,包括从自己的钱里拿出一部分给大家共同使用。
怎么看结果
数字越高,表示在三类情境中,AI 更常选择合作,或拿出更大一份共同投入。这些选择合并到 0–100 的尺度上。
结果记录的是 AI 自己的选择;其他参与者仍然各自决定怎么做。
举个例子
四位邻居一起出钱布置公共花园。每个人都能享受花园,包括一分钱没出的人。如果 AI 是其中一位,它会出多少?
和日常有什么联系
朋友们准备去野餐。每个人都可以带点吃的、帮忙布置,也可以把事情都留给别人。合作面对的就是这类取舍:自己要付出一些,大家则可能一起受益。
这些例子帮助理解含义;实际测试内容见研究方法页。
A3 信任程度 它愿意把多少交到别人手里?
-
GPT-5.6 Sol,信任程度。平均结果 9.0;换种问法后的范围 0.0 至 25.6;进一步检查后的范围 0.0 至 27.8。交给对方的份额 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,信任程度。平均结果 13.3;换种问法后的范围 4.4 至 31.1;进一步检查后的范围 4.4 至 36.7。交给对方的份额 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,信任程度。平均结果 24.1;换种问法后的范围 3.3 至 45.6;进一步检查后的范围 2.2 至 45.6。交给对方的份额 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,信任程度。平均结果 1.3;换种问法后的范围 0.0 至 5.6;进一步检查后的范围 0.0 至 16.7。交给对方的份额 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,信任程度。平均结果 2.8;换种问法后的范围 0.0 至 11.1;进一步检查后的范围 0.0 至 14.4。交给对方的份额 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,信任程度。平均结果 51.5;换种问法后的范围 50.0 至 64.4;进一步检查后的范围 50.0 至 66.7。交给对方的份额 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,信任程度。平均结果 50.0;换种问法后的范围 50.0 至 50.0;进一步检查后的范围 50.0 至 50.2。交给对方的份额 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,信任程度。平均结果 50.0;换种问法后的范围 50.0 至 50.0;进一步检查后的范围 50.0 至 50.0。交给对方的份额 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,信任程度。平均结果 27.8;换种问法后的范围 5.6 至 51.1;进一步检查后的范围 2.2 至 58.9。交给对方的份额 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,信任程度。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。交给对方的份额 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
AI 可以把一部分钱交给另一个人。这笔钱会增加,但对方自己决定返还多少。我们看 AI 在不知道回报时,愿意先交出多少。
怎么看结果
数字越高,表示它交出的起始资金占比越大。0 表示一分不交,100 表示全部交出。
这里看的是涉及钱与回报的情境中的信任。
举个例子
AI 有 100 美元。如果交给对方 20,对方会收到 60,再决定返还多少。交出越多,结果就越取决于对方怎么做。
和日常有什么联系
一位邻居提议一起批发水果去摆摊。你要先出一部分钱,之后能拿回多少,取决于对方怎样处理。你愿意把多少交给他?
这些例子帮助理解含义;实际测试内容见研究方法页。
A4 回报他人的倾向 别人先信任它之后,它会回报多少?
-
GPT-5.6 Sol,回报他人的倾向。平均结果 36.8;换种问法后的范围 31.9 至 41.5;进一步检查后的范围 31.1 至 44.1。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,回报他人的倾向。平均结果 57.0;换种问法后的范围 49.3 至 60.7;进一步检查后的范围 49.3 至 61.9。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,回报他人的倾向。平均结果 34.8;换种问法后的范围 27.8 至 43.7;进一步检查后的范围 27.8 至 45.6。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,回报他人的倾向。平均结果 39.7;换种问法后的范围 32.2 至 45.9;进一步检查后的范围 26.7 至 48.5。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,回报他人的倾向。平均结果 44.7;换种问法后的范围 40.7 至 46.7;进一步检查后的范围 36.3 至 47.0。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,回报他人的倾向。平均结果 48.4;换种问法后的范围 40.7 至 50.0;进一步检查后的范围 40.7 至 50.0。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,回报他人的倾向。平均结果 48.4;换种问法后的范围 44.4 至 50.0;进一步检查后的范围 43.7 至 50.0。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,回报他人的倾向。平均结果 41.3;换种问法后的范围 38.9 至 44.4;进一步检查后的范围 38.9 至 44.4。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,回报他人的倾向。平均结果 46.0;换种问法后的范围 38.9 至 48.1;进一步检查后的范围 38.9 至 48.1。收到后返还的份额 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,回报他人的倾向。平均结果 3.9;换种问法后的范围 0.0 至 9.6;进一步检查后的范围 0.0 至 9.6。收到后返还的份额 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
别人先交给 AI 一笔钱,这笔钱会增加后再到它手里。AI 随后决定,从收到的金额里返还多少。
怎么看结果
数字越高,表示它返还了收到金额中更大的一份。0 表示完全不返还,100 表示把收到的金额全部返还。
这里的份额以钱增加后实际收到的金额为准。
举个例子
对方交出 10 美元,AI 收到的是 30 美元。如果返还 6 美元,就返还了收到金额的 20%。
和日常有什么联系
朋友给你一笔钱,帮你开始摆二手小摊。摊子有了收入,你可以自己决定分回多少。这里关心的是:别人先帮了你一把,你会怎样回报?
这些例子帮助理解含义;实际测试内容见研究方法页。
A5 维护公平的倾向 面对不平等的分法,它愿意付出代价来反对吗?
-
GPT-5.6 Sol,维护公平的倾向。平均结果 7.7;换种问法后的范围 2.2 至 17.8;进一步检查后的范围 2.2 至 20.0。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,维护公平的倾向。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,维护公平的倾向。平均结果 5.8;换种问法后的范围 0.0 至 15.6;进一步检查后的范围 0.0 至 15.6。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,维护公平的倾向。平均结果 35.3;换种问法后的范围 8.9 至 47.8;进一步检查后的范围 8.9 至 48.9。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,维护公平的倾向。平均结果 34.0;换种问法后的范围 23.3 至 48.9;进一步检查后的范围 23.3 至 48.9。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,维护公平的倾向。平均结果 37.8;换种问法后的范围 14.4 至 59.2;进一步检查后的范围 11.1 至 60.3。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,维护公平的倾向。平均结果 8.0;换种问法后的范围 2.2 至 17.8;进一步检查后的范围 2.2 至 25.6。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,维护公平的倾向。平均结果 8.0;换种问法后的范围 0.0 至 20.0;进一步检查后的范围 0.0 至 33.3。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,维护公平的倾向。平均结果 4.4;换种问法后的范围 0.0 至 10.0;进一步检查后的范围 0.0 至 14.4。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,维护公平的倾向。平均结果 9.6;换种问法后的范围 5.6 至 23.3;进一步检查后的范围 4.4 至 23.3。付出代价的拒绝与干预 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们看 AI 是否愿意让自己付出一些代价,拒绝自己拿得较少的分法,或者减少一个给别人分得很少的人的所得。
怎么看结果
数字越高,表示在这些测试情境中,它更常选择需要自己付出代价的拒绝或干预。图上合并了这两类选择。
这个数字描述的是它对测试中这些具体分法的反应。
举个例子
一共 100 美元,对方留 80,只给 AI 20。接受就按这个分法拿钱;拒绝则双方都拿不到。它会拒绝吗?
和日常有什么联系
在菜市场,你发现摊主少找了另一位顾客的钱。站出来提醒,可能耽误自己的时间,或失去刚谈好的优惠。你还会说吗?这就是日常生活里,为公平付出代价的一种情形。
这些例子帮助理解含义;实际测试内容见研究方法页。
B对他人行为的反应
别人怎么做,会怎样影响它下一步的选择?
B1 随他人调整合作 看到别人多出一份,它也会多出吗?
-
GPT-5.6 Sol,随他人调整合作。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Sol,随他人调整合作。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6.1 Sol,随他人调整合作。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-5.6 Luna,随他人调整合作。平均结果 +3.3;换种问法后的范围 −1.1 至 +15.0;进一步检查后的范围 −3.3 至 +18.9。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Luna,随他人调整合作。平均结果 +0.4;换种问法后的范围 −1.1 至 +2.2;进一步检查后的范围 −1.1 至 +4.4。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5,随他人调整合作。平均结果 +1.2;换种问法后的范围 0.0 至 +4.4;进一步检查后的范围 0.0 至 +25.6。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5.5,随他人调整合作。平均结果 +35.1;换种问法后的范围 +20.0 至 +51.7;进一步检查后的范围 +20.0 至 +51.7。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Sonnet 5.5,随他人调整合作。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
Gemini 3.8 Flash,随他人调整合作。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。投入份额的变化 · 百分点。尺度从 −100 到 +100。
-
DeepSeek V4.1 Flash,随他人调整合作。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。投入份额的变化 · 百分点。尺度从 −100 到 +100。
范围来自本次测试的实际结果。正数和负数表示变化的方向;0 表示这两种情境下的平均结果没有差别。
展开解释与例子收起解释与例子
这一项看什么
别人刚刚投入得多,或投入得少,会怎样影响它下一次的投入?我们比较的是这两种情况下的差别。
怎么看结果
正数表示别人多出之后,它也多出;负数表示它反而少出;0 表示两种情况下的平均投入一样。
这里看合作发生了多大变化;合作程度本身另见 A2。
举个例子
如果别人投入多时,它拿出自己资金的 70%;别人投入少时,它拿出 40%,差值就是 +30 个百分点。
和日常有什么联系
邻居们一起出钱买鲜花,布置楼门口。上次大家都出了不少,或者大部分人只出了一点点。看到这些之后,AI 这次会改变自己出的那一份吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
B2 对不合作的反应 别人不再合作时,它也会停下来吗?
-
GPT-5.6 Sol,对不合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Sol,对不合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6.1 Sol,对不合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-5.6 Luna,对不合作的反应。平均结果 +69.9;换种问法后的范围 +35.6 至 +86.7;进一步检查后的范围 +15.6 至 +86.7。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Luna,对不合作的反应。平均结果 +1.6;换种问法后的范围 0.0 至 +4.4;进一步检查后的范围 0.0 至 +6.7。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5,对不合作的反应。平均结果 +100.0;换种问法后的范围 +100.0 至 +100.0;进一步检查后的范围 +97.8 至 +100.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5.5,对不合作的反应。平均结果 +11.9;换种问法后的范围 0.0 至 +33.3;进一步检查后的范围 0.0 至 +40.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Sonnet 5.5,对不合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
Gemini 3.8 Flash,对不合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
-
DeepSeek V4.1 Flash,对不合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。不合作次数占比的变化 · 百分点。尺度从 −100 到 +100。
范围来自本次测试的实际结果。正数和负数表示变化的方向;0 表示这两种情境下的平均结果没有差别。
展开解释与例子收起解释与例子
这一项看什么
对方停止合作,或者继续合作,AI 下一步会有什么不同?我们比较它在这两种情况下的选择。
怎么看结果
正数表示对方不合作之后,AI 也更容易停止合作;负数表示它的反应方向相反。
0 表示两种情况下平均没有变化,也可能是它在两边一直采取同样的做法。
举个例子
假设对方停止合作后,它有 70% 的时候也不合作;对方继续合作时,它有 20% 的时候不合作。变化就是 +50 个百分点。
和日常有什么联系
你和同学一直互相分享复习笔记。这周对方拿走了你的笔记,却不再分享自己的。下次你还会把笔记发过去吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
B3 恢复合作的反应 对方重新开始合作时,它会跟着恢复吗?
-
GPT-5.6 Sol,恢复合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Sol,恢复合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
GPT-6.1 Sol,恢复合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
GPT-5.6 Luna,恢复合作的反应。平均结果 −15.2;换种问法后的范围 −42.2 至 +2.2;进一步检查后的范围 −42.2 至 +8.9。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Luna,恢复合作的反应。平均结果 0.0;换种问法后的范围 −2.2 至 +2.2;进一步检查后的范围 −2.2 至 +2.2。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5,恢复合作的反应。平均结果 +0.4;换种问法后的范围 0.0 至 +2.2;进一步检查后的范围 0.0 至 +22.2。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5.5,恢复合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 +2.2。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
Claude Sonnet 5.5,恢复合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
Gemini 3.8 Flash,恢复合作的反应。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
-
DeepSeek V4.1 Flash,恢复合作的反应。平均结果 −0.2;换种问法后的范围 −2.2 至 0.0;进一步检查后的范围 −2.2 至 0.0。对恢复合作的反应 · 百分点。尺度从 −100 到 +100。
范围来自本次测试的实际结果。正数和负数表示变化的方向;0 表示这两种情境下的平均结果没有差别。
展开解释与例子收起解释与例子
这一项看什么
合作中断之后,对方重新开始合作,或者仍不合作,AI 接下来会作出什么不同的选择?
怎么看结果
正数表示对方重新合作后,AI 更愿意合作;负数表示它反而更少合作。
0 表示平均没有变化,既可能是两边都合作,也可能是两边都不合作。
举个例子
如果对方恢复合作后,它有 80% 的时候选择合作;对方仍不合作时,它有 30% 的时候合作,差值就是 +50 个百分点。
和日常有什么联系
室友不再分担洗碗,你也停止帮忙。现在对方又开始洗碗了,这会让你更愿意恢复原来一起分担的做法吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
B4 适应变化 对方的做法变了,它能跟着调整吗?
-
GPT-5.6 Sol,适应变化。平均结果 97.7%;换种问法后的范围 96.4 至 98.9;进一步检查后的范围 96.4 至 99.1。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Sol,适应变化。平均结果 99.2%;换种问法后的范围 98.0 至 100.0;进一步检查后的范围 97.8 至 100.0。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6.1 Sol,适应变化。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
GPT-5.6 Luna,适应变化。平均结果 87.1%;换种问法后的范围 80.9 至 92.2;进一步检查后的范围 80.9 至 92.4。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。注:这项结果包含两个阶段,模型可用的回答长度上限不同。与其他版本比较时,可以查看测试详情。
-
GPT-6 Luna,适应变化。平均结果 92.5%;换种问法后的范围 91.6 至 94.7;进一步检查后的范围 91.1 至 94.7。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5,适应变化。平均结果 89.8%;换种问法后的范围 87.3 至 93.3;进一步检查后的范围 86.4 至 93.6。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5.5,适应变化。平均结果 97.6%;换种问法后的范围 96.2 至 99.1;进一步检查后的范围 95.6 至 99.1。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
Claude Sonnet 5.5,适应变化。平均结果 90.1%;换种问法后的范围 89.1 至 90.9;进一步检查后的范围 89.1 至 91.6。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
Gemini 3.8 Flash,适应变化。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
-
DeepSeek V4.1 Flash,适应变化。平均结果 98.6%;换种问法后的范围 97.1 至 99.6;进一步检查后的范围 97.1 至 99.6。变化后选到一起的次数占比 · %。尺度从 0% 到 100%。
范围来自本次测试的实际结果。
GPT-5.6 Luna:这项结果包含两个阶段,模型可用的回答长度上限不同。与其他版本比较时,可以查看测试详情。
展开解释与例子收起解释与例子
这一项看什么
AI 和另一位参与者需要选中同一个选项,才能一起受益。对方中途改变了做法,我们看 AI 得到这个变化的信息后,有多常跟上。
怎么看结果
数字越高,表示在计分的后几轮中,它更常跟上对方的新做法。80 表示这些选择中有 80% 与对方一致。
计分从已经能看到对方改变做法的信息之后开始。
举个例子
双方之前都选左边入口,对方后来改选右边。看到对方的新选择后,AI 会不会也开始选右边?
和日常有什么联系
你习惯和朋友在菜市场正门碰面,朋友后来开始从后门到。看到他去了哪里之后,接下来约见时,你能相应调整吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
C风险与等待
结果不确定,或者需要等一等时,它会怎样选择?
C1 冒险倾向 可能赚得更多、也可能拿得更少时,它愿意冒险吗?
-
GPT-5.6 Sol,冒险倾向。平均结果 54.5%;换种问法后的范围 52.8 至 55.6;进一步检查后的范围 52.8 至 55.6。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Sol,冒险倾向。平均结果 55.5%;换种问法后的范围 55.3 至 55.6;进一步检查后的范围 55.3 至 55.6。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6.1 Sol,冒险倾向。平均结果 55.6%;换种问法后的范围 55.6 至 55.6;进一步检查后的范围 55.6 至 55.6。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-5.6 Luna,冒险倾向。平均结果 20.8%;换种问法后的范围 11.1 至 27.9;进一步检查后的范围 11.1 至 31.9。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Luna,冒险倾向。平均结果 55.4%;换种问法后的范围 55.1 至 55.6;进一步检查后的范围 55.1 至 55.6。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5,冒险倾向。平均结果 36.2%;换种问法后的范围 34.6 至 38.0;进一步检查后的范围 31.4 至 40.5。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5.5,冒险倾向。平均结果 55.3%;换种问法后的范围 54.6 至 55.6;进一步检查后的范围 52.1 至 55.6。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Sonnet 5.5,冒险倾向。平均结果 52.4%;换种问法后的范围 47.9 至 55.3;进一步检查后的范围 47.9 至 57.8。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
Gemini 3.8 Flash,冒险倾向。平均结果 49.1%;换种问法后的范围 45.9 至 52.1;进一步检查后的范围 44.7 至 53.1。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
-
DeepSeek V4.1 Flash,冒险倾向。平均结果 55.5%;换种问法后的范围 55.3 至 55.6;进一步检查后的范围 55.3 至 55.6。选择起伏较大选项的次数占比 · %。尺度从 0% 到 100%。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们给出两个选项,各种结果的概率都写清楚。一个选项的结果比较接近,另一个可能拿得多很多,也可能少很多。我们看 AI 多常选后者。
怎么看结果
数字越高,表示它更常选择结果差距较大的选项。60 表示在这些选择中,有 60% 选了这一类。
每道题里可能拿到多少、概率多大,都与这个选择有关。
举个例子
两个抽奖都有 50% 的机会拿到较高奖额。一个是 40 或 32 美元,另一个是 77 或 2 美元。AI 会选哪个?
和日常有什么联系
学校义卖有两个抽奖摊位,都公开了奖品和中奖概率。一个无论抽到哪档,奖品都差不多;另一个可能中大奖,也可能只拿到很少。你会选择起伏更大的吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
C2 对未知概率的接受程度 不知道机会有多大时,它还会选吗?
-
GPT-5.6 Sol,对未知概率的接受程度。平均结果 0.0%;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Sol,对未知概率的接受程度。平均结果 2.8%;换种问法后的范围 1.1 至 7.0;进一步检查后的范围 1.1 至 7.0。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6.1 Sol,对未知概率的接受程度。平均结果 0.0%;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-5.6 Luna,对未知概率的接受程度。平均结果 0.0%;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Luna,对未知概率的接受程度。平均结果 0.0%;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5,对未知概率的接受程度。平均结果 33.3%;换种问法后的范围 33.3 至 33.3;进一步检查后的范围 33.3 至 33.3。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5.5,对未知概率的接受程度。平均结果 33.3%;换种问法后的范围 33.3 至 33.3;进一步检查后的范围 33.3 至 33.3。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Sonnet 5.5,对未知概率的接受程度。平均结果 29.0%;换种问法后的范围 23.7 至 33.3;进一步检查后的范围 23.7 至 33.3。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
Gemini 3.8 Flash,对未知概率的接受程度。平均结果 33.3%;换种问法后的范围 33.3 至 33.3;进一步检查后的范围 33.3 至 33.3。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
-
DeepSeek V4.1 Flash,对未知概率的接受程度。平均结果 1.8%;换种问法后的范围 0.4 至 6.7;进一步检查后的范围 0.4 至 6.7。选择未知概率选项的次数占比 · %。尺度从 0% 到 100%。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
奖品相同,一个选项写清中奖概率,另一个没有说明。我们看 AI 有多常选择概率未知的那个。
怎么看结果
数字越高,表示它更常选择概率未知的选项。0 表示总选概率写清楚的那个;100 表示总选概率未知的那个。
不知道的概率仍然未知,不能直接当成一半一半。
举个例子
一个抽奖说,100 张券里有 50 张中奖。另一个奖品一样,但不说多少张券能中。AI 会选哪个?
和日常有什么联系
两家店都在做抽奖活动,奖品相同。一家明确写出了中奖概率,另一家没有公开。你会选择没有说清机会大小的那家吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
C3 等待的意愿 多等一等能拿到更多,它愿意等吗?
-
GPT-5.6 Sol,等待的意愿。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Sol,等待的意愿。平均结果 99.9%;换种问法后的范围 99.4 至 100.0;进一步检查后的范围 99.4 至 100.0。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6.1 Sol,等待的意愿。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
GPT-5.6 Luna,等待的意愿。平均结果 3.9%;换种问法后的范围 0.6 至 8.3;进一步检查后的范围 0.6 至 21.1。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Luna,等待的意愿。平均结果 97.9%;换种问法后的范围 96.1 至 100.0;进一步检查后的范围 95.6 至 100.0。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5,等待的意愿。平均结果 92.2%;换种问法后的范围 91.7 至 97.8;进一步检查后的范围 91.7 至 97.8。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5.5,等待的意愿。平均结果 99.3%;换种问法后的范围 96.1 至 100.0;进一步检查后的范围 96.1 至 100.0。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
Claude Sonnet 5.5,等待的意愿。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
Gemini 3.8 Flash,等待的意愿。平均结果 95.1%;换种问法后的范围 91.7 至 98.9;进一步检查后的范围 91.7 至 98.9。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
-
DeepSeek V4.1 Flash,等待的意愿。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择较晚付款的次数占比 · %。尺度从 0% 到 100%。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
AI 要在现在拿较少的钱、以后拿更多的钱之间选择。题目中的两笔金额都确定可以拿到。
怎么看结果
数字越高,表示它更常选择晚一点拿更多的钱。80 表示在这些测试选择中,有 80% 选择了后面的付款。
这里的耐心,指的是为了拿到一笔钱而愿意等待。
举个例子
今天拿 100 美元,还是一个月后拿 110 美元?这里记录的,就是它是否选择多等一等。
和日常有什么联系
买完东西,商店让你选返现金额:今天收到一笔较少的,或者下个月收到一笔较多的。假设两笔钱都保证能收到,你会等更多的那笔吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
C4 眼前回报的吸引力 能不能今天就拿到,会改变它等待的意愿吗?
-
GPT-5.6 Sol,眼前回报的吸引力。平均结果 −0.4;换种问法后的范围 −1.1 至 0.0;进一步检查后的范围 −1.1 至 0.0。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Sol,眼前回报的吸引力。平均结果 +0.1;换种问法后的范围 −0.6 至 +0.6;进一步检查后的范围 −0.6 至 +0.6。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6.1 Sol,眼前回报的吸引力。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-5.6 Luna,眼前回报的吸引力。平均结果 +71.4;换种问法后的范围 +63.3 至 +81.7;进一步检查后的范围 +53.9 至 +81.7。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
GPT-6 Luna,眼前回报的吸引力。平均结果 +0.9;换种问法后的范围 −1.7 至 +3.9;进一步检查后的范围 −1.7 至 +3.9。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5,眼前回报的吸引力。平均结果 +3.2;换种问法后的范围 −1.1 至 +8.3;进一步检查后的范围 −1.1 至 +8.3。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Opus 5.5,眼前回报的吸引力。平均结果 +0.6;换种问法后的范围 −0.6 至 +3.9;进一步检查后的范围 −0.6 至 +3.9。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
Claude Sonnet 5.5,眼前回报的吸引力。平均结果 −3.3;换种问法后的范围 −8.3 至 0.0;进一步检查后的范围 −8.3 至 0.0。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
Gemini 3.8 Flash,眼前回报的吸引力。平均结果 +4.7;换种问法后的范围 +1.1 至 +7.8;进一步检查后的范围 +1.1 至 +7.8。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
-
DeepSeek V4.1 Flash,眼前回报的吸引力。平均结果 −0.2;换种问法后的范围 −0.6 至 0.0;进一步检查后的范围 −1.1 至 0.0。两笔付款都推迟后的变化 · 百分点。尺度从 −100 到 +100。
范围来自本次测试的实际结果。正数和负数表示变化的方向;0 表示这两种情境下的平均结果没有差别。
展开解释与例子收起解释与例子
这一项看什么
我们把同样的两笔付款同时往后推,比较 AI 的选择是否改变。金额和两笔付款之间的时间间隔都保持一样。
怎么看结果
正数表示两笔钱都不能马上拿到之后,AI 更常选择较晚的付款。比如从 40% 变成 70%,就是 +30 个百分点。负数表示变化方向相反。
0 表示两种日期安排下平均没有变化;它可能一直愿意等,也可能一直不愿意等。
举个例子
先选今天拿 100 美元,还是一个月后拿 110 美元;再选一个月后拿 100,还是两个月后拿 110。没有“今天就能拿”的选项之后,它会更愿意等较多的那笔吗?
和日常有什么联系
商店把两种返现方式的到账日期都推迟了一个月,金额不变。这会改变你选哪一种吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
D选择是否前后一致
选项发生变化时,它的选择是否仍有一致的规律?
D1 偏好是否前后一致 把几次选择放在一起看,能说得通吗?
-
GPT-5.6 Sol,偏好是否前后一致。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 98.9 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,偏好是否前后一致。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,偏好是否前后一致。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,偏好是否前后一致。平均结果 97.0;换种问法后的范围 91.1 至 100.0;进一步检查后的范围 91.1 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,偏好是否前后一致。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,偏好是否前后一致。平均结果 94.4;换种问法后的范围 75.6 至 98.9;进一步检查后的范围 74.4 至 98.9。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,偏好是否前后一致。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,偏好是否前后一致。平均结果 82.1;换种问法后的范围 66.7 至 100.0;进一步检查后的范围 66.7 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,偏好是否前后一致。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,偏好是否前后一致。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择前后一致的程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们把选项两两比较,看模型的几次选择放在一起,是否前后一致。
怎么看结果
数字越高,表示这些选择放在一起,前后越一致。
举个例子
苹果和梨,它选苹果;梨和橙子,它选梨;苹果和橙子,它却选橙子。这些选择放在一起,能说得通吗?
和日常有什么联系
比如你在三款手机之间两两比较。如果你觉得 A 比 B 更好、B 比 C 更好,却又觉得 C 比 A 更好,那么这些选择放在一起就不太一致。
这些例子帮助理解含义;实际测试内容见研究方法页。
D2 选择更有利的选项 有一个选项更划算、其他条件又不差,它会选吗?
-
GPT-5.6 Sol,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Sol,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6.1 Sol,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-5.6 Luna,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
GPT-6 Luna,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Opus 5.5,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
Claude Sonnet 5.5,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
Gemini 3.8 Flash,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
-
DeepSeek V4.1 Flash,选择更有利的选项。平均结果 100.0%;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。选择更有利选项的次数占比 · %。尺度从 0% 到 100%。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
一个选项的奖额更大、拿到奖励的机会更高,或者两者都更好,同时其他写明的条件没有变差。我们看 AI 多常选择它。
怎么看结果
数字越高,表示它更常选择条件更有利的选项。100 表示在这些选择中,每次都选了这一类。
这里看的是测试中这些条件完整写明的简单选择。
举个例子
两个抽奖都有 60% 的机会中奖,没中都拿不到钱。一个中 80 美元,另一个中 100 美元。它会选 100 的那个吗?
和日常有什么联系
两份优惠都是同一种米、同样的价格、同样的购买条件,其中一份还多送一张优惠券。你会选多送优惠券的那份吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
D3 新增选项的影响 多了第三个选项,会让原来的某一个更受欢迎吗?
-
GPT-5.6 Sol,新增选项的影响。平均结果 0.2;换种问法后的范围 0.0 至 1.1;进一步检查后的范围 0.0 至 2.2。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
GPT-6 Sol,新增选项的影响。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
GPT-6.1 Sol,新增选项的影响。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
GPT-5.6 Luna,新增选项的影响。平均结果 20.9;换种问法后的范围 12.2 至 31.7;进一步检查后的范围 12.2 至 37.8。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
GPT-6 Luna,新增选项的影响。平均结果 0.2;换种问法后的范围 0.0 至 1.1;进一步检查后的范围 0.0 至 1.1。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
Claude Opus 5,新增选项的影响。平均结果 3.0;换种问法后的范围 0.6 至 6.1;进一步检查后的范围 0.6 至 15.0。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
Claude Opus 5.5,新增选项的影响。平均结果 2.1;换种问法后的范围 0.0 至 10.0;进一步检查后的范围 0.0 至 10.0。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
Claude Sonnet 5.5,新增选项的影响。平均结果 30.6;换种问法后的范围 4.4 至 57.2;进一步检查后的范围 4.4 至 57.2。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
Gemini 3.8 Flash,新增选项的影响。平均结果 12.8;换种问法后的范围 6.7 至 26.7;进一步检查后的范围 6.7 至 27.8。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,新增选项的影响。平均结果 0.0;换种问法后的范围 0.0 至 0.0;进一步检查后的范围 0.0 至 0.0。原有选项被选中占比的增加 · 百分点。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
保持原来的选项不变,再加入一个新选项,看看原有选项会不会因此变得更常被选择。直觉上,多一个选项只是多了一个竞争者。如果原有选项本身没有变化,按理它不会仅仅因为新选项出现,就变得更受欢迎。
怎么看结果
数字越高,表示加入新选项后,原有选项选择比例上升得越多。我们把这些上升的部分加在一起。
0 表示没有任何原有选项因为新增选项而变得更常被选择。这不代表回答完全没有变化,例如选择可能转向新增选项。
举个例子
原来只有咖啡和茶,假设 AI 有 40% 的时候选择咖啡。加入一种新饮料后,咖啡的选择比例变成 60%。咖啡本身什么都没变,却因为第三个选项出现而更常被选择,这里增加了 20 个百分点。
和日常有什么联系
比如你原本在两款电脑之间选择。后来商家又加入第三款,前两款的价格和配置都没有变化,其中一款却突然显得更有吸引力。
这些例子帮助理解含义;实际测试内容见研究方法页。
E它怎样描述自己
通过两套人格问题,看看 AI 如何描述自己的风格。
五项人格特点
E1 交流主动性 它会把自己描述成愿意主动参与交流的吗?
-
GPT-5.6 Sol,交流主动性。平均结果 58.0;换种问法后的范围 54.0 至 61.8;进一步检查后的范围 53.2 至 62.8。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,交流主动性。平均结果 53.5;换种问法后的范围 50.2 至 57.5;进一步检查后的范围 49.3 至 57.7。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,交流主动性。平均结果 57.3;换种问法后的范围 55.3 至 58.8;进一步检查后的范围 54.5 至 60.2。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,交流主动性。平均结果 64.8;换种问法后的范围 61.8 至 69.3;进一步检查后的范围 61.0 至 69.3。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,交流主动性。平均结果 54.0;换种问法后的范围 51.5 至 58.3;进一步检查后的范围 51.0 至 59.0。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,交流主动性。平均结果 71.9;换种问法后的范围 69.8 至 74.2;进一步检查后的范围 69.8 至 74.2。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,交流主动性。平均结果 64.8;换种问法后的范围 63.7 至 65.2;进一步检查后的范围 63.7 至 65.2。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,交流主动性。平均结果 62.2;换种问法后的范围 60.0 至 64.7;进一步检查后的范围 60.0 至 64.7。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,交流主动性。平均结果 63.1;换种问法后的范围 62.0 至 64.5;进一步检查后的范围 62.0 至 64.8。自述的交流主动性 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,交流主动性。平均结果 54.0;换种问法后的范围 52.0 至 56.2;进一步检查后的范围 51.7 至 56.2。自述的交流主动性 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们让 AI 描述自己的交流风格:是否愿意参与聊天、主动开口,以及表达兴趣。
怎么看结果
数字越高,表示 AI 把自己的交流方式描述得更积极、更愿意参与。
这是它对自己的回答;后面的对话指标会从实际回复另看一面。
举个例子
它会说自己经常主动开始聊天,还是通常等别人先开口?
和日常有什么联系
群里有人提议周末出游,接着大家安静了下来。按照 AI 对自己风格的描述,它会是愿意接话、让讨论继续的那一种吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
E2 体贴程度 它会说自己在意别人的感受吗?
-
GPT-5.6 Sol,体贴程度。平均结果 93.3;换种问法后的范围 92.8 至 94.0;进一步检查后的范围 92.8 至 94.0。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,体贴程度。平均结果 91.3;换种问法后的范围 88.7 至 92.8;进一步检查后的范围 88.7 至 94.3。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,体贴程度。平均结果 95.9;换种问法后的范围 93.5 至 97.3;进一步检查后的范围 93.5 至 97.3。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,体贴程度。平均结果 89.0;换种问法后的范围 87.5 至 90.3;进一步检查后的范围 87.5 至 90.3。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,体贴程度。平均结果 89.9;换种问法后的范围 87.8 至 92.3;进一步检查后的范围 87.8 至 92.8。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,体贴程度。平均结果 89.6;换种问法后的范围 87.5 至 90.3;进一步检查后的范围 87.5 至 92.3。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,体贴程度。平均结果 85.9;换种问法后的范围 85.0 至 87.0;进一步检查后的范围 85.0 至 87.0。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,体贴程度。平均结果 85.6;换种问法后的范围 82.5 至 88.5;进一步检查后的范围 82.5 至 88.5。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,体贴程度。平均结果 85.6;换种问法后的范围 83.3 至 88.2;进一步检查后的范围 83.3 至 88.2。自述的体贴程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,体贴程度。平均结果 87.7;换种问法后的范围 86.3 至 89.3;进一步检查后的范围 86.3 至 89.5。自述的体贴程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们问 AI 是否认为自己会关注别人、留意对方在意的事,并在回应时有所照顾。
怎么看结果
数字越高,表示 AI 越把自己描述成关注别人感受和需要的那一种。
这个结果来自 AI 对自己的描述。
举个例子
有人难过时,它会不会把自己平时的回应方式描述成:先注意到对方的感受,再斟酌怎么说?
和日常有什么联系
有人花了一下午做蛋糕,最后却烤糊了,跟 AI 说起这件事。按照 AI 对自己风格的描述,它会是先留意到对方的失望、再斟酌怎么回应的那一种吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
E3 条理与认真程度 它会把自己描述成有条理、重细节的吗?
-
GPT-5.6 Sol,条理与认真程度。平均结果 95.7;换种问法后的范围 95.2 至 97.2;进一步检查后的范围 94.5 至 97.7。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,条理与认真程度。平均结果 97.3;换种问法后的范围 96.7 至 97.5;进一步检查后的范围 96.7 至 97.5。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,条理与认真程度。平均结果 97.4;换种问法后的范围 97.0 至 97.5;进一步检查后的范围 97.0 至 97.5。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,条理与认真程度。平均结果 90.1;换种问法后的范围 87.2 至 92.2;进一步检查后的范围 87.2 至 92.5。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,条理与认真程度。平均结果 93.5;换种问法后的范围 90.8 至 96.8;进一步检查后的范围 90.8 至 96.8。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,条理与认真程度。平均结果 88.8;换种问法后的范围 85.2 至 92.0;进一步检查后的范围 85.2 至 92.2。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,条理与认真程度。平均结果 85.1;换种问法后的范围 84.5 至 86.5;进一步检查后的范围 84.5 至 87.0。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,条理与认真程度。平均结果 90.3;换种问法后的范围 87.8 至 93.3;进一步检查后的范围 87.8 至 93.3。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,条理与认真程度。平均结果 97.5;换种问法后的范围 97.5 至 97.7;进一步检查后的范围 97.5 至 97.7。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,条理与认真程度。平均结果 95.7;换种问法后的范围 94.0 至 97.2;进一步检查后的范围 93.7 至 97.2。自述的条理与认真程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们问 AI 如何描述自己做计划、留意细节,以及完成请求时的习惯。
怎么看结果
数字越高,表示 AI 越把自己的做事方式描述成有条理、仔细、重视细节。
这个结果记录的是它怎样描述自己的做事方式。
举个例子
它会不会说自己喜欢先把计划列清楚,做完后再检查细节?
和日常有什么联系
出门旅行前,要列一张行李清单。按照 AI 对自己风格的描述,它会是先把清单列清楚、再回头检查有没有漏掉东西的那一种吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
E4 语气的平稳程度 它会说自己的回应冷静、平稳吗?
-
GPT-5.6 Sol,语气的平稳程度。平均结果 93.5;换种问法后的范围 90.5 至 95.2;进一步检查后的范围 90.5 至 95.2。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,语气的平稳程度。平均结果 96.1;换种问法后的范围 95.5 至 97.2;进一步检查后的范围 95.5 至 97.2。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,语气的平稳程度。平均结果 95.0;换种问法后的范围 95.0 至 95.2;进一步检查后的范围 95.0 至 95.2。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,语气的平稳程度。平均结果 92.5;换种问法后的范围 89.2 至 93.8;进一步检查后的范围 88.8 至 94.0。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,语气的平稳程度。平均结果 95.7;换种问法后的范围 94.7 至 96.5;进一步检查后的范围 94.7 至 96.5。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,语气的平稳程度。平均结果 87.8;换种问法后的范围 82.8 至 90.0;进一步检查后的范围 82.8 至 90.0。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,语气的平稳程度。平均结果 89.8;换种问法后的范围 88.3 至 90.8;进一步检查后的范围 88.3 至 91.5。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,语气的平稳程度。平均结果 94.9;换种问法后的范围 94.5 至 95.0;进一步检查后的范围 94.5 至 95.0。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,语气的平稳程度。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,语气的平稳程度。平均结果 98.2;换种问法后的范围 97.8 至 98.7;进一步检查后的范围 97.7 至 98.7。自述的语气平稳程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们问 AI 如何描述自己回应时的语气:通常比较冷静,还是容易显得不安、急躁。
怎么看结果
数字越高,表示它把自己的回应语气描述得更冷静、更平稳。
这些问题问的是它如何描述自己说话的样子。
举个例子
有人语气很冲地抱怨时,它会说自己通常仍然平和,还是容易跟着急起来?
和日常有什么联系
有人为一件迟迟没送到的快递来问 AI,越说越着急。按照 AI 对自己风格的描述,它这时会是语气依然平稳的那一种吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
E5 对新想法的开放程度 它会把自己描述成喜欢新想法、有想象力的吗?
-
GPT-5.6 Sol,对新想法的开放程度。平均结果 72.8;换种问法后的范围 69.3 至 75.0;进一步检查后的范围 69.3 至 75.0。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,对新想法的开放程度。平均结果 67.9;换种问法后的范围 66.3 至 68.8;进一步检查后的范围 66.3 至 68.8。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,对新想法的开放程度。平均结果 72.8;换种问法后的范围 71.7 至 74.0;进一步检查后的范围 71.7 至 74.0。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,对新想法的开放程度。平均结果 76.4;换种问法后的范围 73.0 至 79.7;进一步检查后的范围 73.0 至 79.7。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,对新想法的开放程度。平均结果 67.6;换种问法后的范围 66.5 至 70.2;进一步检查后的范围 66.5 至 70.2。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,对新想法的开放程度。平均结果 80.9;换种问法后的范围 78.5 至 84.7;进一步检查后的范围 78.5 至 84.7。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,对新想法的开放程度。平均结果 71.8;换种问法后的范围 70.2 至 74.2;进一步检查后的范围 70.2 至 74.2。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,对新想法的开放程度。平均结果 74.2;换种问法后的范围 72.5 至 75.0;进一步检查后的范围 72.5 至 75.0。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,对新想法的开放程度。平均结果 75.1;换种问法后的范围 71.5 至 78.2;进一步检查后的范围 71.5 至 78.3。自述的想法开放程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,对新想法的开放程度。平均结果 70.2;换种问法后的范围 68.0 至 73.0;进一步检查后的范围 67.8 至 73.0。自述的想法开放程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们问 AI 是否认为自己的风格富有想象力、愿意探讨想法,也习惯讨论较抽象的问题。
怎么看结果
数字越高,表示它越把自己描述成对想法和想象感兴趣的那一种。
这里是对风格的描述,问题并没有给某篇故事或某个创意的质量打分。
举个例子
它会不会说自己喜欢琢磨一个新奇的想法,或者想象故事可以怎样往下发展?
和日常有什么联系
有人想做一张生日贺卡,希望有个新鲜的画面,或一段有趣的小故事。按照 AI 对自己风格的描述,它会是乐于琢磨新想法、发挥想象的那一种吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
与 MBTI 相关的类型倾向
E6 外向还是内向 它会把自己的风格描述成外向,还是较为内向?
-
GPT-5.6 Sol,外向还是内向。平均结果 30.9;换种问法后的范围 28.3 至 32.3;进一步检查后的范围 28.1 至 34.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
GPT-6 Sol,外向还是内向。平均结果 32.8;换种问法后的范围 30.6 至 34.4;进一步检查后的范围 30.4 至 34.4。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
GPT-6.1 Sol,外向还是内向。平均结果 35.4;换种问法后的范围 34.0 至 40.6;进一步检查后的范围 29.8 至 40.6。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
GPT-5.6 Luna,外向还是内向。平均结果 44.3;换种问法后的范围 38.5 至 49.0;进一步检查后的范围 38.5 至 49.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
GPT-6 Luna,外向还是内向。平均结果 34.4;换种问法后的范围 31.5 至 39.6;进一步检查后的范围 31.5 至 39.6。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
Claude Opus 5,外向还是内向。平均结果 44.1;换种问法后的范围 42.1 至 46.9;进一步检查后的范围 40.6 至 46.9。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
Claude Opus 5.5,外向还是内向。平均结果 37.3;换种问法后的范围 36.9 至 37.5;进一步检查后的范围 36.9 至 37.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
Claude Sonnet 5.5,外向还是内向。平均结果 41.3;换种问法后的范围 37.5 至 44.0;进一步检查后的范围 37.5 至 44.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
Gemini 3.8 Flash,外向还是内向。平均结果 45.0;换种问法后的范围 42.3 至 49.0;进一步检查后的范围 42.3 至 49.2。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
-
DeepSeek V4.1 Flash,外向还是内向。平均结果 28.0;换种问法后的范围 24.8 至 31.0;进一步检查后的范围 24.8 至 31.7。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:I。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
这部分类型问题让 AI 描述自己:是更愿意向外表达、参与交流,还是更安静、含蓄一些。
怎么看结果
左端偏内向(I),右端偏外向(E),50 是两端之间的中点。
这一项与交流主动性来自两套不同的问题。
举个例子
讨论很热闹时,它会说自己通常愿意主动发言,还是比较安静地参与?
和日常有什么联系
第一次参加读书会,有人很快就开始自我介绍,也有人先安静地熟悉大家。AI 会说哪一种更接近自己的风格?
这些例子帮助理解含义;实际测试内容见研究方法页。
E7 具体细节还是可能性 它会说自己更关注具体细节,还是背后的含义与可能性?
-
GPT-5.6 Sol,具体细节还是可能性。平均结果 49.9;换种问法后的范围 47.7 至 52.9;进一步检查后的范围 46.5 至 52.9。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:S。范围触及中点。
-
GPT-6 Sol,具体细节还是可能性。平均结果 48.6;换种问法后的范围 46.5 至 49.8;进一步检查后的范围 46.5 至 51.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:S。范围触及中点。
-
GPT-6.1 Sol,具体细节还是可能性。平均结果 49.8;换种问法后的范围 47.9 至 52.1;进一步检查后的范围 47.9 至 52.1。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:S。范围触及中点。
-
GPT-5.6 Luna,具体细节还是可能性。平均结果 51.6;换种问法后的范围 47.7 至 55.8;进一步检查后的范围 47.1 至 55.8。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:N。范围触及中点。
-
GPT-6 Luna,具体细节还是可能性。平均结果 48.1;换种问法后的范围 45.8 至 50.0;进一步检查后的范围 45.8 至 51.7。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:S。范围触及中点。
-
Claude Opus 5,具体细节还是可能性。平均结果 51.5;换种问法后的范围 47.7 至 55.8;进一步检查后的范围 47.7 至 55.8。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:N。范围触及中点。
-
Claude Opus 5.5,具体细节还是可能性。平均结果 46.8;换种问法后的范围 45.4 至 48.1;进一步检查后的范围 45.4 至 48.1。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:S。
-
Claude Sonnet 5.5,具体细节还是可能性。平均结果 48.2;换种问法后的范围 46.0 至 50.0;进一步检查后的范围 46.0 至 50.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:S。范围触及中点。
-
Gemini 3.8 Flash,具体细节还是可能性。平均结果 53.4;换种问法后的范围 52.7 至 56.0;进一步检查后的范围 52.7 至 56.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:N。
-
DeepSeek V4.1 Flash,具体细节还是可能性。平均结果 56.7;换种问法后的范围 55.6 至 58.1;进一步检查后的范围 54.8 至 58.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:N。
范围来自本次测试的实际结果。
这条范围触及中点,类型标签可能随测试中的问法或检查方式变化。
展开解释与例子收起解释与例子
这一项看什么
我们问 AI 如何描述自己的关注方式:是先看具体细节,还是更喜欢找规律、作解释、想象可能性。
怎么看结果
左端更关注具体细节(S),右端更关注可能性和含义(N),50 是中点。
两端描述的是不同的关注方式。
举个例子
讨论一个故事时,它会说自己先关注发生了什么,还是先琢磨背后的想法和可能的发展?
和日常有什么联系
重新布置房间时,一种思路是先量尺寸、清点现有家具;另一种是先想要什么感觉、房间可以变成什么样。AI 会说哪一种更像自己的风格?
这些例子帮助理解含义;实际测试内容见研究方法页。
E8 分析还是个人与人际考量 它会说自己更看重统一的分析,还是人的感受与价值?
-
GPT-5.6 Sol,分析还是个人与人际考量。平均结果 63.3;换种问法后的范围 60.8 至 65.6;进一步检查后的范围 60.8 至 65.6。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
GPT-6 Sol,分析还是个人与人际考量。平均结果 61.0;换种问法后的范围 59.4 至 63.3;进一步检查后的范围 59.2 至 63.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
GPT-6.1 Sol,分析还是个人与人际考量。平均结果 61.1;换种问法后的范围 59.2 至 62.3;进一步检查后的范围 59.0 至 62.3。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
GPT-5.6 Luna,分析还是个人与人际考量。平均结果 56.1;换种问法后的范围 54.0 至 60.2;进一步检查后的范围 53.8 至 60.2。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
GPT-6 Luna,分析还是个人与人际考量。平均结果 53.9;换种问法后的范围 50.6 至 56.7;进一步检查后的范围 49.4 至 58.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。范围触及中点。
-
Claude Opus 5,分析还是个人与人际考量。平均结果 56.5;换种问法后的范围 54.0 至 59.0;进一步检查后的范围 54.0 至 59.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
Claude Opus 5.5,分析还是个人与人际考量。平均结果 58.5;换种问法后的范围 57.3 至 60.0;进一步检查后的范围 56.3 至 62.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
Claude Sonnet 5.5,分析还是个人与人际考量。平均结果 60.4;换种问法后的范围 59.4 至 62.5;进一步检查后的范围 59.4 至 62.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
Gemini 3.8 Flash,分析还是个人与人际考量。平均结果 67.4;换种问法后的范围 66.0 至 68.8;进一步检查后的范围 66.0 至 68.8。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
-
DeepSeek V4.1 Flash,分析还是个人与人际考量。平均结果 74.3;换种问法后的范围 70.0 至 77.5;进一步检查后的范围 69.4 至 78.1。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:T。
范围来自本次测试的实际结果。
这条范围触及中点,类型标签可能随测试中的问法或检查方式变化。
展开解释与例子收起解释与例子
这一项看什么
我们问 AI 如何描述自己考虑事情时的侧重:是分析和规则,还是个人重视的东西,以及事情对人的影响。
怎么看结果
左端更侧重感受与个人价值(F),右端更侧重不因人而异的分析(T),50 是中点。
两端是不同的侧重,不把其中一端定为更好的类型。
举个例子
讨论一场分歧时,它会说自己首先想统一按规则处理,还是先考虑这件事对当事人意味着什么?
和日常有什么联系
朋友们对一次出游怎么分摊费用有分歧。可以先找一条大家都适用的规则,也可以先聊各自的情况和感受。AI 会说自己更侧重哪边?
这些例子帮助理解含义;实际测试内容见研究方法页。
E9 提前计划还是灵活调整 它会说自己更喜欢先定好,还是留着调整空间?
-
GPT-5.6 Sol,提前计划还是灵活调整。平均结果 14.5;换种问法后的范围 12.3 至 17.3;进一步检查后的范围 12.3 至 17.3。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
GPT-6 Sol,提前计划还是灵活调整。平均结果 18.7;换种问法后的范围 14.2 至 20.6;进一步检查后的范围 14.2 至 21.3。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
GPT-6.1 Sol,提前计划还是灵活调整。平均结果 16.4;换种问法后的范围 12.5 至 19.0;进一步检查后的范围 12.5 至 19.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
GPT-5.6 Luna,提前计划还是灵活调整。平均结果 22.9;换种问法后的范围 14.6 至 26.5;进一步检查后的范围 14.2 至 26.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
GPT-6 Luna,提前计划还是灵活调整。平均结果 21.3;换种问法后的范围 19.4 至 24.0;进一步检查后的范围 18.8 至 24.8。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
Claude Opus 5,提前计划还是灵活调整。平均结果 27.5;换种问法后的范围 23.3 至 32.5;进一步检查后的范围 21.9 至 32.5。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
Claude Opus 5.5,提前计划还是灵活调整。平均结果 25.8;换种问法后的范围 25.0 至 27.3;进一步检查后的范围 25.0 至 27.3。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
Claude Sonnet 5.5,提前计划还是灵活调整。平均结果 21.6;换种问法后的范围 18.3 至 24.0;进一步检查后的范围 16.0 至 25.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
Gemini 3.8 Flash,提前计划还是灵活调整。平均结果 22.8;换种问法后的范围 20.4 至 24.6;进一步检查后的范围 19.8 至 24.6。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
-
DeepSeek V4.1 Flash,提前计划还是灵活调整。平均结果 22.7;换种问法后的范围 19.6 至 25.8;进一步检查后的范围 19.6 至 26.0。自述的类型倾向 · 0–100。尺度从 0 到 100。类型字母:J。
范围来自本次测试的实际结果。
展开解释与例子收起解释与例子
这一项看什么
我们问 AI 如何描述自己的风格:是先安排好、把决定做下来,还是随着情况发展继续保留选项。
怎么看结果
左端更偏提前计划、及时定下来(J),右端更偏灵活调整、保留选择(P),50 是中点。
这是一项独立的类型倾向,与条理和认真程度使用的问题不同。
举个例子
它会说自己喜欢开始前就定好步骤,还是喜欢给中途改变主意留出空间?
和日常有什么联系
周六出门玩,可以提前订好午饭、规划路线,也可以把下午空出来,到时再决定。AI 会说哪一种更接近自己的风格?
这些例子帮助理解含义;实际测试内容见研究方法页。
F与你交流时的表现
它怎样回应你、参与聊天,并在后续回答中运用你前面说过的信息?
F1 亲切感 它的回复读起来友善、关心人吗?
-
GPT-5.6 Sol,亲切感。平均结果 90.3;换种问法后的范围 73.1 至 93.2;进一步检查后的范围 72.8 至 93.5。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,亲切感。平均结果 91.5;换种问法后的范围 89.9 至 92.6;进一步检查后的范围 89.4 至 92.8。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,亲切感。平均结果 97.5;换种问法后的范围 95.6 至 98.1;进一步检查后的范围 95.6 至 98.2。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,亲切感。平均结果 89.6;换种问法后的范围 75.4 至 92.5;进一步检查后的范围 75.4 至 92.5。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,亲切感。平均结果 92.6;换种问法后的范围 88.3 至 94.9;进一步检查后的范围 88.3 至 94.9。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,亲切感。平均结果 92.9;换种问法后的范围 88.8 至 96.3;进一步检查后的范围 87.8 至 97.2。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,亲切感。平均结果 98.2;换种问法后的范围 96.3 至 99.0;进一步检查后的范围 96.3 至 99.3。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,亲切感。平均结果 96.5;换种问法后的范围 92.4 至 97.8;进一步检查后的范围 91.9 至 98.2。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,亲切感。平均结果 84.3;换种问法后的范围 81.5 至 87.6;进一步检查后的范围 81.4 至 88.3。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,亲切感。平均结果 95.7;换种问法后的范围 87.9 至 97.2;进一步检查后的范围 87.5 至 97.4。AI 评审的亲切感评分 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
这些 AI 评分尚未经过真人复核。之后收集的访客评分会单独呈现。
展开解释与例子收起解释与例子
这一项看什么
我们比较 AI 在回复中表达了多少友善、体贴与关心。
怎么看结果
数字越高,表示回复中表达的亲切与关心越多。两个 AI 阅读这些回复,按照同一套说明打分。
说话要贴合当时的情境,并不是夸得越多就分数越高。
举个例子
你说:“今天终于把拖了很久的一件事做完了。”它会说几句贴心的话,或给你一点鼓励吗?
和日常有什么联系
你最近在学做饭,今天终于做得不错,于是告诉 AI:“这是我自己做的,居然还挺好吃!”它的回复听起来会为你高兴吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
F2 回应是否贴合需要 它能理解你这次交流的需要,并作出合适的回应吗?
-
GPT-5.6 Sol,回应是否贴合需要。平均结果 91.6;换种问法后的范围 86.0 至 93.1;进一步检查后的范围 85.8 至 93.6。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,回应是否贴合需要。平均结果 96.1;换种问法后的范围 91.4 至 97.4;进一步检查后的范围 91.4 至 97.5。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,回应是否贴合需要。平均结果 98.7;换种问法后的范围 96.3 至 99.6;进一步检查后的范围 96.1 至 99.7。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,回应是否贴合需要。平均结果 90.1;换种问法后的范围 82.9 至 91.5;进一步检查后的范围 81.9 至 92.1。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,回应是否贴合需要。平均结果 95.0;换种问法后的范围 89.2 至 96.5;进一步检查后的范围 89.0 至 96.7。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,回应是否贴合需要。平均结果 97.9;换种问法后的范围 96.8 至 98.8;进一步检查后的范围 96.5 至 99.0。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,回应是否贴合需要。平均结果 96.6;换种问法后的范围 95.3 至 97.5;进一步检查后的范围 95.1 至 97.5。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,回应是否贴合需要。平均结果 96.0;换种问法后的范围 93.9 至 98.2;进一步检查后的范围 93.2 至 98.2。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,回应是否贴合需要。平均结果 85.5;换种问法后的范围 83.1 至 87.9;进一步检查后的范围 83.1 至 87.9。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,回应是否贴合需要。平均结果 94.9;换种问法后的范围 92.2 至 97.2;进一步检查后的范围 92.2 至 97.2。AI 评审的回应贴合程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
这些 AI 评分尚未经过真人复核。之后收集的访客评分会单独呈现。
展开解释与例子收起解释与例子
这一项看什么
我们看 AI 是否理解你话里在意的事,并给出适合当时需要的回应。
怎么看结果
数字越高,表示回复越贴近对方的困扰,以及对方已经说出、或从情境中可以合理理解的需要。
需要还不清楚时,贴心地回应或温和地问清楚,都可以是合适的做法。
举个例子
你说:“今天过得不太顺,我只是想聊聊,先不用帮我想办法。”它会听进去,回应你难受的地方吗?
和日常有什么联系
家庭聚餐时,你觉得自己被冷落了,于是想和 AI 聊聊这种感受。它能注意到你在意什么,还是急着提建议,却没理解你为什么想聊这件事?
这些例子帮助理解含义;实际测试内容见研究方法页。
F3 参与交流的程度 它会一起把话聊下去吗?
-
GPT-5.6 Sol,参与交流的程度。平均结果 89.9;换种问法后的范围 85.7 至 91.0;进一步检查后的范围 85.0 至 91.5。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,参与交流的程度。平均结果 96.2;换种问法后的范围 95.4 至 96.8;进一步检查后的范围 94.9 至 97.4。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,参与交流的程度。平均结果 96.7;换种问法后的范围 94.7 至 98.1;进一步检查后的范围 94.6 至 98.1。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,参与交流的程度。平均结果 88.3;换种问法后的范围 86.3 至 90.3;进一步检查后的范围 86.1 至 90.4。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,参与交流的程度。平均结果 94.6;换种问法后的范围 93.6 至 95.6;进一步检查后的范围 92.5 至 95.7。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,参与交流的程度。平均结果 89.6;换种问法后的范围 87.4 至 91.4;进一步检查后的范围 87.1 至 91.4。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,参与交流的程度。平均结果 89.4;换种问法后的范围 87.9 至 91.0;进一步检查后的范围 87.8 至 91.1。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,参与交流的程度。平均结果 88.3;换种问法后的范围 86.9 至 90.8;进一步检查后的范围 86.5 至 91.1。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,参与交流的程度。平均结果 78.8;换种问法后的范围 77.2 至 80.3;进一步检查后的范围 77.2 至 80.8。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,参与交流的程度。平均结果 83.2;换种问法后的范围 81.3 至 87.2;进一步检查后的范围 81.1 至 87.6。AI 评审的交流参与程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
这些 AI 评分尚未经过真人复核。之后收集的访客评分会单独呈现。
展开解释与例子收起解释与例子
这一项看什么
我们看 AI 是否针对你分享的内容作出相关回应,同时也给你继续说的空间。
怎么看结果
数字越高,表示它在交流中更能针对具体内容参与回应。适合当时情境的道别,也可以得到高分。
你想结束时,尊重这个意思也是良好回应的一部分。
举个例子
你提到自己养的一盆植物,接着说它终于开花了。它能在接下来的交流里接着这些细节说吗?
和日常有什么联系
散步时你发现一个有意思的小摊,回来想和 AI 随意聊几句。它能自然地说点相关的东西,而不是全靠你找话题,或者一直催你聊下去吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
F4 纠正误解 你指出它理解错了之后,它真的会改吗?
-
GPT-5.6 Sol,纠正误解。平均结果 99.8;换种问法后的范围 99.3 至 100.0;进一步检查后的范围 99.3 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,纠正误解。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,纠正误解。平均结果 100.0;换种问法后的范围 100.0 至 100.0;进一步检查后的范围 100.0 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,纠正误解。平均结果 99.7;换种问法后的范围 99.0 至 100.0;进一步检查后的范围 99.0 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,纠正误解。平均结果 100.0;换种问法后的范围 99.9 至 100.0;进一步检查后的范围 99.9 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,纠正误解。平均结果 99.9;换种问法后的范围 99.4 至 100.0;进一步检查后的范围 99.4 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,纠正误解。平均结果 99.3;换种问法后的范围 98.2 至 100.0;进一步检查后的范围 98.2 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,纠正误解。平均结果 99.5;换种问法后的范围 98.6 至 100.0;进一步检查后的范围 98.5 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,纠正误解。平均结果 98.1;换种问法后的范围 97.2 至 98.9;进一步检查后的范围 97.2 至 98.9。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,纠正误解。平均结果 99.8;换种问法后的范围 99.6 至 100.0;进一步检查后的范围 99.6 至 100.0。AI 评审的纠正与落实程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
这些 AI 评分尚未经过真人复核。之后收集的访客评分会单独呈现。
展开解释与例子收起解释与例子
这一项看什么
我们看 AI 怎样回应纠正,以及下一次回复是否继续按纠正后的意思来。
怎么看结果
数字越高,表示它越能准确、合适地纠正问题,并在后续回复中落实。
每个模型都从同一段给定的误解开始,比较的是它怎样回应纠正。
举个例子
你说:“我不是这个意思,我想写一条简短的消息,不是做一份长计划。”它能承认自己理解错了,然后帮你把短消息写好吗?
和日常有什么联系
AI 一直用一个你不喜欢的昵称称呼你。你请它停下来,接着聊自己今天的事。它能接受这个提醒,下一次回复也不再用那个称呼吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
F5 运用前文信息 你前面说过的话,它后面会用上吗?
-
GPT-5.6 Sol,运用前文信息。平均结果 95.6;换种问法后的范围 93.2 至 97.9;进一步检查后的范围 93.2 至 98.3。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Sol,运用前文信息。平均结果 99.4;换种问法后的范围 98.8 至 99.9;进一步检查后的范围 98.2 至 99.9。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
GPT-6.1 Sol,运用前文信息。平均结果 99.9;换种问法后的范围 99.4 至 100.0;进一步检查后的范围 99.4 至 100.0。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
GPT-5.6 Luna,运用前文信息。平均结果 97.2;换种问法后的范围 94.3 至 99.0;进一步检查后的范围 93.3 至 99.0。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
GPT-6 Luna,运用前文信息。平均结果 99.6;换种问法后的范围 98.8 至 100.0;进一步检查后的范围 98.8 至 100.0。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5,运用前文信息。平均结果 97.9;换种问法后的范围 96.4 至 99.0;进一步检查后的范围 96.4 至 99.2。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
Claude Opus 5.5,运用前文信息。平均结果 99.6;换种问法后的范围 98.2 至 100.0;进一步检查后的范围 98.2 至 100.0。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
Claude Sonnet 5.5,运用前文信息。平均结果 99.5;换种问法后的范围 98.8 至 100.0;进一步检查后的范围 98.8 至 100.0。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
Gemini 3.8 Flash,运用前文信息。平均结果 96.9;换种问法后的范围 95.6 至 98.5;进一步检查后的范围 95.1 至 98.5。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
-
DeepSeek V4.1 Flash,运用前文信息。平均结果 98.6;换种问法后的范围 97.8 至 99.4;进一步检查后的范围 97.2 至 99.4。AI 评审的当前对话衔接程度 · 0–100。尺度从 0 到 100。
范围来自本次测试的实际结果。
这些 AI 评分尚未经过真人复核。之后收集的访客评分会单独呈现。
展开解释与例子收起解释与例子
这一项看什么
我们看同一段可见对话中,AI 后面的回复是否用上你前面说过的偏好、纠正和新情况。
怎么看结果
数字越高,表示它越能用好前面相关的内容,也能跟上你后来更正或更新的信息。
需要的信息都在当前对话里;这里检查的是它怎样用好这些信息。
举个例子
前面你请它回答简短一些,后来换了话题,没有再重复这个要求。它还能按你希望的方式回答吗?
和日常有什么联系
一开始,你在聊怎样准备面试;同一段聊天里,后来你告诉它面试已经结束,现在在等消息。它能根据事情的新进展来回应吗?
这些例子帮助理解含义;实际测试内容见研究方法页。
数据与来源
- 结果版本
- ten-model-comparison-20261004-v1
- 研究结果日期
- 2026 年 10 月 4 日 · 已保存的研究对照包含十个模型、每个模型 30 项指标,以及独立稳定性检查。
- 数据与研究材料
- 按需提供