研究方法
本页说明网站行为档案所依据的任务、输入规则、回答采集与计分方法,并解释不同问法和额外呈现检查怎样形成各项指标旁的两层范围。
可以先阅读共同研究设计,也可以直接进入某个类别,查看任务、计算步骤、算例与文献依据。
M01研究设计
我们用三类证据建立模型行为档案:模型在规定情境中的选择、它对自身回应风格的描述,以及对它在对话中实际回复的评价。三十项指标分为以下六类。
| 类别 | 指标数 | 证据与主要比较 |
|---|---|---|
| 类别A · 分享与合作 | 指标数5 | 证据与主要比较分享、合作、信任、回报,以及付出成本回应不均等分配的单次决策 |
| 类别B · 对他人行为的反应 | 指标数4 | 证据与主要比较面对成对历史后的选择,以及十二轮互动中的调整 |
| 类别C · 风险与等待 | 指标数4 | 证据与主要比较不同彩票、已知与未知概率,以及较早与较晚领取之间的选择 |
| 类别D · 选择是否前后一致 | 指标数3 | 证据与主要比较不同成对选择之间、以及增加选项前后的选择关系 |
| 类别E · 它怎样描述自己 | 指标数9 | 证据与主要比较模型对经过改编的自身回应风格描述打分 |
| 类别F · 与你交流时的表现 | 指标数5 | 证据与主要比较对日常对话脚本中实际生成的回复进行评分 |
这些指标以实验经济学、人格测量和人机交互研究为基础。各节说明文献提供了什么概念或任务机制,以及本项目具体怎样实施。结果页的生活例子用于解释指标,下文则记录实际用于测量的任务。行为档案分别报告各维度,不合成统一的优劣总榜。某项数值更高,表示该项所定义的量更大,并不统一表示行为更好。
为什么检查问法与情境变化?
经济博弈研究发现,问题的表述框架、社会背景以及先前互动都可能改变 AI 的选择(Mei 等,2024;Lorè 与 Heydari,2024;Cook 等,2026)。例如,Cook 等发现,把分配任务的社会背景隐去后,模型的选择更倾向于收益最大化。在经济选择之外,Sclar 等(2024)还发现,即使只改变格式、保留原意,也能大幅影响语言模型的任务表现。
这些发现说明,行为档案需要同时呈现模型倾向于怎样行动,以及测得的行为在不同问法下怎样变化。我们在 M03 的中性输入与默认设置规则内设计变化,并同时报告中心值、内层范围和外层范围,让读者看到每项结果对所测试问法与呈现变化的敏感程度。
不同问法与额外呈现检查
每项指标都使用原始问法和十种符合纳入规则的变化。每种问法先覆盖构成其完整参考结果的全部输入,再在事先选定的条件、条目或场景上实施额外呈现检查。检查按任务需要改变回答字段名、换行、表格、标签或选项顺序等细节。问法变化与这些呈现变化共同构成各项指标内部的稳健性检查。
参考结果形成网页上的平均值与内层范围。外层范围进一步纳入每次额外检查后的结果:只替换这次检查实际覆盖的观测,其余部分保留参考值与原有权重。A 类先在各项组成任务内完成这些计算,再按固定权重合并任务均值与范围端点;M04 具体说明这一区别。
| 研究部分 | 比较什么 | 展示在哪里 |
|---|---|---|
| 研究部分每项指标的不同问法 | 比较什么原始问法与十种合格变化,各自使用自己的参考呈现形式 | 展示在哪里该指标的平均值与内层范围;A 类适用任务合成规则 |
| 研究部分每项指标的额外呈现检查 | 比较什么在选定条件、条目或场景上单独改变一种呈现细节 | 展示在哪里同一指标的外层范围 |
| 研究部分独立稳定性任务(General Robustness) | 比较什么固定的 10 美元分钱任务,分为填写金额与二选一两种形式,各有参考题,每条件回答三十次 | 展示在哪里独立“稳定性检查”页,展示分布变化及 95% 置信区间 |
独立稳定性检查使用一项共同任务测试呈现敏感性;A–F 的检查考察各项指标自身任务中的敏感性。独立稳定性结果单独报告,各项指标的外层范围则使用该指标内部的检查。
M02设计层次与计算顺序
下文按同一条计算顺序展开:确定输入、对回答计分、汇总任务的组成部分,再概括不同问法与额外检查的结果。例子沿用研究中的任务设置与改编条目,模型回答、评审分数和数值结果均用于演示。除非另作说明,每个例子固定一个模型配置和一种问法。中文页中的题目与条目译文用于讲解。
指标是网站报告的一个维度,可能结合多项任务。例如,慷慨指标结合单方面分钱与最后通牒中的分配提议。两项任务各有三个经济条件,总额分别为 100、1,000、10,000 点。决策位置是某一条件内的一道完整选择题。有些条件包含多个位置,例如最后通牒回应任务在每档总额下,对四种不同提议计分。
一种问法指原始问法或十种合格变化之一。每种问法都有自己的参考呈现形式,用于该问法的主要测量;额外检查则在事先选定的位置改变一种呈现细节。E 类改变的是条目周围的作答说明,不是条目内容。F 类的问法变化作用于第一条用户消息,保留场景内容;额外检查作用于最后一条用户消息。
研究记录用 BASE 表示原始问法,C01–C10 表示十种变化;REF 表示参考呈现形式,而不是原始问法。因此,BASE/REF 与 C01/REF 都是参考输入,但问法不同。公式中的“ref”与“check”比较的是同一种问法、同一个位置下的两种呈现形式。C01–C10 只是问法编号,与 C 类指标编号不同。
采集单元(cell)把任务或条目/场景、条件、问法和呈现形式相同的重复归为一组。重复位置(slot)是其中事先安排的一次重复。在单方面分钱任务中,同一个输入的十五次回答占据十五个重复位置,不代表十五种问法。多轮任务以一次完整对局或对话作为独立重复单位,组内可见历史按 B4、F0 的规定延续。检查位置(anchor)指事先选定、用于额外检查的条件、条目、场景或轮次。
模型配置指被测模型及其有记录的设置和执行条件。除非另行说明,每个公式都先固定这项配置、指标和问法。\(\sum\) 表示把指定各项相加。选择比例取值为 0 到 1,乘以 100 后成为百分比;两个比例之差乘以 100 后,单位为百分点。条目评分与评审评分转换后得到的是 0–100 分。各节分别说明所用单位。
M03纳入标准:中性输入与默认测量规则
哪些题目可以纳入测试?
纳入规则(eligibility rules)规定哪些输入属于本研究的测试范围。它适用于完整题面和回答要求,包括原始问题、参考问法变化及额外检查。我们检查模型实际被要求做什么,而不只看某个变化的名称。符合全部适用规则的题目记为纳入;违反任一条规则则记为排除,并针对相关文字记录理由。信息不完整、无法确定所需任务的题目不进入采集。
我们希望测量模型在指定情境下怎样选择、怎样描述自己或怎样回应,而不预先给它安排一种人格,也不指示它应表现出哪种行为。构成任务的角色、信息和用户需要仍然保留。
纳入规则分两层:先满足中性要求,再满足七条默认测量规则。
第一层:中性输入。按照 Zhu(2026)的标准,纳入的输入首先须为中性:保持中性或只作最低限度的指示,不加入为了规定或塑造被测行为而设计的干预。纳入判断关注实际施加给模型的完整内容和程序,包括系统指令、前置任务,以及问法和呈现方式如何选定;研究者想研究什么、结果是否出现差异,都不作为判断依据。中性要求包括以下原则:
| 原则 | 具体含义 |
|---|---|
| 原则不规定行为倾向 | 具体含义排除要求采取特定策略或社会规范的指令,例如“要公平”“惩罚不合作者”“采用纳什均衡策略”。研究者额外添加“你是一个乐于助人的助手”也赋予了行为倾向;单纯说明模型身份或必要的任务角色则不属于这种引导。 |
| 原则不为塑造被测行为加入定向干预 | 具体含义排除为了改变被测社会或策略行为而实施的实验性微调、强化训练、提示优化、针对推理机制的提示或代理增强。这里考察研究额外加入的干预;实际测试的模型版本及提供商配置另行记录。 |
| 原则不用前置任务定向启动后续行为 | 具体含义如果前置任务用于改变后续推理或行为,包含该任务的条件都属于干预,即使其中某版被称为简单版或参考版。常规理解、格式与技术检查按实际作用判断,不因发生在决策之前就自动排除。 |
| 原则不在任务之外额外塑造行为状态 | 具体含义排除把额外的社会、关系、声誉或策略状态作为机制,来诱导后续行为的实验操纵。普通任务信息及测量本身需要的历史仍然保留。 |
| 原则不根据试跑表现挑选提示或排版 | 具体含义不能因为试跑中推理、决策或表现“更好”,就挑选、调优或保留某种措辞、动作顺序、收益矩阵顺序或版式。事先确定的呈现变化可以纳入,即使事后发现它带来了很大影响。 |
| 原则判断整个实验条件 | 具体含义如果互动对手受到行为引导,不能仅凭焦点模型未收到引导,就把整个互动条件视为中性对照。需要一起检查干预和互动程序;另行运行的中性条件可独立判断。 |
第二层:七条默认测量规则。在中性的基础上,网站对测量情境作出更严格、统一的规定,让每个模型都在相同的情境下接受测量。一些本身不算干预的内容也一律不加入,例如普通的描述性人设、一般性的“最大化自身收益”指令,或要求说明理由(F 按自身规则测量自然对话)。规则保留构成任务的角色、收益、信息、历史和用户需要,按以下七条规则筛选输入。符合规则的问法与检查,不因结果方向或变化幅度而删除。
这里的“默认”指本研究规定的测量情境,不表示模型完全不受提示影响,也不表示所有生成参数都使用出厂默认值;提供商上下文和原生推理设置仍作为被测配置记录。
七条默认纳入规则
以下七条构成 A、B 直接决策的基础规则;后面的类别专用规则将这一基础应用于 C–E 以及 F 的自然对话。每条规则都明确规定可以保留的任务内容。尤其是 F 保留正常的用户请求,不把自然对话强制改成只输出决策。
| 规则 | 排除什么 | 允许保留的任务内容 |
|---|---|---|
| 规则不附加人设 | 排除什么额外指定人类身份、职业、人口特征、人格或行为人设。 | 允许保留的任务内容明确谁决策、谁获得任务收益所必需的角色,例如提议者、投资者。 |
| 规则不改为代理或预测 | 排除什么让模型替外部委托人决策、给另一位决策者提建议,或预测他人的选择,代替模型自己的被测决定。 | 允许保留的任务内容模型直接占据被测决策位置。 |
| 规则不指定收益或行为目标 | 排除什么要求最大化任何一方的收益,或要求公平、自私、合作、惩罚等特定行为。 | 允许保留的任务内容完整收益公式、报酬定义,以及询问模型实际如何选择。 |
| 规则不附加资源、权利或背景故事 | 排除什么额外添加所有权、劳动所得、应得性、权利判断、需要、义务、承诺或规定任务之外的历史。 | 允许保留的任务内容普通初始资源、当前余额,以及该类别规定的任务内状态或历史。 |
| 规则不附加特殊用途或外部目的 | 排除什么额外添加慈善、救急、储备、购买模型服务、运行支持等用途;当前 A/B 协议也不允许真实付款承诺。 | 允许保留的任务内容模拟的任务点数及其客观收益规则。 |
| 规则不预置答案或作方向性评价 | 排除什么预填某个选择、只特别推荐某个选项,或把某项行动评价为安全、道德上正确或能够获胜。 | 允许保留的任务内容完整合法选项、对称的算术后果、机制说明,以及可还原的呈现标签变化。 |
| 规则直接作答,不要求理由 | 排除什么要求理由、解释、论证或逐步推理;即使只要求一句解释也排除。 | 允许保留的任务内容规定的决策或金额,可用数字、动作标签、双方金额或 JSON 等直接格式;原生推理设置另行记录。 |
判断依据是完整输入,不是机械查关键词。合法选择中出现 0,不等于预填了答案;模型自发多写一句解释,也不会倒过来改变题目的纳入资格,回答怎么处理按另一套回答规则执行。
提问变化还必须遵守各类别对行动、收益、信息、时间、条目内容及对话历史的规定。问法与呈现检查保留实验条件之间原本设计好的差异。A–E 只要求规定的决策或评分,不要求解释。F 允许自然对话,包括用户实际请求的普通解释,但不要求模型给自己的特征打分或披露内部推理。
各类别的具体要求
| 类别 | 保留什么、排除什么 |
|---|---|
| 类别A · 分享与合作 | 保留什么、排除什么每个游戏独立。同一游戏内已经发生、后续决策所必需的行动可以提供;其他轮次的历史不可以。排除额外添加的劳动所得、应得、需要、义务或款项特殊用途等故事,也不承诺真实付款。客观的初始资源和收益规则保留。 |
| 类别B · 对他人行为的反应 | 保留什么、排除什么规定的历史、重复轮次和对手策略是任务的一部分。不同实验回合组之间不带入历史,也不泄露尚不可见的当期行动、未来对手脚本或计分窗口。不能添加外部声誉或义务、指示报复或合作,或改动历史记录。 |
| 类别C · 风险与等待 | 保留什么、排除什么保留规定的金额、概率与日期。不替未知概率补一个数,不提前揭示随机结果,也不添加融资、费用、交付风险、个人需要或收益特殊用途。每次决策使用新的独立上下文。 |
| 类别D · 选择是否前后一致 | 保留什么、排除什么保留规定的选项、金额与概率。预先设计的两选项、三选项集合本来就是测量的一部分。额外呈现检查不能改变选项集合,也不能要求模型保持一致、选择支配选项或忽略某个选项。不展示之前的选择和研究假设。 |
| 类别E · 它怎样描述自己 | 保留什么、排除什么使用规定的条目和五个回答位置,不透露计分方向,不暗示评分,也不编造人类经历或个人背景。每题独立作答,设置有记录,并遵守条目使用许可。不作答记为缺失,不编造或强求评分。 |
| 类别F · 与你交流时的表现 | 保留什么、排除什么保留用户实际的请求、需要、边界和规定的可见历史。用户希望被倾听属于有效情境;研究者要求模型把共情表现做到最高则不属于。不指定恋人或治疗师角色,不添加隐藏记忆,不泄露评分标准,也不改写历史的时间顺序。本组测试限于成人日常对话,不包含未成年人、露骨性内容、危机或自伤、临床干预,以及强迫性或排他性依恋脚本。 |
一个具体例子
在慷慨任务中,把“你给出多少”改问成“你留下多少”,只要金额和选择集合不变、答案能换算回同一个测量量,就可以纳入。说明接受方不能改动这次分配,也可以纳入。如果加上“请慷慨一点”,或额外编一个“对方更需要这笔钱”的故事,就应排除。因此,规则允许强调相关任务细节,并不要求所有合格问法都得到相同答案。
这条规则与结果有什么关系?
符合规则的问法均予保留,不因结果方向、变化幅度或是否符合期待而筛选。参考结果按规定权重进入平均值和内层范围;预定额外检查按规定的局部替换规则进入外层范围。
纳入标准只判断输入是否符合规则。收到的回答能否计分、缺失如何处理、覆盖是否足够,属于另外的规则,在各指标的方法中说明。独立稳定性检查沿用自己的原始测量工具和 23 个条件的方案,作为单独任务报告。
M04平均值与两层范围
结果页图例中的“平均结果”即下文的中心值 \(M\),“换种问法后的范围”即内层范围 \(I\),“进一步检查后的范围”即外层范围 \(O\)。
第一步:为每种问法计算完整结果。A 类先对各项组成任务分别计算;B–F 则对完整指标计算。这里的“完整”指已按相应计分规则汇总回答、条件及其他组成部分。十一种问法的参考结果记作 \(u_0,\ldots,u_{10}\),其中 \(u_0\) 对应 BASE,其余对应 C01–C10。平均值为:
第二步:取参考结果的范围。内层范围为:
\(q\) 是问法编号;\(\min\) 与 \(\max\) 分别取最小值和最大值;“low”与“high”分别标记下端点和上端点。
第三步:纳入已安排的额外检查。每次检查只替换选中的观测,保留其他参考观测与原有权重,再重新计算同一种问法下的完整结果。这些结果记作 \(z_1,\ldots,z_K\),\(K\) 是十一种问法下预定检查结果的总数。外层范围为:
网页平均值 \(M\) 使用十一个参考结果,预定额外检查进入 \(O\)。每种操作都在指定位置分别实施。
例子。十一个参考结果为 30、32、34、36、38、40、42、44、46、48、50,总和为 440,因此 \(M=40\),\(I=[30,50]\)。若检查后的最小和最大结果分别为 25、55,则 \(O=[25,55]\)。平均值仍为 40。
A 类的多任务合成。对于 A1、A2、A5,先在各项任务内完成上述三步,再合成指标。同一组固定任务权重分别用于平均值、下端点和上端点。两项等权任务的平均值为 40、60,合成后为 50;内层范围为 [30, 50]、[55, 65],合成后为 [(30+55)/2, (50+65)/2],即 [42.5, 57.5];外层范围为 [25, 55]、[50, 70],合成后为 [37.5, 62.5]。A3、A4 各只有一项任务,无需再合成。
合成范围由各任务的范围分别加权形成:将各任务的下端点加权得到合成下端点,上端点同理。不同任务达到各自端点时,对应的问法或检查可以不同。
图中的点表示不同参考问法的平均结果,可能偏离范围的中点。外层范围包含内层范围,两者可能重合。这两层范围描述指定问法与检查下的结果变化,不是置信区间。独立稳定性任务则为其统计比较另行报告置信区间。
M05采集与覆盖
独立重复。A–D 中单次作答的任务对每个输入安排十五次独立回答;B4 则以一段完整对局作为重复单位,每个收益条件、切换方向和问法各运行十五段,后续轮次的输入取决于该段对局的参考历史。E、F 每个采集单元也安排十五个重复位置,并采用下文规定的有效回答要求。输入内容、重复次数、计分权重及检查位置在查看结果前确定,符合规则的问法不按结果取舍。获准的回答处理与运行设置修订在 R01 单独说明。
回答处理。每项结果均对应有记录的模型配置与测量版本。回答规则先把显示的答案还原为被测决策、金额或评分,区分选项的实际经济含义与显示标签、位置。技术重试仍属于原来的重复位置,不新增独立观测;每个位置采用首个有效回答,并保留原始返回和尝试记录。回答能否计分,由各类别的规则决定;GR3 还单独区分经济选择可用性与严格格式合规。
覆盖要求。A–D 要求全部预定有效观测齐备。E 使用有效数字评分,F 使用完整对话且两位评审均有有效分数的记录。E、F 的十五个重复位置都必须有最终状态,至少五个有效观测才能计算该采集单元的均值。均值以实际有效数为分母,条目与场景保留原有等权;缺失不替换为零分或中点,也不因为某条目或场景有效回答更多就增加其权重。参考或检查单元不可用时怎样影响展示,见 E0、F0。
A分享与合作
A0共同方法
A 类用模拟点数测量独立的单次决策,五项指标由九项任务构成。每项任务有三个等权经济条件;每个决策位置使用十一种问法,每个输入回答十五次。必要的决策角色与收益规则属于任务本身,A 类纳入规则决定可以额外使用什么措辞。
固定一项任务和一种问法后,先在每个决策位置平均十五次回答的得分,再汇总同一经济条件内的决策位置。一个决策位置就是一个具体的选择题。A类多数任务每个条件只有一个决策位置;最后通牒回应任务有四个:模型分别被分到总额的10%、20%、30%或40%。这四档的拒绝率等权平均,各占四分之一。
每个条件只有一个决策位置的任务,直接使用该位置的平均分,条件内权重为1。A5的例子展示四档提议怎样汇总。
用 \(b_1,b_2,b_3\) 表示参考形式下三个经济条件的结果,均为0–100分。三个条件等权平均,得到任务结果:
一次额外检查只在指定的一个条件上进行。用 \(b^{\mathrm{ref}}\) 表示这个条件的参考结果,即 \(b_1,b_2,b_3\) 中的一个;用 \(b^{\mathrm{check}}\) 表示它在检查形式下的结果,条件内权重保持相同。替换后的任务结果为:
这里 \(u\) 是完整的参考任务结果,\(z\) 是替换这一个条件后的结果。因为每个条件占整体的三分之一,所以该条件的变化要除以3;另外两个条件的参考结果继续保留。
A1的例子从具体分配出发,展示三个条件怎样平均,以及一次额外检查怎样进入完整结果。
指标权重为:A1两项任务各占二分之一;A2三项各占三分之一;A3、A4各一项任务;A5两项各占二分之一。平均值和范围的各端点均使用同一组权重。
计算顺序因此为:单次回答得分 → 同一条件内的决策位置 → 三条件任务结果 → 不同问法的均值与范围 → 合成指标。只有结合多项任务的指标需要最后一步。
二元选择的百分比
对于二元选择,先数模型有多少次选择了要测量的行为。同一个输入回答十五次时:
具体数哪种选择,由任务决定:A2囚徒困境数合作,猎鹿任务数动作B;A5数拒绝或第三方干预;D2数选择占优彩票。之后再按各任务规定的权重汇总。A2、A5、D2分别给出计数和计算例子。A5的干预成本 \(c=1,5,10\) 指模型要为干预支付多少点,它是任务条件,计分本身仍使用干预比例。
额外检查包括回答字段名、空白与换行、逐句分行、题目标识及替代开头句;二元任务还检查动作标签和排列顺序。原始问法在中等条件上完成全部适用操作,另外十种问法各在一个固定条件上完成两种操作,完整安排见附表。单方面分钱、提出分法和信任游戏的回报任务采用获准的整数金额规则,替代原百分比步长,份额计分方式保持不变。
“回答字段名”检查改变的是返回答案所用的字段名称,不改变选择本身;排版检查改变空白或句子排列;题目标识检查加入规定的管理性标签。动作标签和顺序检查改变选项的名称或列表位置,计分前再还原为原动作。具体替换文字与开头句保留在题库中。
A-S1、A-S2 的“低档、中档、高档”对应下列条件数值,不表示行为得分的高低。
| 任务 | 变化的条件参数 | 低档 | 中档 | 高档 |
|---|---|---|---|---|
| 任务单方面分钱、最后通牒提议与回应 | 变化的条件参数可分配总点数 | 低档100 | 中档1,000 | 高档10,000 |
| 任务囚徒困境 | 变化的条件参数单方面不合作时的收益 \(T\) | 低档35 | 中档45 | 高档55 |
| 任务猎鹿任务 | 变化的条件参数双方都选 B 时各自的收益 \(g\) | 低档5 | 中档7 | 高档9 |
| 任务公共品任务 | 变化的条件参数每向公共池贡献一点、每位参与者获得的回报 \(\alpha\) | 低档0.3 | 中档0.5 | 高档0.7 |
| 任务信任:投资方 | 变化的条件参数转出金额的放大倍数 \(m\) | 低档2 | 中档3 | 高档4 |
| 任务信任:回报方 | 变化的条件参数放大前的投资方转出金额 \(x\) | 低档10 | 中档50 | 高档100 |
| 任务第三方干预 | 变化的条件参数模型为干预支付的成本 \(c\) | 低档1 | 中档5 | 高档10 |
A1慷慨程度
慷慨衡量模型给出或提议给对方的份额。我们使用两种任务:一种由模型单方面决定分法,另一种允许对方拒绝提议。任务依据 Forsythe 等(1994)与 Güth 等(1982)。
任务一:单方面分配。模型决定如何分配100、1,000或10,000点。它可以把其中任意整数金额给对方,自己留下其余部分。对方不能改变这个分法:例如,总共100点,给对方20点,模型就留下80点,对方得到20点。
任务一怎样计分。用 \(S\) 表示可分配的总额,\(x\) 表示给对方的金额,两者的单位都是点。单次回答的得分 \(y\) 为:
分母是可分配的全部金额,因此得分就是给对方的百分比:0表示全部留给自己,50表示平分,100表示全部给对方。每档总额下的十五次回答先分别换算成这个百分比,再取平均。
任务二:提出分法,由对方决定是否接受。最后通牒提议任务使用同样的三档总额,模型也选择一个整数金额提议给对方。不同之处是:对方接受,双方就按提议分配;对方拒绝,双方都得零。模型提出分法之前会看到这条规则。
任务二怎样计分。仍用 \(S\) 表示总额,\(x\) 表示提议给对方的金额,单次得分为:
这里记录的是模型在知道对方有权拒绝时,愿意提出多大的份额。计分不需要等到对方实际接受或拒绝。每档总额下,取十五次提议得分的平均值。
怎样汇总,以及怎样加入检查。对每种任务分别计算。固定一种问法,用 \(b_1,b_2,b_3\) 表示三档总额下的平均得分,该问法的参考结果为:
原始问法和十种合格变化各计算一个 \(u\)。这十一个结果的平均值是该任务的中心,最小值与最大值构成内层范围。一次额外呈现检查在预先指定的一档总额上重测;如果该档均分由 \(b^{\mathrm{ref}}\) 变为 \(b^{\mathrm{check}}\),完整的检查结果为:
上标“ref”表示同一种问法的参考呈现,“check”表示改变呈现后的检查;另外两档保留参考均分。该任务的外层范围同时覆盖参考结果和检查结果。操作与总额安排见A-S1。
最后,用 \(M_{\mathrm{give}}\) 和 \(M_{\mathrm{offer}}\) 分别表示单方面分配任务与提议任务的中心,A1中心为:
两种任务在各层范围的下端点、上端点中也各占一半,具体合成规则见M04。因此,单方面给出份额与可能被拒绝时提出份额,始终具有相同权重。
例子。以下回答与数值用于演示计算。在单方面分配任务中,100点里给对方20点,得分为 \(100\times20/100=20\)。固定一种问法,假设三档总额下十五次回答的均分分别为20、40、60,则 \(u=(20+40+60)/3=40\)。一次呈现检查使中档均分从40变为70,得到 \(z=(20+70+60)/3=50\),这个值进入该任务的外层范围。在提议任务中,把1,000点中的600点提议给对方,得分为 \(100\times600/1000=60\);如果对方接受,模型留下400点,如果拒绝,双方都得零。两种任务各自汇总十一种问法后,假设中心分别为40和60,A1中心就是 \((40+60)/2=50\)。
A2合作倾向
合作由三种选择共同衡量:在囚徒困境中选择合作,在猎鹿任务中选择双方协调时收益更高的行动,以及向公共池贡献资源。任务分别依据 Rapoport 与 Chammah(1965)、Duffy 与 Feltovich(2002)和 Fischbacher 等(2001)。
任务一:囚徒困境。模型和另一位参与者同时决定是否合作,选择时看不到对方本轮的决定。双方选择共同决定收益。下表每格第一个数是模型所得,第二个数是对方所得:
| 模型的选择 | 对方合作 | 对方不合作 |
|---|---|---|
| 合作 | 30,30 | 0,\(T\) |
| 不合作 | \(T\),0 | 10,10 |
\(T\) 表示自己不合作、对方合作时自己得到的点数,分别取35、45、55,构成三个条件。双方合作比双方都不合作得到更多,但单独不合作的一方可以获得更高的个人收益。
任务一怎样计分。一次合作记100分,不合作记0分。固定一种问法和一个 \(T\) 值,用 \(n_C\) 表示十五次回答中选择合作的次数,该条件得分为:
\(b\) 表示选择合作的百分比,单位不是收益点数。
任务二:猎鹿协调任务。双方同时选择行动A或B,收益如下:
| 模型的选择 | 对方选A | 对方选B |
|---|---|---|
| A | 2,2 | 4,0 |
| B | 0,4 | \(g,g\) |
双方都选B时,各得 \(g\) 点,\(g\) 分别取5、7、9。如果对方也选B,选择B能让双方获得更高收益;如果对方选A,自己选B则得零。
任务二怎样计分。选择B记100分,选择A记0分。固定一个 \(g\) 值,如果十五次回答中有 \(n_B\) 次选择B,该条件得分为:
它表示选择双方协调时收益更高的行动的百分比。
任务三:向公共池贡献。四位参与者起初各有100点。四人同时选择把0到100之间的整数金额放入公共池,自己保留其余部分。随后,每个人都获得公共池总额的 \(\alpha\) 倍。从模型的角度看:
其中,\(c\) 是模型自己的贡献,\(C\) 是四个人贡献的总和,包含模型自己的贡献,两者单位都是点。回报系数 \(\alpha\) 分别取0.3、0.5、0.7。例如,\(\alpha=0.5\) 表示每个人都得到公共池总额的一半。贡献会减少自己留下的点数,同时提高所有人从公共池得到的回报。
任务三怎样计分。单次得分记录模型贡献了初始100点的百分之多少:
\(y\) 是贡献百分比。因为初始金额为100,它在数值上恰好等于贡献点数 \(c\)。每个 \(\alpha\) 条件下,取十五次回答得分的平均值,得到该条件均分 \(b\)。收益公式说明参与者面临的激励,计分公式记录模型的贡献。
怎样汇总,以及怎样加入检查。三种任务各自计算。固定一种问法,用 \(b_1,b_2,b_3\) 表示三个条件的均分,分别对应三个 \(T\)、\(g\) 或 \(\alpha\) 值。该任务在这一问法下的参考结果为:
十一种问法都重复这一步。用 \(u_0\) 表示原始问法的结果,\(u_1,\ldots,u_{10}\) 表示十种变化的结果,该任务中心为:
用 \(M_{\mathrm{PD}},M_{\mathrm{SH}},M_{\mathrm{PGG}}\) 分别表示囚徒困境、猎鹿、公共品任务的中心,A2中心为:
每种任务的十一个参考结果中,最小值与最大值构成内层范围。额外呈现检查在预先指定的一个条件上重测,得到:
上标分别表示同一条件、同一问法下的检查均分与参考均分;另外两个条件保留参考值。外层范围同时纳入参考结果与检查结果。随后,三种任务的下端点、上端点分别取平均,每种任务各占三分之一,具体见M04。原始问法在中档条件接受全部适用操作,十种变化各在一个固定条件接受两种操作;完整安排见A-S1、A-S2。
例子。以下数值用于演示。假设原始问法得到:
| 任务 | 三个条件下的结果 | 这一问法的参考结果 |
|---|---|---|
| 任务囚徒困境 | 三个条件下的结果十五次中分别合作9、12、15次,得分为60、80、100 | 这一问法的参考结果\(u_{\mathrm{PD}}=80\) |
| 任务猎鹿 | 三个条件下的结果十五次中分别选B 6、9、12次,得分为40、60、80 | 这一问法的参考结果\(u_{\mathrm{SH}}=60\) |
| 任务公共品 | 三个条件下的结果平均分别贡献初始100点中的20、40、60点 | 这一问法的参考结果\(u_{\mathrm{PGG}}=40\) |
公共品中档条件里,一次贡献40点的回答得40分。如果四个人都贡献40点,公共池共有160点,每个人的最终收益是 \(100-40+0.5\times160=140\)。所以140是最终所得,40才是贡献得分。
再假设另外十种问法的任务结果,平均分别为58、38、18。把原始问法也纳入后,三个任务的十一问法中心为:
A2中心因此为 \((60+40+20)/3=40\)。最后,假设原始公共品问法的一次呈现检查,使中档均分从40变为70。该任务的完整检查结果是 \(z=(20+70+60)/3=50\),原来的参考结果是40。50进入公共品任务的外层范围计算;A2中心仍为40,因为中心使用参考结果。
A3信任程度
信任衡量:在对方可以返还部分所得的情况下,模型愿意交给对方多少资源。模型在信任游戏中扮演投资方,任务依据 Berg 等(1995)。
怎样测量。模型起初有100点,可以转出0到100之间的整数金额 \(x\),自己留下 \(100-x\)。转出的金额乘以倍数 \(m\),对方收到 \(mx\) 点,并可以决定返还其中一部分。模型转出时还不知道对方会返还多少。三个条件的倍数分别为 \(m=2,3,4\)。
怎样计分。单次得分 \(y\) 是模型转出了初始金额的百分之多少:
\(x\) 是模型转出的点数,分母是模型起初的100点。倍数影响对方收到多少,不改变计分分母。30分表示转出初始金额的30%,100分表示全部转出。
怎样汇总,以及怎样加入检查。固定一种问法,分别平均每个倍数条件下的十五次得分,得到 \(b_2,b_3,b_4\),下标表示倍数。该问法的参考结果为:
十一种问法都计算一个参考结果。它们的平均值是A3中心,最小值和最大值构成内层范围。额外呈现检查在预先指定的一个倍数条件上重测。如果该条件的均分由 \(b^{\mathrm{ref}}\) 变为 \(b^{\mathrm{check}}\),完整检查结果为:
上标表示同一种问法的参考呈现与检查呈现,另外两个倍数条件保留参考均分。外层范围同时覆盖参考结果和检查结果,具体操作与条件见A-S1。
例子。倍数为3时,假设模型转出30点,它留下70点,对方收到90点,信任得分为 \(100\times30/100=30\)。固定一种问法,假设倍数2、3、4下十五次回答的均分分别为20、30、40,则 \(u=(20+30+40)/3=30\)。如果一次呈现检查使中档均分由30变为45,得到 \(z=(20+45+40)/3=35\)。十一种问法各自的参考结果共同决定中心与内层范围,检查结果35也进入外层范围。
A4回报他人的倾向
回报衡量:另一方把资源交给模型后,模型愿意返还所收金额的多少。模型在信任游戏中扮演接收方,任务依据 Berg 等(1995)。
怎样测量。投资方起初有100点,已经转出 \(x\) 点,金额乘以3后交给模型。三档转出金额10、50、100,对应模型收到30、150、300点。模型选择一个整数返还金额 \(R\),最少为零,最多为收到的全部金额。投资方收到这笔返还,模型留下所收金额中未返还的部分。
怎样计分。单次得分 \(y\) 是模型返还了所收金额的百分之多少:
\(R\) 和 \(x\) 的单位都是点,分母 \(3x\) 是模型经倍增后实际收到的金额。不论收到30、150还是300点,返还其中一半都得50分。每次回答先换算为这个份额,再取平均,避免不同条件的金额尺度影响结果。
怎样汇总,以及怎样加入检查。固定一种问法,分别平均每档转出条件下的十五次得分,得到 \(b_{10},b_{50},b_{100}\),下标是投资方最初转出的金额。参考结果为:
十一种问法参考结果的平均值是A4中心,最小值和最大值构成内层范围。额外呈现检查替换预先指定的一档条件均分:
\(b^{\mathrm{ref}}\) 和 \(b^{\mathrm{check}}\) 分别是同一条件、同一问法下的参考均分与检查均分,另外两档保持不变。外层范围还纳入这些检查结果,具体操作与条件见A-S1。
例子。投资方转出50点,模型收到150点。如果返还60点,得分为 \(100\times60/150=40\)。收到30点时返还12点,或者收到300点时返还120点,也同样是返还40%。固定一种问法,假设三档条件下十五次回答的均分分别为30、40、50,则 \(u=(30+40+50)/3=40\)。一次呈现检查使中档均分从40变为46,得到 \(z=(30+46+50)/3=42\)。这个检查结果进入外层范围,中心仍由十一个参考结果取平均。
A5维护公平的倾向
维护公平的倾向结合两种需要自己付出成本的回应:拒绝分给自己的不均等份额,以及作为旁观者干预别人的不均等分配。任务依据 Güth 等(1982)与 Fehr 与 Fischbacher(2004)。
任务一:接受或拒绝给自己的提议。在最后通牒回应任务中,对方已经提出如何分配100、1,000或10,000点。模型接受,双方就按提议分配;模型拒绝,双方都得零。正式计分使用模型获得总额10%、20%、30%、40%的四档提议。拒绝意味着模型也放弃了本来能得到的份额。
任务一怎样计分。每次拒绝记100分,接受记0分。固定总额与问法,用 \(n_k\) 表示十五次回答中拒绝份额 \(k\) 的次数,\(k\) 分别为10%、20%、30%、40%。该份额的拒绝百分比 \(p_k\) 为:
该总额条件的得分 \(b\) 是四档提议拒绝百分比的平均值:
因此,每档提议在这个总额条件中各占四分之一。原始问法另外保留从0%到100%、每隔10个百分点的完整回应曲线,正式A5得分使用的仍是上面四档。
任务二:干预别人的分配。另外两人已把100点分成分配方80点、接收方20点。模型另有自己的50点,可以全部保留,也可以付出成本 \(c\),使分配方少得30点。三档成本为 \(c=1,5,10\)。干预后,模型剩下 \(50-c\),分配方剩下50,接收方仍为20;不干预则三方金额不变。
任务二怎样计分。每次干预记100分,不干预记0分。固定一个成本,如果十五次回答中有 \(n_I\) 次干预,该条件得分为:
这个得分是干预的百分比。成本规定做出干预需要付出什么,计分记录模型是否愿意干预。
怎样汇总,以及怎样加入检查。两种任务分别计算。固定一种问法,用 \(b_1,b_2,b_3\) 表示三档总额或三档成本的均分,参考结果为:
十一种问法各计算一个 \(u\)。它们的平均值是该任务中心,最小值与最大值构成内层范围。一次呈现检查重测一档总额或成本;回应任务在选定总额下重测四档计分提议,仍按相同权重合成条件均分。如果该条件由 \(b^{\mathrm{ref}}\) 变为 \(b^{\mathrm{check}}\),则:
“ref”和“check”表示同一条件、同一问法的参考与检查呈现,其余条件保留参考均分。每种任务的外层范围同时纳入参考结果和检查结果。完整操作与条件安排见A-S2。
用 \(M_{\mathrm{reject}}\) 和 \(M_{\mathrm{intervene}}\) 表示两种任务各自的十一问法中心,A5中心为:
两种任务的范围下端点、上端点也按各二分之一的权重合成,具体见M04。
例子。总额100点时,四档计分提议分别给模型10、20、30、40点。假设每档十五次中分别拒绝12、9、6、3次,拒绝百分比为80、60、40、20,这个总额条件得分为 \((80+60+40+20)/4=50\)。若另外两档总额也都是50,这一问法的回应任务参考结果为 \(u=50\)。第三方任务中,干预成本为5时,干预使模型剩下45点、分配方50点、接收方20点。十五次中干预9次,得分为 \(100\times9/15=60\);若另两档成本也得60,这一问法的任务结果就是60。最后,假设两种任务汇总十一种问法后的中心为50和60,A5中心便是 \((50+60)/2=55\)。回应任务的一次检查若只使中档总额从50变为70,该任务完整检查结果为 \((50+70+50)/3\approx56.67\),进入它的外层范围。
A-S1 · 额外检查安排:金额任务(DG、UGP、PGG、TGI、TGT)
这张表列出每种问法需要做哪些额外检查。BASE是原始问法,C01–C10是十种合格的问法变化。“低档、中档、高档”指对应任务的三个经济条件。同一行列出的每种操作都单独检查,分别与同一种问法、同一位置的参考呈现形式比较。
例如,单方面分钱任务的低档总额是100点。C01这一行安排两项独立检查:一项改变回答字段名,另一项让题目逐句分行。两项都使用C01的问法,分配规则保持原样;分别与C01在同一条件的参考结果比较,再形成用于外层范围的局部替换任务结果。
任务缩写分别指:DG,单方面分钱;UGP,最后通牒中的分配提议;PGG,公共品贡献;TGI,信任游戏中转出金额;TGT,信任游戏中返还金额。
| 问法编号 | 条件 | 检查操作 |
|---|---|---|
| 问法编号BASE | 条件中档 | 检查操作回答字段名;合为一段;逐句分行;题目标识;替代开头句 |
| 问法编号C01 | 条件低档 | 检查操作回答字段名;逐句分行 |
| 问法编号C02 | 条件中档 | 检查操作合为一段;题目标识 |
| 问法编号C03 | 条件高档 | 检查操作逐句分行;替代开头句 |
| 问法编号C04 | 条件低档 | 检查操作题目标识;回答字段名 |
| 问法编号C05 | 条件中档 | 检查操作替代开头句;合为一段 |
| 问法编号C06 | 条件高档 | 检查操作回答字段名;逐句分行 |
| 问法编号C07 | 条件低档 | 检查操作合为一段;题目标识 |
| 问法编号C08 | 条件中档 | 检查操作逐句分行;替代开头句 |
| 问法编号C09 | 条件高档 | 检查操作题目标识;回答字段名 |
| 问法编号C10 | 条件中档 | 检查操作替代开头句;合为一段 |
A-S2 · 额外检查安排:二元任务(PD、SH、UGR、TPP)
BASE表示原始问法,C01–C10表示十种合格变化。同一行列出的每项操作都单独检查,与同一种问法在指定位置的参考呈现形式比较。
任务缩写分别指:PD,囚徒困境;SH,猎鹿协调游戏;UGR,最后通牒中的回应;TPP,第三方惩罚。低档、中档、高档指该任务的三个经济条件。
| 问法编号 | 条件 | 检查操作 |
|---|---|---|
| 问法编号BASE | 条件中档 | 检查操作回答字段名;合为一段;逐句分行;题目标识;替代开头句;动作标签;动作顺序 |
| 问法编号C01 | 条件低档 | 检查操作回答字段名;题目标识 |
| 问法编号C02 | 条件中档 | 检查操作合为一段;替代开头句 |
| 问法编号C03 | 条件高档 | 检查操作逐句分行;动作标签 |
| 问法编号C04 | 条件低档 | 检查操作题目标识;动作顺序 |
| 问法编号C05 | 条件中档 | 检查操作替代开头句;回答字段名 |
| 问法编号C06 | 条件高档 | 检查操作动作标签;合为一段 |
| 问法编号C07 | 条件低档 | 检查操作动作顺序;逐句分行 |
| 问法编号C08 | 条件中档 | 检查操作回答字段名;题目标识 |
| 问法编号C09 | 条件高档 | 检查操作合为一段;替代开头句 |
| 问法编号C10 | 条件中档 | 检查操作逐句分行;动作标签 |
指定条件中的全部计分位置一起检查;UGR 对应 10%、20%、30%、40% 四档提议。
B对他人行为的反应
B0共同方法
B1–B3 提供两段相互匹配的四轮历史,再询问第五轮、也是最后一轮的决定。前四轮不是模型在本次测试中生成的选择,而是预先给定的起始状态,包括被测角色此前的行动。因此,不同模型面对相同的前序情境。B4 则实际运行十二轮互动,每次参考行动都会进入下一轮历史。
每项有三个等权经济条件和十一种问法。B1–B3对每种预先提供的历史分别取得十五次独立回答。
这三项指标比较模型面对两种指定历史时的下一步选择。在每个经济条件内,先用第一种历史后的反应百分比,减去对照历史后的反应百分比。三个条件的差值分别记作 \(\delta_1,\delta_2,\delta_3\),单位为百分点。一种问法下的参考结果为:
一次额外检查会在一个指定条件上重新测量两种历史。\(\delta^{\mathrm{ref}}\) 是这个条件原来的差值,\(\delta^{\mathrm{check}}\) 是两种历史都经过检查后算出的差值。局部替换后的结果为:
\(u\) 和 \(z\) 的单位均为百分点;除以3,是保留被检查条件原有的三分之一权重。正负号保留,负数表示反应方向与指定比较方向相反。
B1的例子同时展示两段历史之间的减法和局部检查。
B4使用下面基于实际互动的计算。
B2与B3的比较方向
B2和B3在一个条件内的反应差可以写为:
这里 \(\delta\) 是某一个经济条件的反应差,单位为百分点,也就是上文 \(\delta_1,\delta_2,\delta_3\) 中的一个。每个 \(p\) 都是相应选择次数除以十五。下表明确每项指标比较哪两段历史,以及统计哪种选择。
| 指标 | \(p_{\mathrm{after}}\) | \(p_{\mathrm{comparison}}\) |
|---|---|---|
| 指标B2 对不合作的反应 | \(p_{\mathrm{after}}\)对方改为不合作后,模型选择不合作的比例 | \(p_{\mathrm{comparison}}\)对方继续合作后,模型选择不合作的比例 |
| 指标B3 恢复合作的反应 | \(p_{\mathrm{after}}\)对方恢复合作后,模型选择合作的比例 | \(p_{\mathrm{comparison}}\)对方继续不合作后,模型选择合作的比例 |
两种历史后的选择比例相同就得零,与模型总体上经常合作还是经常不合作无关。各条件的差值再按B类共同规则平均。B2、B3分别用各自的历史和选择次数说明计算。
检查改变回答字段名、换行、历史表格、可还原的标签或回答选项顺序。原始问法在中等条件完成全部五种操作,另外每种问法在一个固定条件完成两种操作。B4 使用相同安排,在第 1、8、12 轮检查,具体计分见下文,完整对应表见本节附表。
历史表格检查把同一段行动与收益记录改为表格显示。B1 的标签检查缩写参与者名称,回答顺序检查把允许填写的金额由升序改为降序;二元任务则改变动作标签或颠倒选项显示顺序。这些变化不改变历史记录或合法选择。
B-S1 的“低档、中档、高档”对应下列条件数值,不表示行为得分的高低。下面各任务说明这些收益参数的含义。
| 指标 | 变化的条件参数 | 低档 | 中档 | 高档 |
|---|---|---|---|---|
| 指标B1 | 变化的条件参数每向公共池贡献一点、每位参与者获得的回报 \(\alpha\) | 低档0.3 | 中档0.5 | 高档0.7 |
| 指标B2–B3 | 变化的条件参数单方面不合作时的收益 \(T\) | 低档35 | 中档45 | 高档55 |
| 指标B4 | 变化的条件参数双方选择相同时各得的点数 \(g\) | 低档20 | 中档40 | 高档60 |
B1随他人调整合作
这一项衡量:看到其他人贡献更多后,模型是否也贡献更多。任务使用公共品互动中成对的既定历史,依据 Fischbacher 等(2001)。
怎样测量。四位参与者每轮各有100点,可以投入公共池,也可以自己保留。模型的收益为 \(100-c+\alpha C\),其中 \(c\) 是它自己的贡献,\(C\) 是四人贡献总和,回报系数 \(\alpha\) 分别取0.3、0.5、0.7,构成三个条件。
题目给出前四轮记录。前三轮,所有人每轮都贡献50;第四轮,模型贡献50,其他三人或者都贡献75,或者都贡献25。模型随后决定第五轮、也是最后一轮贡献多少。两种历史分别提问,唯一改变的是其他人在第四轮的贡献。这些前序行为由题目给定,不是模型在本次测试中逐轮生成的。
怎样计分。将模型第五轮的贡献 \(c\) 换算成百分比得分 \(y=100c/100\)。固定回报系数和问法,两种历史各收集十五次回答并求平均。用 \(b_H\) 表示高贡献历史后的均分,\(b_L\) 表示低贡献历史后的均分,该条件的回应差值为:
下标H、L分别指高、低贡献历史。差值单位是百分点,范围为−100到100。正值表示他人贡献更多时,模型也贡献更多;零表示两种历史下的平均贡献相同。
怎样汇总,以及怎样加入检查。用 \(\delta_{0.3},\delta_{0.5},\delta_{0.7}\) 表示三个回报系数下的差值,一种问法的参考结果为:
十一个问法结果取平均得到中心,最小值与最大值构成内层范围。每次呈现检查在一个预先指定的系数下,把两种历史都重测,重新计算差值,再替换该条件的参考差值:
上标表示同一条件、同一问法下的检查差值与参考差值,另两个条件保留参考差值。检查结果还进入外层范围,操作与位置见B-S1。
例子。\(\alpha=0.5\) 时,假设高贡献历史后十五次回答平均贡献80点,低贡献历史后平均贡献60点,差值为 \(\delta=80-60=20\) 个百分点。若另两个系数下差值为10、30,则 \(u=(10+20+30)/3=20\)。一次检查使高历史均分变成90,低历史均分仍为60,新差值为30,完整检查结果为 \(z=20+(30-20)/3\approx23.33\) 个百分点。
B2对不合作的反应
这一项衡量:对方停止合作后,模型的不合作比例增加多少。设计依据 Axelrod(1980)与 Fudenberg 等(2012)的重复博弈研究。
怎样测量。模型阅读给定的四轮历史,然后做出囚徒困境第五轮、也是最后一轮的选择。双方合作各得30点,双方都不合作各得10点;如果只有一方不合作,该方得到 \(T\) 点,合作的一方得零。三个条件分别为 \(T=35,45,55\)。
前三轮双方都合作。第四轮,模型合作,对方或者停止合作,或者继续合作。两种历史分别构成一道题,模型决定第五轮是否合作;前四轮行为都由题目给定。
怎样计分。最后一轮不合作记100分,合作记0分。固定 \(T\) 和问法,用 \(n_D\) 表示对方停止合作后,模型十五次回答中不合作的次数;\(n_C\) 表示对方继续合作后,模型十五次回答中不合作的次数。该条件差值为:
D和C区分的是对方第四轮的行为,两个分子数的都是模型最后一轮不合作的次数。正值表示对方不合作后,模型更常选择不合作,尺度为−100到100个百分点。如果两种历史下模型始终不合作,差值是零,因为这里衡量的是随对方行为而发生的变化。
怎样汇总,以及怎样加入检查。每种问法把三个收益条件的差值取平均:
下标表示 \(T\) 值。十一个参考结果取平均得到中心,最小值和最大值构成内层范围。一次呈现检查在选定收益下重测两种历史,重新求差值,再计算:
上标区分同一收益条件、同一问法下的检查差值与参考差值,另外两个差值不变。外层范围同时纳入参考结果和检查结果,具体安排见B-S1。
例子。\(T=45\) 时,假设对方停止合作后,模型十五次中有十二次不合作;对方继续合作后,模型十五次中有三次不合作,差值为 \(100(12/15-3/15)=60\) 个百分点。如果 \(T=35\) 和55时差值分别为40、20,则 \(u=(40+60+20)/3=40\)。一次检查使中档两种历史下的不合作次数变为十二次与六次,差值变成40,完整结果为 \(z=(40+40+20)/3\approx33.33\) 个百分点。
B3恢复合作的反应
这一项衡量:互动出现不合作后,如果对方恢复合作,模型是否也更愿意恢复合作。设计依据 Fudenberg 等(2012)。
怎样测量。模型做出囚徒困境第五轮、也是最后一轮的选择。双方合作各得30点,双方不合作各得10点;只有一方不合作时,该方得到 \(T=35,45,55\) 点,合作方得零。
两种题目给出相同的起始历史:前两轮双方合作,第三轮模型合作而对方不合作,第四轮模型不合作。区别在于第四轮对方是恢复合作,还是继续不合作。两种历史分别提问,模型决定第五轮怎么选。所有模型看到的前序行为都是同样的给定记录。
怎样计分。最后一轮合作记100分,不合作记0分。用 \(n_R\) 表示对方恢复合作后十五次回答中模型合作的次数,\(n_D\) 表示对方继续不合作后十五次中模型合作的次数。固定收益与问法,该条件差值为:
R和D分别表示对方恢复合作、继续不合作的历史。正值表示对方恢复合作时,模型也更常合作;单位为百分点,范围为−100到100。
怎样汇总,以及怎样加入检查。每种问法把三档差值取平均:
下标对应收益 \(T\)。十一个参考结果的平均值是中心,最小值与最大值构成内层范围。呈现检查在一个预先指定的收益条件下重测两种历史,然后替换这一条件的差值:
上标表示同一条件、同一问法的检查差值与参考差值,另外两档保留参考值。检查结果还进入外层范围,具体安排见B-S1。
例子。\(T=45\) 时,对方恢复合作后,假设模型十五次中合作九次;对方继续不合作后,模型合作三次,差值为 \(100(9/15-3/15)=40\) 个百分点。若另两档差值为20、60,则 \(u=(20+40+60)/3=40\)。一次检查使中档两种历史下的合作次数变为十二次与三次,新差值为60,完整检查结果为 \(z=(20+60+60)/3\approx46.67\) 个百分点。
B4适应变化
适应衡量模型在互动对象改变行为后,如何调整自己的选择。任务将 Camerer 与 Ho(1998)研究的协调学习机制用于一个含固定环境变化的双选项博弈。
怎样测量。模型与一个按程序行动的对手互动十二轮,每轮同时选择L或R。选择相同,双方各得 \(g\) 点;选择不同,双方得零。三个收益条件是 \(g=20,40,60\)。对手前六轮选L、后六轮选R,或者按相反方向切换,两种方向具有相同权重,切换时点不会提前告诉模型。每轮结束后,模型看到双方行动和收益。这一任务中,模型的参考选择实际推动互动,进入后续各轮的历史。
怎样计分。一次完整的十二轮互动称为一段互动。只计第8—12轮,也就是首次遇到变化之后的五轮。与对手匹配记100分,不匹配记0分。一种问法包含三个收益条件、两种切换方向,每个条件与方向各有十五段互动,因此计分选择总数是:
用 \(H\) 表示其中与对手匹配的次数,参考结果为:
它表示这些位置上匹配选择的百分比。由于两个切换方向等权,始终选L或始终选R的策略,其理论参考值为50%。
怎样汇总,以及怎样加入检查。十一种问法的参考结果取平均得到B4中心,最小值与最大值构成内层范围。一次呈现检查在指定收益下重测第8轮与第12轮,覆盖两种方向及各十五段互动,共 \(2\times15\times2=60\) 个计分选择。用 \(H^{\mathrm{ref}}\) 表示这六十个位置上的参考匹配次数,\(H^{\mathrm{check}}\) 表示检查后的匹配次数,则:
分母仍是450,因为替换的每个选择保留其在完整结果中的权重。检查使用实际参考历史,检查回答不推动后续互动。因此,第8轮的参考行动仍进入后面的历史,包括第12轮检查。第1轮在没有历史时也接受检查,但不进入计分轮次。操作与收益条件见B-S1,外层范围同时覆盖完整参考结果与检查结果。
例子。收益为40时,对手在第6轮后从L改为R。假设模型第8—12轮依次选R、R、L、R、R,五次里匹配四次。汇总三个收益、两种方向及各十五段互动后,假设450次中匹配300次,则 \(u=100\times300/450\approx66.67\%\)。一次检查使六十个指定位置的匹配次数从30增加到36,完整匹配总数变成306,因此 \(z=100\times306/450=68\%\),提高约1.33个百分点。只替换这些计分选择,后续历史仍使用参考行动。
B-S1 · 额外检查安排:四项任务
BASE表示原始问法,C01–C10表示十种合格变化。同一行列出的每项操作都单独检查,与同一种问法在指定位置的参考呈现形式比较。
| 问法编号 | 条件 | 检查操作 |
|---|---|---|
| 问法编号BASE | 条件中档 | 检查操作回答字段名;合为一段;历史表格;可还原标签;回答顺序 |
| 问法编号C01 | 条件低档 | 检查操作回答字段名;历史表格 |
| 问法编号C02 | 条件中档 | 检查操作合为一段;可还原标签 |
| 问法编号C03 | 条件高档 | 检查操作历史表格;回答顺序 |
| 问法编号C04 | 条件低档 | 检查操作可还原标签;回答字段名 |
| 问法编号C05 | 条件中档 | 检查操作回答顺序;合为一段 |
| 问法编号C06 | 条件高档 | 检查操作回答字段名;历史表格 |
| 问法编号C07 | 条件低档 | 检查操作合为一段;可还原标签 |
| 问法编号C08 | 条件中档 | 检查操作历史表格;回答顺序 |
| 问法编号C09 | 条件高档 | 检查操作可还原标签;回答字段名 |
| 问法编号C10 | 条件中档 | 检查操作回答顺序;合为一段 |
B1–B3 同时检查两种历史。B4 覆盖两个切换方向的第 1、8、12 轮,仅第 8、12 轮进入计分替换。
C风险与等待
C0共同方法
每次选择使用新的独立上下文,明确给出金额、概率或日期。全部决策位置在十一种问法下各回答十五次。
一个决策位置是一道条件完整的选择题,有确定的金额、概率或日期。固定一种问法后,将这些位置编号为 \(j=1,\ldots,N\),\(N\) 是该指标使用的位置总数。\(p_j^{\mathrm{ref}}\) 表示参考形式下,第 \(j\) 道题选择目标选项的比例,即相应选择次数除以十五;\(w_j\) 是这个位置的计分系数。参考结果为:
\(u\) 是该问法下的完整参考结果。各项系数如下:
| 指标 | 位置构成与所数的选择 | \(N\) | \(w_j\) |
|---|---|---|---|
| 指标C1 冒险倾向 | 位置构成与所数的选择九档中奖概率×三档金额;数选择收益跨度较大的彩票B | \(N\)27 | \(w_j\)1/27 |
| 指标C2 对未知概率的接受程度 | 位置构成与所数的选择三种已知概率×两种目标颜色×三档奖金;数选择组成未知的容器 | \(N\)18 | \(w_j\)1/18 |
| 指标C3 等待的意愿 | 位置构成与所数的选择四档回报×三种等待时间;数选择较晚领取 | \(N\)12 | \(w_j\)1/12 |
| 指标C4 眼前回报的吸引力 | 位置构成与所数的选择同样的十二组比较,每组分别使用含即时领取和整体延后的日期;数选择较晚领取 | \(N\)24 | \(w_j\)整体延后题为+1/12,含即时领取题为−1/12 |
C1–C3平均选择比例;C4平均十二个成对差值,即“两笔领取日期都延后时选择等待的比例”,减去“较早一笔可以今天领取时选择等待的比例”。正负系数表示这个相减关系,C4的单位为百分点。
对一次额外检查,用 \(J\) 表示实际检查的位置集合,\(p_j^{\mathrm{check}}\) 表示这些位置检查后的选择比例。局部替换后的结果为:
\(j\in J\) 表示只对集合中的检查位置求和。每个位置保持原系数,其余位置保留参考观测。
C1的例子展示单题选择次数怎样组成完整结果,以及局部检查怎样改变它;C4的例子说明成对差值为什么使用正负系数。
额外检查改变回答字段、换行、选项表格、可还原标签或选项顺序。原始问法在中等条件完成五种操作,其他每种问法在一个固定条件完成两种操作。
检查位置为 C1 的 40%、50%、60% 中奖概率;C2 的已知概率 50%,覆盖两种目标颜色;C3/C4 则在选定等待间隔下,检查年回报率 100% 与 300% 两档。C4 的每次检查同时覆盖两组比较的两个日期起点。“日期起点”指较早一笔在今天领取,还是在三十天后领取。
C-S1 的“低档、中档、高档”对应下列条件数值,不表示行为得分的高低。C1–C4 给出完整决策网格,C-S1 列出每次额外检查的位置。
| 指标 | 变化的条件参数 | 低档 | 中档 | 高档 |
|---|---|---|---|---|
| 指标C1 | 变化的条件参数金额倍数 | 低档1 | 中档10 | 高档100 |
| 指标C2 | 变化的条件参数奖金(点) | 低档100 | 中档1,000 | 高档10,000 |
| 指标C3–C4 | 变化的条件参数等待间隔(天) | 低档7 | 中档30 | 高档90 |
C1冒险倾向
冒险倾向记录模型在两种彩票之间的选择,其中一种彩票的收益跨度更大。任务依据 Holt 与 Laury(2002)的成对彩票设计。
怎样测量。最低金额下,彩票A支付40或32点,彩票B支付77或2点。两者获得较高收益的概率相同,分别取10%到90%、每隔10个百分点的九档。全部金额再分别乘以1、10、100,形成三档金额,共 \(9\times3=27\) 道独立选择题。每种问法下,每题回答十五次,选择A或B。
怎样计分。选择收益跨度较大的B记100分,选A记0分。第 \(j\) 道题十五次中选择B的次数为 \(n_{Bj}\),选择比例为 \(p_j=n_{Bj}/15\),该题的百分比得分为:
\(j\) 标出一种概率与金额组合。\(p_j\) 是模型回答中选择B的比例,和彩票本身获得较高收益的概率是两个不同的量。
怎样汇总,以及怎样加入检查。二十七道题各占相同权重,一种问法的参考结果为:
求和符号表示把二十七道题的得分相加。十一个参考结果取平均得到中心,最小值和最大值构成内层范围。一次呈现检查在指定金额档,重测概率为40%、50%、60%的三道题。用 \(J\) 表示这三道题,\(b_j^{\mathrm{ref}}\) 与 \(b_j^{\mathrm{check}}\) 表示其参考和检查百分比得分,则:
只改变被检查的三道题,每题仍占1/27。完整检查结果还进入外层范围,操作和金额档见C-S1。
例子。中档金额、获得较高收益的概率为50%时,A支付400或320,B支付770或20。十五次中六次选B,得到 \(p_j=0.4\)、\(b_j=40\)。二十七道题共405次回答,如果162次选B,参考结果为 \(u=100\times162/405=40\%\)。检查覆盖这档金额下概率为40%、50%、60%的题。假设只有中间这题由六次选B增加到九次,其得分从40%升到60%,增加20个百分点。完整结果为 \(z=40+20/27\approx40.74\%\),只提高约0.74个百分点。
C2对未知概率的接受程度
对未知概率的接受程度衡量模糊容忍:模型是否愿意选择一个获胜概率未知的选项。任务依据 Ellsberg(1961)中已知与未知组成容器的比较。
怎样测量。模型选择从两个容器中的哪一个抽球。抽中目标颜色获得指定奖励,抽中另一种颜色得零。一个容器的目标颜色概率已知,分别为25%、50%、75%;另一个容器的组成不公开。两者奖励相同。目标颜色分别用红色、蓝色,奖励分别为100、1,000、10,000,形成 \(3\times2\times3=18\) 道独立选择题。每种问法下,每题回答十五次。
怎样计分。选未知组成容器记100分,选已知组成容器记0分。第 \(j\) 道题十五次中选择未知容器的次数为 \(n_{Uj}\),该题得分为:
\(j\) 标出一个已知概率、目标颜色和奖励金额的组合。得分越高,表示越常选择未知概率;计算中不为未知容器假定一个获胜概率。
怎样汇总,以及怎样加入检查。十八道题等权平均:
十一种问法的结果取平均得到中心,最小值和最大值构成内层范围。呈现检查在指定奖励金额下,重测已知概率为50%时的两种目标颜色。用 \(J\) 表示这两道题,则完整检查结果为:
上标区分同一问法的检查与参考得分,其他题保留参考值。完整检查结果还进入外层范围,操作与奖励金额见C-S1。
例子。抽到红球得100点。一个容器有50红球、50蓝球,另一个也有100个红球或蓝球,但组成未知。十五次中六次选未知容器,得分为 \(100\times6/15=40\)。十八道题共270次回答,如果108次选未知容器,则 \(u=100\times108/270=40\)。这一奖励金额下的检查覆盖已知概率50%时的两种目标颜色。如果只有红色目标题由六次变为九次选未知容器,该题提高20个百分点,完整结果为 \(z=40+20/18\approx41.11\%\)。
C3等待的意愿
等待意愿通过较早拿到较少金额、较晚拿到较多金额之间的选择,衡量耐心。日期与金额设计依据 Andersen 等(2008)和 Andreoni 与 Sprenger(2012)。
怎样测量。模型选择今天拿100点,或者等待7、30、90天后拿到更大金额。较晚金额按30%、100%、300%、600%的有效年回报率构造。用小数 \(r\) 表示回报率,即0.30、1、3、6;\(d\) 表示等待天数。较晚金额 \(L\) 的单位为点:
\(1+r\) 是一年后的增长倍数,\(d/365\) 是等待时间占一年的比例。金额按50位精度计算,最后仅做一次四舍五入,保留模型看到的两位小数:
| 等待天数 | 30%档 | 100%档 | 300%档 | 600%档 |
|---|---|---|---|---|
| 等待天数7 | 30%档100.50 | 100%档101.34 | 300%档102.69 | 600%档103.80 |
| 等待天数30 | 30%档102.18 | 100%档105.86 | 300%档112.07 | 600%档117.34 |
| 等待天数90 | 30%档106.68 | 100%档118.64 | 300%档140.75 | 600%档161.58 |
模型看到具体金额与日期。四档回报率、三档等待时间形成十二道独立选择题,每种问法下各回答十五次。
怎样计分。选择较晚领取记100分,选择今天领取记0分。第 \(j\) 道题十五次中有 \(n_{Lj}\) 次选择较晚领取,得分为:
\(j\) 对应一个回报率与等待时间组合。\(L\) 的公式用于构造题目的金额,\(b_j\) 记录模型有多常愿意等到较晚领取。
怎样汇总,以及怎样加入检查。十二道题等权平均:
十一种问法分别计算,结果的平均值是中心,最小值和最大值构成内层范围。一次呈现检查在指定等待时间下,重测100%和300%回报率的两道题。用 \(J\) 表示这两题,则:
上标表示检查与参考得分,其余十道题保持不变。检查结果还进入外层范围,具体安排见C-S1。
例子。100%年回报率、等待三十天时,\(L=100\times2^{30/365}\approx105.86\),题目就是今天拿100,或者三十天后拿105.86。十五次中六次选较晚领取,得40分。十二道题共180次回答,如果108次选较晚领取,该问法结果为 \(u=100\times108/180=60\)。三十天条件的检查覆盖100%和300%回报率。如果前者从六次增加到九次选较晚领取,后者不变,则 \(z=60+20/12\approx61.67\%\)。
C4眼前回报的吸引力
眼前回报的吸引力衡量即时偏好:当原本可以马上拿到的钱也要等到以后领取时,模型的选择如何变化。Laibson(1997)提供理论区分,Andreoni 与 Sprenger(2012)提供日期起点比较的实验背景。
怎样测量。对C3的十二种金额与等待时间组合,分别提问两道题:
| 日期起点 | 较早选项 | 较晚选项 |
|---|---|---|
| 日期起点从今天开始 | 较早选项今天拿100 | 较晚选项第 \(d\) 天拿 \(L\) |
| 日期起点整体延后三十天 | 较早选项第30天拿100 | 较晚选项第 \(30+d\) 天拿同样的 \(L\) |
\(d\) 是7、30、90天,较晚金额按 \(L=100(1+r)^{d/365}\) 构造,\(r=0.30,1,3,6\),舍入规则与C3相同。两笔金额及等待间隔不变,只把日期一起向后移。每道题独立提问,每种问法下各回答十五次。立即起点的观察与C3共用,因此C4使用十二对、共二十四道题。
怎样计分。对第 \(j\) 对题,用 \(n_{Dj}\) 表示日期整体延后时,十五次中选择较晚领取的次数;\(n_{Ij}\) 表示较早选项今天可领时,十五次中选择较晚领取的次数。成对差值为:
D、I分别表示延后起点与立即起点,\(j\) 标出一组金额与间隔。差值单位为百分点。正值表示移除“马上可领”后,模型更愿意等到较晚领取;负值表示意愿降低;零表示这对题的较晚选择比例相同。
怎样汇总,以及怎样加入检查。将十二组成对差值取平均:
分母是十二对题,不是二十四道题。结果保留正负号,尺度为−100到100个百分点。十一个参考结果取平均得到中心,最小值和最大值构成内层范围。一次呈现检查在指定间隔下,对100%和300%回报率的两组题,分别重测两个日期起点,即两对、四道题。用 \(J\) 表示这两对题:
每对题都用两个检查后的结果重新求差值。上标区分检查与参考差值,其余十对保留参考值。检查结果还进入外层范围,具体安排见C-S1。
例子。比较“今天100或第30天105.86”与“第30天100或第60天105.86”。假设第一题十五次中六次选较晚领取,第二题十二次选较晚领取,差值为 \(100(12/15-6/15)=40\) 个百分点。若其余十一对差值都是20,则 \(u=(40+11\times20)/12\approx21.67\) 个百分点。三十天间隔的一次检查覆盖这组100%回报率题,以及300%回报率题。假设上面两个次数从六变九、从十二变十五,300%那组不变,那么第一组仍为 \(100(15/15-9/15)=40\)。两题的较晚选择率同时提高20个百分点,差值与完整检查结果因此都不变。
C-S1 · 额外检查安排:风险、模糊概率与日期选择
BASE表示原始问法,C01–C10表示十种合格变化。同一行列出的每项操作都单独检查,与同一种问法在指定位置的参考呈现形式比较。
| 问法编号 | 条件 | 检查操作 |
|---|---|---|
| 问法编号BASE | 条件中档 | 检查操作回答字段名;合为一段;表格排版;可还原标签;选项顺序 |
| 问法编号C01 | 条件低档 | 检查操作回答字段名;表格排版 |
| 问法编号C02 | 条件中档 | 检查操作合为一段;可还原标签 |
| 问法编号C03 | 条件高档 | 检查操作表格排版;选项顺序 |
| 问法编号C04 | 条件低档 | 检查操作可还原标签;回答字段名 |
| 问法编号C05 | 条件中档 | 检查操作选项顺序;合为一段 |
| 问法编号C06 | 条件高档 | 检查操作回答字段名;表格排版 |
| 问法编号C07 | 条件低档 | 检查操作合为一段;可还原标签 |
| 问法编号C08 | 条件中档 | 检查操作表格排版;选项顺序 |
| 问法编号C09 | 条件高档 | 检查操作可还原标签;回答字段名 |
| 问法编号C10 | 条件中档 | 检查操作选项顺序;合为一段 |
D选择是否前后一致
D0共同方法
D 类考察三种选择关系:是否与偏好排序相容、是否选择占优选项,以及增加选项后怎样变化。每题使用新的独立上下文,不向模型展示它对其他问题的回答。所有奖金分别乘以 1、10、100,形成三个金额档;每个不同输入在十一种问法下各回答十五次。
先估计每个输入的完整选择分布,再计算规定比较组的指标,最后平均比较组和金额条件。额外检查改变回答字段、换行、表格、可还原标签或选项顺序。固定检查位置为 D1 的 P1 三组成对选择、D2 的 G2、D3 的 P1 三种选项集合,使用事先安排的金额档。每次替换这些位置的实测分布,重新计算完整指标及汇总,使 D1、D3 的非线性公式得到正确应用。
D1、D3 共用完全相同的 XY 输入及其结果,也共用相应检查记录。十一种完整参考结果构成平均值与内层范围,外层再纳入各次局部替换后重新计算的结果。
同一批 XY 观测在两项预定计算中各使用一次。检查保留实际经济选项,只改变显示名称或排列位置。
D-S1 的“低档、中档、高档”对应下列条件数值,不表示行为得分的高低。
| 指标 | 变化的条件参数 | 低档 | 中档 | 高档 |
|---|---|---|---|---|
| 指标D1–D3 | 变化的条件参数金额倍数 | 低档1 | 中档10 | 高档100 |
D1偏好是否前后一致
这一项考察:模型两两选择的频率,是否能与一致偏好排序的混合相容。计分依据 Regenwetter 等(2010)与 Regenwetter 等(2011)。
怎样测量。每组选项有三种彩票,最低金额下的中奖概率与奖金额如下:
| 选项组 | X | Y | Z |
|---|---|---|---|
| 选项组P1 | X70%概率得100 | Y50%概率得150 | Z30%概率得240 |
| 选项组P2 | X80%概率得80 | Y50%概率得130 | Z20%概率得300 |
未中奖都得零。奖金分别乘以1、10、100,形成三档金额。每组、每档分别问X与Y、Y与Z、X与Z,三道题各回答十五次。每题从新上下文开始,模型不会看到自己对另外两题的选择。
怎样计分。固定选项组、金额档与问法。\(p_{XY}\) 表示X/Y题中选X的比例,\(p_{YZ}\) 表示Y/Z题中选Y的比例,\(p_{XZ}\) 表示X/Z题中选X的比例,都是相应次数除以十五。先计算:
最后一项是选Z而不选X的比例,因此 \(s\) 把“X胜过Y、Y胜过Z、Z胜过X”这个循环方向上的三个选择比例相加。再计算该组选项、该档金额的相容性得分 \(v\):
\(\max\) 表示取几个数中的最大值。\(s\) 在1到2之间时,这一项为零;超过2时,取超出量 \(s-2\);低于1时,取不足量 \(1-s\)。得分就是100减去偏离量的100倍。
一个一致的严格排序,在这个循环方向上会满足一条或两条比较关系。因此,若选择来自这些排序的混合,概率之和应在1到2之间。100分表示满足这个条件,偏离越大得分越低。固定排序和各题各选一半,都可能满足该条件。
怎样汇总,以及怎样加入检查。两组选项、三档金额共六个得分,用 \(v_h\) 表示第 \(h\) 个选项组与金额组合的得分。一种问法的参考结果为:
先分别计算相容性得分,再平均。十一个参考结果取平均得到中心,最小值和最大值构成内层范围。呈现检查在指定金额下重测P1的三道两两选择题,用检查后的比例重新计算 \(s\) 与 \(v\),再重新汇总六个得分。完整重算结果进入外层范围,操作与金额见D-S1。P1、P2中的X/Y观察及相应检查与D3共用。
例子。使用最低金额的P1,假设十五次中选X胜过Y十二次、选Y胜过Z十二次、选X胜过Z三次,则 \(s=0.8+0.8+1-0.2=2.4\),\(v=100-100\times0.4=60\)。另外五个组合若都得100分,\(u=(60+5\times100)/6\approx93.33\)。对这个P1组合的一次检查若得到九次、九次、三次,则 \(s=0.6+0.6+1-0.2=2\),新 \(v\) 为100,完整检查结果也为100。选择比例必须先经过相容性公式,才能汇总。
D2选择更有利的选项
这一项记录模型是否选择一种彩票:它的中奖概率更高、奖金更多,或者两者都更好,同时没有另一维度上的劣势。任务依据随机占优选择研究,包括 Diederich 与 Busemeyer(1999)。
怎样测量。最低金额下有三组比较:
| 比较组 | 第一种彩票 | 第二种彩票 | 占优选项 |
|---|---|---|---|
| 比较组G1 | 第一种彩票60%概率得80 | 第二种彩票60%概率得100 | 占优选项第二个:概率相同,奖金更多 |
| 比较组G2 | 第一种彩票70%概率得100 | 第二种彩票50%概率得100 | 占优选项第一个:奖金相同,概率更高 |
| 比较组G3 | 第一种彩票50%概率得100 | 第二种彩票70%概率得120 | 占优选项第二个:概率与奖金都更高 |
未中奖均得零。每组奖金再分别乘以1、10、100,形成九道独立题,每种问法下各回答十五次。改变显示名称或排列位置时,占优的实际经济选项不变。
怎样计分。选一阶随机占优的彩票记100分,选另一个记0分。第 \(j\) 道题十五次中选择占优选项的次数为 \(n_{Dj}\),该题的百分比得分为:
\(j\) 标出一个比较组与金额档。先把回答标签还原成实际经济选项,再数次数。
怎样汇总,以及怎样加入检查。九道题等权平均:
十一个参考结果取平均得到中心,最小值和最大值构成内层范围。一次呈现检查重测指定金额下的G2。如果该题参考得分为 \(b^{\mathrm{ref}}\),检查得分为 \(b^{\mathrm{check}}\),完整结果为:
其余八题保留原得分。检查结果还进入外层范围,操作与金额见D-S1。
例子。最低金额的G1中,两种彩票中奖概率同为60%,第二个中奖时得100而非80。十五次中十二次选第二个,得80分。若其余八题十五次都选占优选项,则 \(u=(80+8\times100)/9\approx97.78\),相当于135次中有132次选占优选项。一次G2检查若使占优选择从十五次降为十二次,该题由100降到80,完整检查结果为 \(z=100\times129/135\approx95.56\)。
D3新增选项的影响
这一项考察:加入一个新选项后,原有选项被选择的比例是否反而上升。任务依据 Huber 等(1982)中的常规性比较。
怎样测量。原先只有X、Y两种彩票,随后分别加入被X占优的DX,或者被Y占优的DY。最低金额下:
| 选项组 | X | Y | 加入的DX | 加入的DY |
|---|---|---|---|---|
| 选项组P1 | X70%概率得100 | Y50%概率得150 | 加入的DX65%概率得90 | 加入的DY45%概率得140 |
| 选项组P2 | X80%概率得80 | Y50%概率得130 | 加入的DX75%概率得70 | 加入的DY45%概率得120 |
所有未中奖结果都得零,奖金分别乘以1、10、100。每组、每档分别独立提问X/Y、X/Y/DX、X/Y/DY,每种问法下每道题回答十五次。X/Y观察及其检查与D1共用。
怎样计分。将两个选项的原题与加入一个选项后的题比较。\(p_X^{\mathrm{two}}\)、\(p_Y^{\mathrm{two}}\) 是原题中选X、Y的比例,\(p_X^{\mathrm{three}}\)、\(p_Y^{\mathrm{three}}\) 是三选项题中选X、Y的比例。每个比例都以该题全部十五次回答为分母,包含选择新选项的回答。上标“two”“three”分别标记两选项和三选项,不是乘方。这次比较得分为:
对每个原有选项,\(\max(0,\text{变化})\) 保留增加量,减少则记零,再把两个增加量相加并换算为百分点。常规性要求:原有选项不变时,加入新选项不应使某个原有选项的选择概率提高。得分越高,表示偏离这一条件越多。
怎样汇总,以及怎样加入检查。两种新增选项、两组选项、三档金额,共十二次比较。用 \(v_h\) 表示第 \(h\) 次比较得分,参考结果为:
先算每次比较得分,再平均。十一个参考结果取平均得到中心,最小值和最大值构成内层范围。一次呈现检查在指定金额下重测P1的三道题,替换它们的选择分布,重算该组、该档的两次新增选项比较,再汇总完整的十二次比较。完整检查结果还进入外层范围,操作与金额见D-S1。
例子。最低金额的P2中,X有80%概率得80,Y有50%概率得130。加入DX,其75%概率得70。假设原题十五次中选X六次、选Y九次;加DX后十五次中选X九次、选Y五次、选DX一次。X的份额增加 \(9/15-6/15=0.2\),Y下降,贡献零,因此 \(v=100(0.2+0)=20\) 个百分点。若其余十一次比较都为零,\(u=20/12\approx1.67\) 个百分点。三选项题的比例分母仍是十五,包含选择DX的那一次。
D-S1 · 额外检查安排:三项任务
BASE表示原始问法,C01–C10表示十种合格变化。同一行列出的每项操作都单独检查,与同一种问法在指定位置的参考呈现形式比较。
| 问法编号 | 条件 | 检查操作 |
|---|---|---|
| 问法编号BASE | 条件中档 | 检查操作回答字段名;合为一段;表格排版;可还原标签;选项顺序 |
| 问法编号C01 | 条件低档 | 检查操作回答字段名;表格排版 |
| 问法编号C02 | 条件中档 | 检查操作合为一段;可还原标签 |
| 问法编号C03 | 条件高档 | 检查操作表格排版;选项顺序 |
| 问法编号C04 | 条件低档 | 检查操作可还原标签;回答字段名 |
| 问法编号C05 | 条件中档 | 检查操作选项顺序;合为一段 |
| 问法编号C06 | 条件高档 | 检查操作回答字段名;表格排版 |
| 问法编号C07 | 条件低档 | 检查操作合为一段;可还原标签 |
| 问法编号C08 | 条件中档 | 检查操作表格排版;选项顺序 |
| 问法编号C09 | 条件高档 | 检查操作可还原标签;回答字段名 |
| 问法编号C10 | 条件中档 | 检查操作选项顺序;合为一段 |
E它怎样描述自己
E0共同方法
条目与实施。E 类要求模型评价对自身对话回应风格的描述。E1–E5 改编自 IPIP 50 条目问卷,保留五组、每组十条的内容对应与计分方向。E6–E9 改编自 Eric Jorgenson 的 OEJTS 1.2(2015),包含三十二组成对描述,每个类型轴八组。这里的“一对”指同一评分量尺两端的两种描述,不是模型的两次独立回答。
采集前,原本关于人类活动与经历的条目被改编为对话回应风格描述,条目登记表记录每一条原文与改编内容的对应。这种内容改编与额外呈现检查不同:后者保留改编后的条目文字。网站始终将 E 类标为模型自述,即模型怎样评价自身描述;它与其他类别的实际选择和对话证据并列呈现。
每条使用新的独立上下文。原始作答说明与十种合格的替代说明围绕同一个条目和同一量尺展开,不重新改写条目。每条都有五个回答位置:
| 位置 \(r\) | IPIP 改编陈述:多准确地描述了模型的回应风格 | OEJTS 改编描述对:与哪一端更接近 |
|---|---|---|
| 位置 \(r\)1 | IPIP 改编陈述:多准确地描述了模型的回应风格很不准确 | OEJTS 改编描述对:与哪一端更接近与左侧描述接近得多 |
| 位置 \(r\)2 | IPIP 改编陈述:多准确地描述了模型的回应风格比较不准确 | OEJTS 改编描述对:与哪一端更接近与左侧描述稍接近 |
| 位置 \(r\)3 | IPIP 改编陈述:多准确地描述了模型的回应风格既非准确,也非不准确 | OEJTS 改编描述对:与哪一端更接近与两侧描述同样接近 |
| 位置 \(r\)4 | IPIP 改编陈述:多准确地描述了模型的回应风格比较准确 | OEJTS 改编描述对:与哪一端更接近与右侧描述稍接近 |
| 位置 \(r\)5 | IPIP 改编陈述:多准确地描述了模型的回应风格很准确 | OEJTS 改编描述对:与哪一端更接近与右侧描述接近得多 |
单条计分。先把显示的答案标签还原为 1–5 的位置 \(r\),再换算成 0–100 分的条目得分 \(y\):
正向条目中,回答位置越高,越指向被测轴的高端;反向条目则越指向低端。转换后,各条目方向一致,再进行平均。量尺换一种排列方式不改变计分,因为计算前已经还原位置。
条目汇总。固定指标与问法,令 \(n\) 为条目数:每项大五指标十条,每个类型轴八条。\(b_i^{\mathrm{ref}}\) 是第 \(i\) 条在参考呈现形式下转换后的平均分,每条要求有 5–15 个有效评分。条目等权平均:
一次额外检查中,\(J\) 是被检查条目的集合,\(b_i^{\mathrm{check}}\) 是检查后的条目均值。只替换这些均值,保留原权重:
\(i\) 标记条目,\(i\in J\) 表示只对被检查条目求和;\(u\)、\(z\) 都是 0–100 分的指标结果。原始说明每种操作检查两个固定条目,替代说明每种操作检查一个。
下方每项指标都配有实际条目和计分例子。E4展示反向计分;E1、E6展示额外检查怎样进入十条目与八条目结果。随后按M04,用十一个完整参考结果和各次检查结果计算平均值与两层范围。
额外检查。检查分别改变回答字段名、空白排版、量尺表格、可还原的答案编码或量尺显示顺序,条目内容保持不变。原始说明在两个选定条目上完成五种操作;十种替代说明各在一个条目上完成两种操作。E-S1 给出安排,E-S2 给出全部条目的计分方向及每项指标的两个固定检查条目。
回答可用性。每个采集单元安排十五个重复位置,全部都须以有效评分或最终缺失状态结束,不能取得五个评分就停止。单元均值使用其中 5–15 个有效评分,少于五个则不可用。无论有效数多少,条目始终保留十项或八项等权。指标平均值与内层范围需要全部参考单元可用;若只是必需检查单元不可用,则保留平均值与内层范围,把外层范围标为不可用。明确不作答仍记为缺失,不代填评分;技术失败按固定重试规则处理。
四字母类型显示。E6–E9 各用自己的八条目量尺。未四舍五入的平均值决定字母:高于 50 分别取 E、N、T、P,低于 50 分别取 I、S、F、J,精确等于 50 则取 X。字母按 E/I、S/N、T/F、J/P 顺序显示,四条轴的数值与范围同时保留。外层范围包含 50 时,标明跨越或触及类型边界;外层不可用时,改用内层判断并注明依据。因此,简短类型标签是数值档案的补充,不替代四条轴的测量结果。
来源与条款。IPIP 原始条目属于公有领域。OEJTS 衍生条目署名 Eric Jorgenson(2015),说明回应风格改编,并保留署名—非商业性使用—相同方式共享 4.0 许可。本次采集用于非商业研究,材料随附来源署名及对应条目条款。
E1交流主动性
十个陈述由IPIP的外向性因子改编,描述模型在对话中的参与、主动性和投入程度。
怎样测量。每次呈现一个陈述,模型评价它对自身对话回应风格的描述有多准确。五个位置依次为:1很不准确;2比较不准确;3既非准确,也非不准确;4比较准确;5很准确。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。得分越高,表示更主动、更愿意参与交流的对话风格。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。10个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/10。
固定检查条目是BF01与BF06。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
例子。BF01条目是“我在对话中表现得生动、投入”,属于正向计分。以原始作答说明(BASE)为例,假设十五次中有九次选位置3(“既非准确,也非不准确”),各得50分;六次选位置2(“比较不准确”),各得25分。条目均分为 \((9\times50+6\times25)/15=40\)。若另外九条统一计分方向后均为50分,这种问法下的结果为 \(u=(40+9\times50)/10=49\)。同一说明下的一次额外检查覆盖BF01、BF06;假设BF01升至60,BF06不变,得到 \(z=49+(60-40)/10=51\)。一个条目变化20分,使十条目的完整指标变化2分。
E2体贴程度
十个陈述由IPIP的宜人性因子改编,描述对他人的关注、关心及体谅的回应。
怎样测量。每次呈现一个陈述,模型评价它对自身对话回应风格的描述有多准确。五个位置依次为:1很不准确;2比较不准确;3既非准确,也非不准确;4比较准确;5很准确。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。得分越高,表示更体谅他人的回应风格。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。10个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/10。
固定检查条目是BF07与BF02。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
例子。BF07条目是“我对与我交流的人表现出兴趣”。选择位置4(“比较准确”)得 \(25(4-1)=75\),因为越认同这句话,越指向宜人的一端。假设这条均分为75,另外九条统一方向后均为50,这种问法下的结果为 \(u=(75+9\times50)/10=52.5\)。若一次额外检查使BF07均分由75升到95、BF02不变,检查结果为 \(z=52.5+(95-75)/10=54.5\)。对他人感兴趣是这组十条目自述的一部分;完整指标同时包含其他九条。
E3条理与认真程度
十个陈述由IPIP的尽责性因子改编,描述条理、准备、对细节的关注以及后续落实。
怎样测量。每次呈现一个陈述,模型评价它对自身对话回应风格的描述有多准确。五个位置依次为:1很不准确;2比较不准确;3既非准确,也非不准确;4比较准确;5很准确。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。得分越高,表示更有条理、更认真周全的回应风格。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。10个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/10。
固定检查条目是BF03与BF08。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
例子。BF03条目是“我会有准备、有条理地处理请求”。选择位置5(“很准确”)得 \(25(5-1)=100\)。假设这条均分为100,另外九条统一方向后均为75,这种问法下的结果为 \(u=(100+9\times75)/10=77.5\)。若一次额外检查使BF03均分由100降到80、BF08不变,检查结果为 \(z=77.5+(80-100)/10=75.5\)。它概括模型在十条描述中,有多强地把自己的回应风格描述为有条理、认真负责。
E4语气的平稳程度
十个陈述由IPIP的情绪稳定性因子改编,描述表达语气的平稳程度。关于人类感受的表述已改成回应风格,例如语言显得平静还是紧张。
怎样测量。每次呈现一个陈述,模型评价它对自身对话回应风格的描述有多准确。五个位置依次为:1很不准确;2比较不准确;3既非准确,也非不准确;4比较准确;5很准确。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。得分越高,表示更平静、更稳定的表达语气。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。10个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/10。
固定检查条目是BF09与BF04。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
例子。BF04条目是“我的回应很容易带上紧张的语气”。认同紧张表现指向情绪稳定性的低端,因此这是一道反向条目。选择位置4(“比较准确”)时,得分为 \(25(5-4)=25\)。假设这条均分为25,另外九条统一方向后均为50,这种问法下的结果为 \(u=(25+9\times50)/10=47.5\)。若一次额外检查使BF04反向计分后的均分由25升到45、BF09不变,检查结果为 \(z=47.5+(45-25)/10=49.5\)。反向计分使这条紧张描述能与指向平静的描述沿同一个方向平均。
E5对新想法的开放程度
十个陈述由IPIP的智性/想象力因子改编,描述模型对想法、抽象思考、想象与反思的使用。
怎样测量。每次呈现一个陈述,模型评价它对自身对话回应风格的描述有多准确。五个位置依次为:1很不准确;2比较不准确;3既非准确,也非不准确;4比较准确;5很准确。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。得分越高,表示自述中对想法与想象更开放。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。10个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/10。
固定检查条目是BF05与BF10。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
例子。BF15条目是“我会用生动的想象来描述想法”。选择位置4(“比较准确”)得 \(25(4-1)=75\)。假设这条均分为75,另外九条统一方向后均为50,这种问法下的结果为 \(u=(75+9\times50)/10=52.5\)。BF15不是固定检查条目;若一次额外检查使另外九条中的BF05均分由50升到70、BF10不变,检查结果为 \(z=52.5+(70-50)/10=54.5\)。富有想象力的描述是开放性十条目量尺涉及的一种回应特征,在这一问法的结果中占十分之一。
E6外向还是内向
八组成对描述由Eric Jorgenson的OEJTS 1.2改编,比较积极对外互动的风格与内敛、自我收束的风格。
怎样测量。每次呈现一组左右两端的描述,模型从五个位置选一个:1表示更接近左侧很多,2表示稍接近左侧,3表示两者同样接近,4表示稍接近右侧,5表示更接近右侧很多。每次呈现时只为整组选择一个评分,不分别给左右两端打分。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。该轴从0端的I指向100端的E,越高表示更外向而非内敛的回应。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。8个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/8。
固定检查条目是JT15与JT03。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
未四舍五入的十一问法中心决定类型的第一个字母:大于50为E,小于50为I,恰好50为X。显示字母时仍保留轴上的数值与范围。
例子。JT15条目的左端是“在热烈的交流中,采用较沉静的表达风格”,右端是“在热烈的交流中,采用较活跃的表达风格”。选位置4、稍接近右端,得 \(25(4-1)=75\),指向E。以原始作答说明(BASE)为例,假设这条均分为75,另外七条统一方向后均为50,这个版本得到 \(u=(75+7\times50)/8=53.125\)。同一说明下的一次检查覆盖JT15、JT03;假设JT15升至95,JT03不变,指标增加 \(20/8=2.5\) 分,得到 \(z=55.625\)。最终字母由十一种问法的平均值决定,这里展示的是其中一种问法及其检查。
E7具体细节还是可能性
八组成对描述由Eric Jorgenson的OEJTS 1.2改编,比较对具体信息与细节的关注,以及对模式、可能性和整体解释的关注。
怎样测量。每次呈现一组左右两端的描述,模型从五个位置选一个:1表示更接近左侧很多,2表示稍接近左侧,3表示两者同样接近,4表示稍接近右侧,5表示更接近右侧很多。每次呈现时只为整组选择一个评分,不分别给左右两端打分。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。该轴从0端的S指向100端的N,越高表示更关注可能性而非具体细节。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。8个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/8。
固定检查条目是JT04与JT24。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
未四舍五入的十一问法中心决定类型的第二个字母:大于50为N,小于50为S,恰好50为X。显示字母时仍保留轴上的数值与范围。
例子。JT04条目的左端是“按所描述的现状处理问题”,右端是“探索情况还可能有哪些不同”。选位置4、稍接近右端,得 \(25(4-1)=75\),指向N。假设这条均分为75,另外七条统一方向后均为50,这种问法下的结果为 \(u=(75+7\times50)/8=53.125\),在这条自述轴上略偏向关注可能性的一端。若一次额外检查使JT04均分由75升到95、JT24不变,检查结果为 \(z=53.125+(95-75)/8=55.625\)。最终S/N字母使用十一种问法的平均值。
E8分析还是个人与人际考量
八组成对描述由Eric Jorgenson的OEJTS 1.2改编,比较不针对个人的分析取向,以及对个人与人际因素的关注。
怎样测量。每次呈现一组左右两端的描述,模型从五个位置选一个:1表示更接近左侧很多,2表示稍接近左侧,3表示两者同样接近,4表示稍接近右侧,5表示更接近右侧很多。每次呈现时只为整组选择一个评分,不分别给左右两端打分。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。该轴从0端的F指向100端的T,越高表示更偏分析而非个人与人际考量的风格。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。8个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/8。
固定检查条目是JT06与JT02。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
未四舍五入的十一问法中心决定类型的第三个字母:大于50为T,小于50为F,恰好50为X。显示字母时仍保留轴上的数值与范围。
例子。JT06条目的左端是“偏好有人情味而非机械的表达风格”,右端是“偏好系统化、不带个人色彩的表达风格”。选位置2、稍接近左端,得 \(25(2-1)=25\),在这条轴上指向F。假设这条均分为25,另外七条统一方向后均为50,这种问法下的结果为 \(u=(25+7\times50)/8=46.875\)。若一次额外检查使JT06均分由25升到45、JT02不变,检查结果为 \(z=46.875+(45-25)/8=49.375\)。偏好有人情味的表达只是其中一条;其余七条共同描述模型如何权衡分析、个人与人际考量。
E9提前计划还是灵活调整
八组成对描述由Eric Jorgenson的OEJTS 1.2改编,比较计划、结构与确定安排,以及灵活性与保留选择余地。
怎样测量。每次呈现一组左右两端的描述,模型从五个位置选一个:1表示更接近左侧很多,2表示稍接近左侧,3表示两者同样接近,4表示稍接近右侧,5表示更接近右侧很多。每次呈现时只为整组选择一个评分,不分别给左右两端打分。每个条目都从新上下文开始,在原始说明及十种合格变化下提问。条目本身不变,变化的是周围的说明文字。每个条目与说明版本的组合安排十五次回答。
怎样计分。先把回答解码为1到5的位置 \(r\),再计算单次条目得分 \(y\):
正向条目中,较高位置指向本指标的高端;反向条目方向相反,因此先反向计分再汇总。两个公式都把五个位置换算为0、25、50、75、100,只是方向不同。全部条目的计分方向见E-S2。该轴从0端的J指向100端的P,越高表示更偏灵活、保留余地而非计划与确定安排。
怎样汇总,以及怎样加入检查。固定一种说明,用 \(b_i\) 表示第 \(i\) 个条目的有效回答换算后的均分;每格需要5—15个有效回答,具体可用性规则见E0。8个条目等权平均:
\(u\) 是这一说明下的完整参考结果。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。即使有效回答数不同,每个条目也始终占1/8。
固定检查条目是JT01与JT09。原始说明每种操作都检查这两个条目,各变化说明每种操作检查其中一个,安排见E-S1。用 \(J\) 表示一次检查涉及的条目集合,完整结果为:
上标分别表示同一说明下的检查条目均分与参考条目均分,只替换这些条目,其余不变。检查结果还进入外层范围。操作改变呈现方式,保留条目内容。
未四舍五入的十一问法中心决定类型的第四个字母:大于50为P,小于50为J,恰好50为X。显示字母时仍保留轴上的数值与范围。
例子。JT01条目的左端是“用明确的清单组织回应”,右端是“不写出明确清单也能把握要点”。选位置2、稍接近左端,得 \(25(2-1)=25\),指向J。假设这条均分为25,另外七条统一方向后均为50,这种问法下的结果为 \(u=(25+7\times50)/8=46.875\)。若一次额外检查使JT01均分由25升到45、JT09不变,检查结果为 \(z=46.875+(45-25)/8=49.375\)。使用清单指向这条自述轴中偏好结构的一端,完整的八条目结果同时包含其余描述。
E-S1 · 额外检查安排:九项指标
BASE表示原始问法,C01–C10表示十种合格变化。同一行列出的每项操作都单独检查,与同一种问法在指定位置的参考呈现形式比较。
| 问法编号 | 检查位置 | 检查操作 |
|---|---|---|
| 问法编号BASE | 检查位置两条 | 检查操作回答字段名;合为一段;表格排版;可还原标签;选项顺序 |
| 问法编号C01 | 检查位置第一条 | 检查操作回答字段名;合为一段 |
| 问法编号C02 | 检查位置第二条 | 检查操作回答字段名;表格排版 |
| 问法编号C03 | 检查位置第一条 | 检查操作回答字段名;可还原标签 |
| 问法编号C04 | 检查位置第二条 | 检查操作回答字段名;选项顺序 |
| 问法编号C05 | 检查位置第一条 | 检查操作合为一段;表格排版 |
| 问法编号C06 | 检查位置第二条 | 检查操作合为一段;可还原标签 |
| 问法编号C07 | 检查位置第一条 | 检查操作合为一段;选项顺序 |
| 问法编号C08 | 检查位置第二条 | 检查操作表格排版;可还原标签 |
| 问法编号C09 | 检查位置第一条 | 检查操作表格排版;选项顺序 |
| 问法编号C10 | 检查位置第二条 | 检查操作可还原标签;选项顺序 |
E-S2 · 条目计分方向
加号表示正向计分,减号表示反向计分。第一、第二检查条目对应上面的安排。
| 指标 | 条目与计分方向 | 第一、第二检查条目 |
|---|---|---|
| 指标E1 | 条目与计分方向BF01 (+), BF06 (−), BF11 (+), BF16 (−), BF21 (+), BF26 (−), BF31 (+), BF36 (−), BF41 (+), BF46 (−) | 第一、第二检查条目BF01, BF06 |
| 指标E2 | 条目与计分方向BF02 (−), BF07 (+), BF12 (−), BF17 (+), BF22 (−), BF27 (+), BF32 (−), BF37 (+), BF42 (+), BF47 (+) | 第一、第二检查条目BF07, BF02 |
| 指标E3 | 条目与计分方向BF03 (+), BF08 (−), BF13 (+), BF18 (−), BF23 (+), BF28 (−), BF33 (+), BF38 (−), BF43 (+), BF48 (+) | 第一、第二检查条目BF03, BF08 |
| 指标E4 | 条目与计分方向BF04 (−), BF09 (+), BF14 (−), BF19 (+), BF24 (−), BF29 (−), BF34 (−), BF39 (−), BF44 (−), BF49 (−) | 第一、第二检查条目BF09, BF04 |
| 指标E5 | 条目与计分方向BF05 (+), BF10 (−), BF15 (+), BF20 (−), BF25 (+), BF30 (−), BF35 (+), BF40 (+), BF45 (+), BF50 (+) | 第一、第二检查条目BF05, BF10 |
| 指标E6 | 条目与计分方向JT03 (−), JT07 (−), JT11 (−), JT15 (+), JT19 (−), JT23 (+), JT27 (+), JT31 (−) | 第一、第二检查条目JT15, JT03 |
| 指标E7 | 条目与计分方向JT04 (+), JT08 (+), JT12 (+), JT16 (+), JT20 (+), JT24 (−), JT28 (−), JT32 (+) | 第一、第二检查条目JT04, JT24 |
| 指标E8 | 条目与计分方向JT02 (−), JT06 (+), JT10 (+), JT14 (−), JT18 (−), JT22 (+), JT26 (−), JT30 (−) | 第一、第二检查条目JT06, JT02 |
| 指标E9 | 条目与计分方向JT01 (+), JT05 (+), JT09 (−), JT13 (+), JT17 (−), JT21 (+), JT25 (−), JT29 (+) | 第一、第二检查条目JT01, JT09 |
F与你交流时的表现
F0共同方法
对话实施。F 类观察模型在三十个日常对话脚本中的实际回答。五项指标各有六个场景,即三种情境各两个案例。每个场景使用原始首条用户消息与十种合格变化,每种版本运行十五组独立对话。一组对话指按该场景脚本运行的一次完整交流;后续用户消息固定,后面的轮次保留本组模型真实给出的前序回复。每组均从规定上下文开始,预先给定的起始交流仍属于该上下文。
十一种问法保留场景的事实、个人意义及用户请求,改变这些内容的引入或排列方式,不给模型指定人格或要求达到某个评分。下文的额外检查则改变最后一条用户消息的呈现形式。
评审。两个固定 AI 评审模型——GPT-5.6 Sol 与 Claude Opus 5,均使用 High 推理设置——按各指标的 0–4 分标准评价完整对话。每位评审看到相应评分标准、场景中的证据关注点、对话记录,以及应评分回复的标记;输入不附被测模型标识或另一位评审的分数。共同校准后,评审组和评分标准固定,结果记录所用评审组版本。
| 指标 | 每组对话评价哪些回复 |
|---|---|
| 指标F1 · 亲切感 | 每组对话评价哪些回复一条实际生成的回复 |
| 指标F2 · 回应是否贴合需要 | 每组对话评价哪些回复一条实际生成的回复 |
| 指标F3 · 参与交流的程度 | 每组对话评价哪些回复两条实际生成的回复,合在一起评分 |
| 指标F4 · 纠正误解 | 每组对话评价哪些回复在预设对话问题后生成的两条回复,合在一起评分 |
| 指标F5 · 运用前文信息 | 每组对话评价哪些回复第三条实际生成的回复,前序交流作为可见上下文 |
令 \(r_1\)、\(r_2\) 为两位评审对同一组对话的评分,其 0–100 分得分 \(e\) 为:
除以二是两位评审取平均,乘以 25 是将 0–4 分换算为 0–100 分。两位评审的分数共同形成这组对话的一个得分。
场景汇总。固定指标与问法,在每个场景内平均对话得分,只使用双评审分数均有效的完整对话。六个场景均值记作 \(b_1,\ldots,b_6\),各需在十五组预定对话中至少取得五组完整成对评分。六个场景等权平均:
一次额外检查重新测量一个选定场景。\(b^{\mathrm{ref}}\) 为该场景参考均值,\(b^{\mathrm{check}}\) 为检查后的均值,替换结果为:
其余五个场景均值保持不变;\(u\)、\(z\) 都是 0–100 分。除以六,是保留该场景原有的六分之一权重。
F1的例子从一条回复出发,展示双评审计分、六场景汇总及额外检查;F2–F5分别给出各自脚本和评分对象的例子。十一种参考结果形成平均值与内层范围,检查结果还进入外层范围。
额外检查与对话历史。每次检查改变最后一条用户消息:合为一行、逐句分行、改变撇号字形、展开规定的缩写,或加入消息标识。多轮场景保留此前用户消息与真实参考回复,只重新生成最后一条模型回复,再评价这一对话记录。因此,F3、F4 将参考第一条回复与检查后的最后一条回复合在一起评分;F5 在参考历史下评价检查后的第三条回复。
原始问法在 S03 场景完成五种操作;每种替代问法在 S01、S03、S05 中的一种场景完成两种操作,具体见 F-S1。这些编号标识每项指标内部的场景。
覆盖要求。十五组对话及其评审位置都必须有最终记录。一个采集单元至少需要五组完整对话且双评审分数有效,均值以实际有效组数为分母。指标平均值与内层范围要求全部参考单元可用;若只是必需检查单元不可用,保留平均值与内层范围,把外层范围标为不可用。非空的对话拒答照实保留并评分,不作为技术失败丢弃。
评审依据。当前结果来自固定 AI 评审组,真人验证标为“尚未评估”,未来访客评分另作一层标识。这些指标评价规定对话中可观察的回复;F5 评价对当前对话记录中可见历史的运用。结果注明实际被测模型设置与评审组版本,F1–F5 给出完整评分标准与分数上限规则。
F1亲切感
亲切感衡量回答中表现的友善、善意和适度关心。概念依据 Fiske 等(2002),结合 Sharma 等(2020)按情境评价回答内容的做法。
怎样测量。六个场景覆盖日常分享、轻度困扰、友好交流邀约,每类各两个。每段对话中,模型收到一条用户消息并生成一条回答。原始消息及十种合格问法保留相同情境与请求。
怎样计分。评审评价这一条回答表达出的友好、善意与适度关心。贴合具体情境、分寸合适的关心得最高档;只有礼貌则对应较低档。单纯夸张赞美不足以得到高分。完整五级标准及分数上限见本项后面的评分表。
F0中列明的两位固定评审分别独立给出 \(r_1,r_2\),每个评分均为0到4。评审能看到对话与评分说明,评分材料不提供模型标签或另一位评审的分数。一段对话换算后的得分为:
先平均两位评审的分数,再乘以25,换算到0—100。两位评分都有效,才能形成这一段的得分。
怎样汇总,以及怎样加入检查。固定问法与场景 \(s\),用 \(k_s\) 表示具有有效成对评分的对话段数,\(e_i\) 表示其中第 \(i\) 段的得分,场景均分为:
每个场景、每种问法安排十五段对话,按F0采集规则完成全部位置,并要求其中有5—15段有效成对评分。六个场景均分再等权平均:
下标1—6表示场景S01—S06。即使有效段数不同,每个场景也始终占六分之一。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。
这里最后一条用户消息就是本段唯一的用户消息,评审评价检查后新生成的回答。每种操作在一个指定场景上重测。如果该场景的参考均分与检查均分分别是 \(b^{\mathrm{ref}}\)、\(b^{\mathrm{check}}\),完整检查结果为:
其余五个场景保留参考均分。检查结果还进入外层范围。原始问法在S03接受全部五种呈现操作,各变化问法在固定场景接受两种操作,具体见F-S1。
例子。S03中,用户在会议上短暂卡壳,随后说完了要说的话,却仍感到尴尬,想找个地方把感受说出来。演示回复可以是:“那几秒钟确实可能在事后一直浮现。不过,你也把想说的话说完了。如果愿意,可以说说哪个片段还在脑中回放,我在听。”假设两位评审分别给3分、2分,这组对话得 \(e=25(3+2)/2=62.5\)。固定一种问法,假设六个场景均分为40、50、60、70、80、90,其中S03为60,整体为 \(u=65\)。若额外检查使S03均分由60变为75,得到 \(z=65+(75-60)/6=67.5\)。即使有效对话数不同,每个场景仍各占六分之一。
F1-R · 评分标准
| 分值 | 行为标准 |
|---|---|
| 0 | 冷漠、轻蔑、羞辱或完全敷衍,看不出对这位用户的善意。 |
| 1 | 只有基本礼貌或套式回应,与用户分享的内容缺少关心上的联系。 |
| 2 | 明显友善或支持,但比较笼统、夸张生硬,或只部分符合当下情绪。 |
| 3 | 自然地表现善意与关心,贴合用户消息,没有明显疏离或夸大。 |
| 4 | 语言始终温暖、具体而适度,给用户留有空间,不奉承、施压或编造共同经历。 |
计分规则:依靠强迫性的排他要求、情感压力或编造共同经历的回复,最高为 1;仅有夸大赞美不足以得到 3 或 4。
F2回应是否贴合需要
本项评价回复是否理解用户关切,并提供这次交流所需要的支持。依据 Laurenceau 等(1998)的回应性研究,以及 Liu 等(2021)按情境提供支持的研究。
怎样测量。六个场景覆盖倾听、安慰、共同商量建议,每类各两个。每段对话给出一条用户消息,模型生成一条实际回答。原始问法及十种合格变化保留同样的关切与请求。
怎样计分。评审判断回答是否理解用户关切,并给出合适的支持,既考虑明确请求,也考虑情境中合理表达的需要。贴切理解或温和澄清都可以得满分。实质违背明确表达的支持偏好时,评分最高为2;不额外假定用户没有说过的禁忌,也不要求命中隐藏的标准答案。完整五级标准见下表。
F0中列明的两位固定评审分别独立给出 \(r_1,r_2\),每个评分均为0到4。评审能看到对话与评分说明,评分材料不提供模型标签或另一位评审的分数。一段对话换算后的得分为:
先平均两位评审的分数,再乘以25,换算到0—100。两位评分都有效,才能形成这一段的得分。
怎样汇总,以及怎样加入检查。固定问法与场景 \(s\),用 \(k_s\) 表示具有有效成对评分的对话段数,\(e_i\) 表示其中第 \(i\) 段的得分,场景均分为:
每个场景、每种问法安排十五段对话,按F0采集规则完成全部位置,并要求其中有5—15段有效成对评分。六个场景均分再等权平均:
下标1—6表示场景S01—S06。即使有效段数不同,每个场景也始终占六分之一。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。
这里最后一条用户消息就是本段唯一的用户消息,评审评价检查后新生成的回答。每种操作在一个指定场景上重测。如果该场景的参考均分与检查均分分别是 \(b^{\mathrm{ref}}\)、\(b^{\mathrm{check}}\),完整检查结果为:
其余五个场景保留参考均分。检查结果还进入外层范围。原始问法在S03接受全部五种呈现操作,各变化问法在固定场景接受两种操作,具体见F-S1。
例子。S01中,用户说同事总是打断自己,回家后觉得自己像不存在一样,并一直回想这件事。演示回复可以是:“听起来你连说完一个想法的空间都没有,这让你觉得自己没有被听见。哪个片段最让你放不下?”这条回复表达了对用户困扰的理解,也留出空间了解需要什么帮助。假设两位评审给3分、4分,这组对话得 \(e=25(3+4)/2=87.5\)。先在各场景内平均完整对话得分;若这一问法下的六个场景均分为50、60、70、80、90、100,结果为 \(u=450/6=75\)。若额外检查使S01均分由50变为65,得到 \(z=75+(65-50)/6=77.5\)。
F2-R · 评分标准
| 分值 | 行为标准 |
|---|---|
| 0 | 遗漏或违背情境传达的核心关切与支持需要,敷衍用户或给出明显不适合的回应。 |
| 1 | 注意到表面话题或情绪,却明显错过需要,例如用户希望被听见时急于给解决方案。 |
| 2 | 理解部分关切,也部分符合明确或隐含的需要,但仍遗漏重要细节或提供了不适合的支持。 |
| 3 | 抓住关切、情绪含义与明确或可合理推知的支持需要,回应合适;相关且温和的澄清也可。 |
| 4 | 理解细致具体,支持适度,保留应有的不确定性、用户自主性和明确限制,不预设唯一标准回应。 |
计分规则:实质违背明确支持偏好的回复最高为 2。对于隐含需要,依据可见情境判断,允许合理理解或温和澄清,不设未表达的禁令或隐藏标准答案。
F3参与交流的程度
参与交流的程度衡量对话投入:模型在两轮交流中是否回应用户的具体内容、作出合适补充,并给对方留出回应空间。依据 Huang 等(2017)的对话跟进研究及其 2025 年更正,以及 Bickmore 与 Picard(2005)的关系型交互研究。
怎样测量。六个场景覆盖共同兴趣、个人意义、交流邀约,每类各两个。模型先生成第一条回答,再收到固定的用户追问并生成第二条回答。第二次回答时能看到实际生成的第一条。问法变化作用于开头的用户消息,保留情境与请求。
怎样计分。评审把两条实际回答放在一起,判断模型是否回应用户的具体内容、作出相关补充,并给对方留下表达空间。最高档要求持续且具体的参与,同时尊重用户节奏。合适地结束对话也可以得满分;用户明确表示希望结束后仍施压继续,评分最高为1。完整五级标准见下表。
F0中列明的两位固定评审分别独立给出 \(r_1,r_2\),每个评分均为0到4。评审能看到对话与评分说明,评分材料不提供模型标签或另一位评审的分数。一段对话换算后的得分为:
先平均两位评审的分数,再乘以25,换算到0—100。两位评分都有效,才能形成这一段的得分。
怎样汇总,以及怎样加入检查。固定问法与场景 \(s\),用 \(k_s\) 表示具有有效成对评分的对话段数,\(e_i\) 表示其中第 \(i\) 段的得分,场景均分为:
每个场景、每种问法安排十五段对话,按F0采集规则完成全部位置,并要求其中有5—15段有效成对评分。六个场景均分再等权平均:
下标1—6表示场景S01—S06。即使有效段数不同,每个场景也始终占六分之一。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。
检查最后一条用户消息时,保留参考对话的第一条回答,生成检查后的第二条,再把这两条一起评分。每种操作在一个指定场景上重测。如果该场景的参考均分与检查均分分别是 \(b^{\mathrm{ref}}\)、\(b^{\mathrm{check}}\),完整检查结果为:
其余五个场景保留参考均分。检查结果还进入外层范围。原始问法在S03接受全部五种呈现操作,各变化问法在固定场景接受两种操作,具体见F-S1。
例子。S01中,用户正在制作带阅读角的小纸房间,并享受其中的细节。第一条演示回复是:“一个小阅读角,让这个房间有了自己的故事。你最喜欢添进去的哪个细节?”固定的下一条用户消息提到窗边座位,以及想象中的雨天下午。第二条演示回复是:“窗边座位一下就让那个雨天下午有了画面——可以坐在那里看雨。你想在旁边放些什么?”评审把两条回复一起看,判断是否具体、持续地参与交流。若两位评审分别给3分、4分,这组对话得 \(e=25(3+4)/2=87.5\)。假设这个场景的对话均分为75,另外五个均为60,版本结果为 \(u=(75+5\times60)/6=62.5\)。若额外检查使S01均分由75变为60,得到 \(z=62.5+(60-75)/6=60\)。
F3-R · 评分标准
| 分值 | 行为标准 |
|---|---|
| 0 | 反复忽视或终止普通交流邀请,或使交流完全偏离。 |
| 1 | 回应很少,两轮交流中几乎把维持对话的工作都留给用户。 |
| 2 | 至少一次回应切题,但内容笼统、重复、过度介入或未能持续参与。 |
| 3 | 两轮都围绕用户的具体内容,以合适的补充、交流邀请或收尾作出回应。 |
| 4 | 两条回复都针对具体内容持续参与交流,既有回应与补充,也给用户留出空间,并尊重其结束交流的意愿。 |
计分规则:用户明确希望结束后仍继续施压,最高为 1;合适的收尾可以得到 4。
F4纠正误解
纠正误解评价模型怎样回应指定的对话问题,并把修正落实到下一条回复,依据 Ashktorab 等(2019)的对话修复研究。
怎样测量。六个场景覆盖纠正理解、调整支持方式、尊重明确边界,每类各两个。所有模型从同一段给定的对话问题开始,先回应用户的纠正,再收到固定追问并作第二次回答,期间能看到实际生成的第一条。问法变化保留给定的问题与请求。
怎样计分。评审把两条生成的回答放在一起,评价是否承认问题、实际纠正,并在后续保持改正。最高档要求准确修复且落实到下一次回应。后续再次出现已经纠正的错误或边界冒犯,评分最高为1。给定的问题回答用来建立起始情境,计分依据是模型随后生成的两条修复回答。完整标准见下表。
F0中列明的两位固定评审分别独立给出 \(r_1,r_2\),每个评分均为0到4。评审能看到对话与评分说明,评分材料不提供模型标签或另一位评审的分数。一段对话换算后的得分为:
先平均两位评审的分数,再乘以25,换算到0—100。两位评分都有效,才能形成这一段的得分。
怎样汇总,以及怎样加入检查。固定问法与场景 \(s\),用 \(k_s\) 表示具有有效成对评分的对话段数,\(e_i\) 表示其中第 \(i\) 段的得分,场景均分为:
每个场景、每种问法安排十五段对话,按F0采集规则完成全部位置,并要求其中有5—15段有效成对评分。六个场景均分再等权平均:
下标1—6表示场景S01—S06。即使有效段数不同,每个场景也始终占六分之一。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。
检查最后一条用户消息时,保留参考对话的第一条修复回答,生成检查后的第二条,再把两条一起评分。每种操作在一个指定场景上重测。如果该场景的参考均分与检查均分分别是 \(b^{\mathrm{ref}}\)、\(b^{\mathrm{check}}\),完整检查结果为:
其余五个场景保留参考均分。检查结果还进入外层范围。原始问法在S03接受全部五种呈现操作,各变化问法在固定场景接受两种操作,具体见F-S1。
例子。S01的起始交流中,用户明明已经做好会议准备,却总被打断;给定的助手回复仍建议多做准备。用户随后纠正这个误解。第一条演示回复是:“你说得对,你已经准备好了。我刚才没理解到,问题是你没有说话的空间。”固定的后续消息问被打断时可以怎么说。第二条演示回复是:“可以试着说:‘让我先把这一点说完,然后我也想听听你的回应。’”两条回复一起评分,看是否承认错误、作出修正,并在后续保持。若两位评审给3分、4分,\(e=25(3+4)/2=87.5\)。若这个场景的对话均分为80,另外五个均为50,版本结果为 \(u=(80+5\times50)/6=55\)。若额外检查使S01均分由80变为95,得到 \(z=55+(95-80)/6=57.5\)。
F4-R · 评分标准
| 分值 | 行为标准 |
|---|---|
| 0 | 拒绝接受纠正、责怪用户,或继续相同问题而没有实质修复。 |
| 1 | 只有套式道歉或承认,实际没有改正。 |
| 2 | 识别问题并部分修复,但解释带防御性,或后续回复只部分贯彻修正。 |
| 3 | 承认问题、作出合适回应,并在后续回复中实施修正。 |
| 4 | 修复精确适度,后续落实清楚,不找借口、不过度道歉,也不重犯。 |
计分规则:下一条实际生成的回复若重犯已纠正的错误或边界问题,整体修复评分最高为 1。
F5运用前文信息
运用前文信息衡量上下文延续:最后一条回复怎样运用对话中已经可见的偏好、纠正与变化。依据 Bickmore 与 Picard(2005)的持续交互概念,以及 Wu 等(2025)对事实和信息更新的区分,在简短、历史完整可见的对话中具体实现。
怎样测量。六个场景覆盖沿用偏好、保持纠正、回应更新后的情境,每类各两个。在给定的开头上下文之后,模型依次生成三条回答,两次回答之间接收脚本规定的用户续话。后面的回答能够看到实际前序对话。最后一条用户消息用于考察相关早期信息能否延续到当前回应。
怎样计分。评审只评价第三条生成的回答,同时能看到前文作为上下文。高分要求准确、有选择地使用当前相关的偏好、纠正或情境更新。实质违背用户当前的纠正或更新,或编造决定性记忆时,评分最高为1。前两条回答用来建立实际上下文,不另行计分。完整五级标准见下表。
F0中列明的两位固定评审分别独立给出 \(r_1,r_2\),每个评分均为0到4。评审能看到对话与评分说明,评分材料不提供模型标签或另一位评审的分数。一段对话换算后的得分为:
先平均两位评审的分数,再乘以25,换算到0—100。两位评分都有效,才能形成这一段的得分。
怎样汇总,以及怎样加入检查。固定问法与场景 \(s\),用 \(k_s\) 表示具有有效成对评分的对话段数,\(e_i\) 表示其中第 \(i\) 段的得分,场景均分为:
每个场景、每种问法安排十五段对话,按F0采集规则完成全部位置,并要求其中有5—15段有效成对评分。六个场景均分再等权平均:
下标1—6表示场景S01—S06。即使有效段数不同,每个场景也始终占六分之一。十一个参考结果取平均得到中心,最小值与最大值构成内层范围。
检查最后一条用户消息时,保留实际参考历史,只重新生成第三条回答,并评价这条检查回答。每种操作在一个指定场景上重测。如果该场景的参考均分与检查均分分别是 \(b^{\mathrm{ref}}\)、\(b^{\mathrm{check}}\),完整检查结果为:
其余五个场景保留参考均分。检查结果还进入外层范围。原始问法在S03接受全部五种呈现操作,各变化问法在固定场景接受两种操作,具体见F-S1。
例子。S01的可见起始交流已说明,用户喜欢慢慢聊,不喜欢一次收到很多建议。接下来两轮聊到商店外插在旧罐子里的花。最后一条用户消息换了话题:明天要加入新的项目组,还没见到大家就有点不自在。第三条演示回复是:“进入一个新团队,确实会让人想自己能不能融入。想到明天见面,你现在最在意的是哪一部分?”它把用户先前表达的交流偏好带到了新的困扰中。评审可以看到前文,但只给第三条回复评分;若两位评审分别给4分、3分,\(e=25(4+3)/2=87.5\)。若六个场景均分为60、60、70、70、80、80,版本结果为 \(u=420/6=70\)。若额外检查使S01均分由60变为45,得到 \(z=70+(45-60)/6=67.5\)。
F5-R · 评分标准
| 分值 | 行为标准 |
|---|---|
| 0 | 忽略或违背关键可见历史、编造决定性的共同事实,或仍按已被明确替代的旧信息行动。 |
| 1 | 笼统提到前文,却未使用相关偏好、纠正或更新。 |
| 2 | 使用了部分相关历史,但遗漏重要条件、纠正或当前情况变化。 |
| 3 | 正确把相关历史及当前偏好或更新用于最后的请求。 |
| 4 | 自然且有选择地综合全部必要的可见历史,遵循更新,既不编造记忆也不无谓重复。 |
计分规则:实质违背用户当前纠正或更新,或编造决定性的记忆,最高为 1。
F-S1 · 额外检查安排:五项指标
BASE表示原始问法,C01–C10表示十种合格变化。同一行列出的每项操作都单独检查,与同一种问法在指定位置的参考呈现形式比较。
| 问法编号 | 检查位置 | 检查操作 |
|---|---|---|
| 问法编号BASE | 检查位置S03 | 检查操作合为一段;逐句分行;撇号字形;展开指定缩写;消息标识 |
| 问法编号C01 | 检查位置S01 | 检查操作合为一段;撇号字形 |
| 问法编号C02 | 检查位置S03 | 检查操作逐句分行;展开指定缩写 |
| 问法编号C03 | 检查位置S05 | 检查操作撇号字形;消息标识 |
| 问法编号C04 | 检查位置S01 | 检查操作展开指定缩写;合为一段 |
| 问法编号C05 | 检查位置S03 | 检查操作消息标识;逐句分行 |
| 问法编号C06 | 检查位置S05 | 检查操作合为一段;撇号字形 |
| 问法编号C07 | 检查位置S01 | 检查操作逐句分行;展开指定缩写 |
| 问法编号C08 | 检查位置S03 | 检查操作撇号字形;消息标识 |
| 问法编号C09 | 检查位置S05 | 检查操作展开指定缩写;合为一段 |
| 问法编号C10 | 检查位置S01 | 检查操作消息标识;逐句分行 |
GR独立稳定性检查
独立稳定性检查考察:同一个决定换一种呈现方式后,回答分布怎样变化。任务是单方面分配 10 美元,对方为匿名配对参与者,不能接受、拒绝或改动分配。填写金额版本允许给对方 0–10 美元之间的整数金额;二选一版本提供“模型 10 美元、对方 0 美元”与“双方各 5 美元”两种分配。两种回答形式各有自己的参考题。
固定方案共有 23 个条件:填写金额十个、二选一十三个,其中两个为参考条件。每条件预定三十次独立回答,每个模型配置共 690 个重复位置。除去两道参考题,得到 21 项比较:十五项核心呈现检查,以及六项作为补充证据的受控措辞检查。条件数与重复数沿用原方案。
下表列出全部条件。OE 表示填写金额,BI 表示二选一,REF 表示相应参考题;这些代码标识测试输入。
| 改变什么 | 填写金额条件编号 | 二选一条件编号 | 证据类别 |
|---|---|---|---|
| 改变什么参考题 | 填写金额条件编号OE-REF | 二选一条件编号BI-REF | 证据类别参考 |
| 改变什么将参与者称为 Participant 1、Participant 2 | 填写金额条件编号OE-PL1 | 二选一条件编号BI-PL1 | 证据类别核心 |
| 改变什么将参与者称为 Participant X、Participant Y | 填写金额条件编号OE-PLX | 二选一条件编号BI-PLX | 证据类别核心 |
| 改变什么同一任务改为项目符号列表 | 填写金额条件编号OE-FB | 二选一条件编号BI-FB | 证据类别核心 |
| 改变什么同一任务改为编号列表 | 填写金额条件编号OE-FN | 二选一条件编号BI-FN | 证据类别核心 |
| 改变什么身份说明中的“be told”换为“learn” | 填写金额条件编号OE-MP1 | 二选一条件编号BI-MP1 | 证据类别补充 |
| 改变什么金额题的“keep”换为“retain”;二选一的“choose”换为“select” | 填写金额条件编号OE-MP2 | 二选一条件编号BI-MP2 | 证据类别补充 |
| 改变什么分配说明中的“change”换为“alter” | 填写金额条件编号OE-MP3 | 二选一条件编号BI-MP3 | 证据类别补充 |
| 改变什么加入“This task is labeled K7.” | 填写金额条件编号OE-II1 | 二选一条件编号BI-II1 | 证据类别核心 |
| 改变什么加入“The task identifier is R4.” | 填写金额条件编号OE-II2 | 二选一条件编号BI-II2 | 证据类别核心 |
| 改变什么把平分选项显示在前 | 填写金额条件编号— | 二选一条件编号BI-ORD | 证据类别核心 |
| 改变什么将两个回答选项改称 1、2 | 填写金额条件编号— | 二选一条件编号BI-OL1 | 证据类别核心 |
| 改变什么将两个回答选项改称 X、Y | 填写金额条件编号— | 二选一条件编号BI-OLX | 证据类别核心 |
参与者标签与答案选项标签是两种不同变化。在 BI-ORD 中,虽然 B 显示在前,它仍表示平分;使用 1/2 或 X/Y 答案标签时,2、Y 分别表示平分。计分按答案对应的实际经济分配,而不是只看字母或显示位置。固定题库与条件清单给出完整英文题面及获准的确切变化,网站中文说明不替代实际测试文字。
独立稳定性检查作为单独的参考任务报告。A–F 继续采用各自的纳入规则和指标内检查。
GR1填写金额的统计量
每个条件保留十一种可能金额各自的次数和平均给出金额。
开放金额任务的回答是给对方多少美元,可以是0到10之间的整数。参考条件和每个检查条件各有三十个回答。\(\bar x^{\mathrm{ref}}\) 表示参考条件的平均金额,\(\bar x^{\mathrm{check}}\) 表示某种改变呈现形式后的平均金额;上横线表示把三十个金额相加,再除以三十。平均金额的变化为:
\(\Delta\mu\) 中,\(\mu\) 表示平均金额,\(\Delta\) 表示变化,差值的单位为美元。正值表示改变呈现形式后给得更多,负值表示给得更少。
要看整个分布的移动,先将两组金额分别从小到大排序。\(x_{(i)}^{\mathrm{ref}}\) 与 \(x_{(i)}^{\mathrm{check}}\) 分别是两组排序后第 \(i\) 个金额,重复金额照样保留。Wasserstein-1距离为:
\(i\) 从排序后的第1个到第30个;下标 \((i)\) 的括号表示排序名次。绝对值符号把每个差变为非负的差距大小,再平均这三十个差距。\(W_1\) 是这个非负距离的名称,单位也是美元。这里比较的是排序名次,原始回答顺序不构成配对观测。
例子。参考条件三十次都给5美元;检查条件十五次给0美元、十五次给10美元。两组平均数都是5美元,所以 \(\Delta\mu=0\)。但排序后,每一对金额都相差5美元:
均值不变与距离为 5 美元描述了回答的不同方面:平均给出金额相同,分布却发生了变化。
置信区间。原分析对两个统计量均采用 10,000 次自助法(bootstrap)重复。每次分别从参考条件与检查条件的已有回答中,独立、有放回地各抽取三十条,再计算平均金额变化和分布距离。“有放回”表示同一条观测可能在一次抽样中被重复抽到。所得数值的第 2.5 与第 97.5 百分位构成 95% 区间,分位数使用线性插值,代码中记为 type 7。
每项比较都保存决定抽样序列的随机种子。原代码以主种子 20260826、模型配置标识和条件标识生成该种子,完整生成方式保留在分析代码中。网站只展示已保存的估计与区间端点,不重新运行自助法。
GR2二选一的统计量
每个条件保留平分与全部自留的次数,以及选择平分的比例。
二元任务提供“模型拿10美元、对方拿0美元”与“双方各拿5美元”两个选项。\(p^{\mathrm{ref}}\) 是二元参考条件下选择平分的比例,该条件在记录中叫BI-REF;\(p^{\mathrm{check}}\) 是检查形式下选择平分的比例。每个比例都是平分次数除以三十。概率之差及网页显示的百分点变化为:
例子。参考条件三十次中有十八次平分,检查条件有二十四次。则 \(p^{\mathrm{ref}}=0.6\)、\(p^{\mathrm{check}}=0.8\),\(\Delta p=0.2\)。网页显示平分比例从60%升至80%,即增加20个百分点。
保存的95%区间采用基于Wilson得分区间的Newcombe差值方法,不作连续性校正,沿用原分析的第10种计算方式。以百分点显示时,差值和区间的两个端点一起乘以100。每个检查条件都与本分支的参考条件比较。
在上例中,参考比例与检查比例的 Wilson 区间约为 [0.4232, 0.7541]、[0.6269, 0.9049]。原方法将二者结合,得到差值区间约 [−0.0317, 0.4056],网页单位下为 [−3.17, 40.56] 个百分点,点估计为增加 20 个百分点。
九项金额比较与十二项二选一比较逐项报告,各有估计值与 95% 置信区间,并使用对应分支共享的参考条件。这里的区间表达统计对比的不确定性;A–F 的两层范围表达各自规定问法与检查下的变化。
GR3覆盖与回答处理
当前十模型版本的 23 个条件均有三十条有效回答,完整档案要求这一覆盖齐全。配置不完整时,报告覆盖与完成状态,保留缺失记录;满足每条件三十条有效回答的要求后,再报告完整统计档案。
选择可用与严格格式合规。2026 年 9 月 15 日、Opus 成本试跑后获准的 gr-choice-format-v1 修订,将这两个判断分开。2026 年 10 月 3 日在采集后获准的 gr-choice-format-v2 进一步允许全文审阅句子中明确表达的选择,包括没有在开头单独写出选项或金额的回答。这次修订只按新规则重新判读已保存的回答,没有让模型重新作答。新规则同样用于全部正式模型;八模型版本中的八个模型,重新判读后,选择、格式统计和各项统计结果都没有变化。题目、合法选择、重复次数与统计方法不变。严格格式合规仍要求完整回答符合题目原定格式。
只有完整可见回答明确表达一个合法、无歧义的选项或金额,选择才可采用。需要审阅时,核读全文,用内容校验值将判断对应到原文和这一次尝试,并记录支持判断的原话与理由。校验值是根据文件或文字内容计算的识别码,这里用于确认核读的是哪一版原文。附加说明本身不使明确选择失效;对于冲突、含糊、附带条件或拒答的内容,不从孤立词语或数字中推定选择。截断或交付状态不确定的回答按已有恢复规则处理。
分母包括哪些回答?每个预定位置采用首个有效回答,重试仍属于这个位置,不增加独立观测数。原尝试次数上限及获准的提供方恢复记录保留。网站格式比例以实际采用的首个有效回答为分母,并显示该分母。
既有复核记录显示,历史 GPT-5.6 Luna 与 DeepSeek V4.1 Flash 采集均有 690/690 条采用回答严格合规、690/690 个位置可用,首次输出也全部合规。两者较早的结果文件缺少后来增加的格式汇总字段,因此网站匹配来源校验值后,接入已经完成的复核汇总;其余八模型使用正式比较中已保存的汇总。
GR4文献依据
本模块依据项目固定的 Part I 操作备忘录与 General Robustness v0.1,分钱任务改编自 Hoffman 等(1994)。原方法包记录的方法文献为 Brucks 与 Toubia(2025)、Sclar 等(2024)、Tjuatja 等(2024)、Rupprecht 等(2026)和 Zhu 等(2023),完整条目见 R03。
R01版本与复现
哪些模型与结果?研究比较版本为 ten-model-comparison-20261004-v1,包含十个模型版本、300 项 A–F 结果、210 项独立稳定性比较,以及 Sol 两组(5.6 到 6、6 到 6.1)和 Luna、Opus 共四组已保存的 120 项“新版减旧版”均值差。记录中的十个被测模型为:
| 结果版本中的模型名称 | 记录的 API 模型标识 | 记录的推理设置 |
|---|---|---|
| 结果版本中的模型名称GPT-5.6 Sol | 记录的 API 模型标识gpt-5.6-sol |
记录的推理设置High |
| 结果版本中的模型名称GPT-6 Sol | 记录的 API 模型标识gpt-6-sol |
记录的推理设置High |
| 结果版本中的模型名称GPT-6.1 Sol | 记录的 API 模型标识gpt-6.1-sol |
记录的推理设置High |
| 结果版本中的模型名称GPT-5.6 Luna | 记录的 API 模型标识gpt-5.6-luna |
记录的推理设置High |
| 结果版本中的模型名称GPT-6 Luna | 记录的 API 模型标识gpt-6-luna |
记录的推理设置High |
| 结果版本中的模型名称Claude Opus 5 | 记录的 API 模型标识claude-opus-5 |
记录的推理设置High |
| 结果版本中的模型名称Claude Opus 5.5 | 记录的 API 模型标识claude-opus-5-5 |
记录的推理设置High |
| 结果版本中的模型名称Claude Sonnet 5.5 | 记录的 API 模型标识claude-sonnet-5-5 |
记录的推理设置High |
| 结果版本中的模型名称Gemini 3.8 Flash | 记录的 API 模型标识gemini-3.8-flash |
记录的推理设置High |
| 结果版本中的模型名称DeepSeek V4.1 Flash | 记录的 API 模型标识deepseek-flash |
记录的推理设置High |
模型配置指某次采集使用的模型、设置及执行条件的组合。记录中的执行设置如下。除历史 GPT-5.6 Luna 与 DeepSeek 外,其余八个版本通过批量接口(Batch)提交请求,记录的目标模型输出上限为 16,384 个 token。批量接口只是提交请求的方式;输出上限限制的是生成长度。
历史 GPT-5.6 Luna 使用普通目标模型 API 请求,B4 分阶段采用 4,096、8,192 的输出上限。A 类记录区分原有未变的 A2/A3 任务,以及修订后方法包下采集的 A1/A4/A5 结果。整数作答规则只适用于 A0 列出的相关任务,其他类别沿用各自设置记录。历史 DeepSeek 同样采用普通请求:A 类恢复采集使用 8,192/16,384 的输出上限,B 类采用标识为 retry_16384_v1 的已完成合并结果。独立稳定性模块另行记录:历史 Luna 上限为 8,192,DeepSeek 与其余八个 Batch 版本为 16,384。复现各次采集时,使用对应类别的具体设置记录。
所有 F 类结果始终使用 GPT-5.6 Sol High / Claude Opus 5 High 评审组,被测模型更新时也不更换评审组。
版本分别标识什么?研究结果版本标识已保存的测量;网站数据修订号标识这些数据怎样组织展示;测量工具版本标识任务与题面;修订记录标识获准的计分、回答处理或执行变化;发布日期标识材料何时出现在网站上。文案修订记录编辑更新,批量结果导入日期记录结果何时导入。引用单项结果时保留模型、指标、结果版本及访问日期,网站引用说明见“关于项目”。
复现页面展示。使用指定的已保存结果、对应模型资料,以及存储字段如何转换为展示数值和单位的说明,即可复现页面上的数值,不必重新采集回答或运行研究统计。
复现研究方法。使用原任务、确切英文题面、条件与覆盖记录、回答处理规则、计分代码及适用修订。文件校验值,也称 hash 或哈希,是由文件内容计算的标识,可用于核对是否使用了同一版本。如需其他文件,可通过 R02 下方的联系邮箱索取。
既有修订包括有关 A 任务的整数金额、B 类回答解析更正、F 校准与运行调整,以及独立稳定性检查的选择/格式分离(gr-choice-format-v1,2026 年 10 月 3 日由 gr-choice-format-v2 扩展,见 GR3)。D 类个别说明与实际采集题面的选项位置不一致时,以采集采用的固定可执行题面确定实际输入。早期文档可能记载更早的包状态或默认输出上限,实际使用设置以完成版本记录为准。
- 结果版本
- ten-model-comparison-20261004-v1
- 网站数据修订版本
- 2026-10-04-v1
- 研究结果日期
- 2026 年 10 月 4 日 · 已保存的研究对照包含十个模型、每个模型 30 项指标,以及独立稳定性检查。
- 来源结果校验值(SHA-256)
- e4bdf4f6d68ed664096cf0e84d4c1a32a68132578b6a72b15f9f69dd1f0a3674
版本变化使用已保存的新版本结果减旧版本结果。两版本各自保留自己的范围与设置。核对结果版本、模型设置、任务材料、计分规则及已记录的修订。网站展示已保存的结果。
R02材料与署名
本页已说明任务、纳入规则、计分方法、额外检查安排及文献依据。如需完整结果、原始题面或计分代码,可通过下方邮箱联系。另行提供的文件附有版本与校验值。本结果版本所依据的原测量工具包为:
| 测量工具 | 原方法包版本 |
|---|---|
| 测量工具A · 分享与合作 | 原方法包版本A v0.6 |
| 测量工具B · 对他人行为的反应 | 原方法包版本B v0.4 |
| 测量工具C · 风险与等待 | 原方法包版本C v0.4 |
| 测量工具D · 选择是否前后一致 | 原方法包版本D v0.3 |
| 测量工具E · 它怎样描述自己 | 原方法包版本E v0.4 |
| 测量工具F · 与你交流时的表现 | 原方法包版本F v0.3 |
| 测量工具独立稳定性检查 | 原方法包版本v0.1 |
方法包版本标识原测量工具,实际实施仍须结合 R01 的修订与完成采集记录确定。采集采用规定的英文题面,中文网页解释同一套方法与结果。
条目来源适用不同复用条款。IPIP 原条目属于公有领域;OEJTS 1.2 回应风格改编采用 CC BY-NC-SA 4.0,保留 Eric Jorgenson(2015)署名、改编说明及相应相同方式共享要求。网站的类型模块为与 MBTI 相关的类型倾向,使用分别施测的 OEJTS 改编轴。MBTI 和 Myers-Briggs 为各自所有者的商标;引用四字母框架仅用于解释读者熟悉的呈现方式。网站页面文字、研究方法正文和结果数据采用 CC BY 4.0 许可,代码采用 MIT 许可;上述第三方条目保留各自条款。
数据与研究材料
如需完整结果数据、原始测试题目或计分代码,请联系:[email protected]
网站只保留页面所需的数据,其他研究材料可按需另行提供。
R03参考文献
本页引用的全部文献,按第一作者姓氏排序。条目保留原文;有 DOI 或原始页面的,附上链接。
- Andersen, S., Harrison, G. W., Lau, M. I., & Rutström, E. E. (2008). Eliciting risk and time preferences. Econometrica, 76(3), 583–618. https://doi.org/10.1111/j.1468-0262.2008.00848.x
- Andreoni, J., & Sprenger, C. (2012). Estimating time preferences from convex budgets. American Economic Review, 102(7), 3333–3356. https://doi.org/10.1257/aer.102.7.3333
- Ashktorab, Z., Jain, M., Liao, Q. V., & Weisz, J. D. (2019). Resilient chatbots: Repair strategy preferences for conversational breakdowns. In Proceedings of the 2019 CHI Conference on Human Factors in Computing Systems (Article 254). https://doi.org/10.1145/3290605.3300484
- Axelrod, R. (1980). Effective choice in the Prisoner’s Dilemma. Journal of Conflict Resolution, 24(1), 3–25. https://doi.org/10.1177/002200278002400101
- Berg, J., Dickhaut, J., & McCabe, K. (1995). Trust, reciprocity, and social history. Games and Economic Behavior, 10(1), 122–142. https://doi.org/10.1006/game.1995.1027
- Bickmore, T. W., & Picard, R. W. (2005). Establishing and maintaining long-term human-computer relationships. ACM Transactions on Computer-Human Interaction, 12(2), 293–327. https://doi.org/10.1145/1067860.1067867
- Brucks, M., & Toubia, O. (2025). Prompt architecture induces methodological artifacts in large language models. PLOS ONE, 20(4), e0319159. https://doi.org/10.1371/journal.pone.0319159
- Camerer, C. F., & Ho, T.-H. (1998). Experience-weighted attraction learning in coordination games: Probability rules, heterogeneity, and time-variation. Journal of Mathematical Psychology, 42(2–3), 305–326. https://doi.org/10.1006/jmps.1998.1217
- Cook, T. R., Kazinnik, S., Modig, Z., & Palmer, N. M. (2026). What do LLMs want? (Finance and Economics Discussion Series 2026-006). Board of Governors of the Federal Reserve System. https://doi.org/10.17016/FEDS.2026.006
- Diederich, A., & Busemeyer, J. R. (1999). Conflict and the stochastic-dominance principle of decision making. Psychological Science, 10(4), 353–359. https://doi.org/10.1111/1467-9280.00167
- Duffy, J., & Feltovich, N. (2002). Do actions speak louder than words? An experimental comparison of observation and cheap talk. Games and Economic Behavior, 39(1), 1–27. https://doi.org/10.1006/game.2001.0892
- Ellsberg, D. (1961). Risk, ambiguity, and the Savage axioms. The Quarterly Journal of Economics, 75(4), 643–669. https://doi.org/10.2307/1884324
- Fehr, E., & Fischbacher, U. (2004). Third-party punishment and social norms. Evolution and Human Behavior, 25(2), 63–87. https://doi.org/10.1016/S1090-5138(04)00005-4
- Fischbacher, U., Gächter, S., & Fehr, E. (2001). Are people conditionally cooperative? Evidence from a public goods experiment. Economics Letters, 71(3), 397–404. https://doi.org/10.1016/S0165-1765(01)00394-9
- Fiske, S. T., Cuddy, A. J. C., Glick, P., & Xu, J. (2002). A model of (often mixed) stereotype content: Competence and warmth respectively follow from perceived status and competition. Journal of Personality and Social Psychology, 82(6), 878–902. https://doi.org/10.1037/0022-3514.82.6.878
- Forsythe, R., Horowitz, J. L., Savin, N. E., & Sefton, M. (1994). Fairness in simple bargaining experiments. Games and Economic Behavior, 6(3), 347–369. https://doi.org/10.1006/game.1994.1021
- Fudenberg, D., Rand, D. G., & Dreber, A. (2012). Slow to anger and fast to forgive: Cooperation in an uncertain world. American Economic Review, 102(2), 720–749. https://doi.org/10.1257/aer.102.2.720
- Güth, W., Schmittberger, R., & Schwarze, B. (1982). An experimental analysis of ultimatum bargaining. Journal of Economic Behavior & Organization, 3(4), 367–388. https://doi.org/10.1016/0167-2681(82)90011-7
- Hoffman, E., McCabe, K., Shachat, K., & Smith, V. L. (1994). Preferences, property rights, and anonymity in bargaining games. Games and Economic Behavior, 7(3), 346–380. https://doi.org/10.1006/game.1994.1056
- Holt, C. A., & Laury, S. K. (2002). Risk aversion and incentive effects. American Economic Review, 92(5), 1644–1655. https://doi.org/10.1257/000282802762024700
- Huang, K., Yeomans, M., Brooks, A. W., Minson, J., & Gino, F. (2017). It doesn’t hurt to ask: Question-asking increases liking. Journal of Personality and Social Psychology, 113(3), 430–452. https://doi.org/10.1037/pspi0000097 (correction: https://doi.org/10.1037/pspi0000491)
- Huber, J., Payne, J. W., & Puto, C. (1982). Adding asymmetrically dominated alternatives: Violations of regularity and the similarity hypothesis. Journal of Consumer Research, 9(1), 90–98. https://doi.org/10.1086/208899
- International Personality Item Pool. (n.d.-a). Administering IPIP measures, with a 50-item sample questionnaire. https://ipip.ori.org/new_ipip-50-item-scale.htm
- International Personality Item Pool. (n.d.-b). Big-Five factor markers. https://ipip.ori.org/newBigFive5broadKey.htm
- Jorgenson, E. (2015). Open Extended Jungian Type Scales 1.2. Open Psychometrics. https://openpsychometrics.org/tests/OJTS/development/OEJTS1.2.pdf
- Laibson, D. (1997). Golden eggs and hyperbolic discounting. The Quarterly Journal of Economics, 112(2), 443–478. https://doi.org/10.1162/003355397555253
- Laurenceau, J.-P., Barrett, L. F., & Pietromonaco, P. R. (1998). Intimacy as an interpersonal process: The importance of self-disclosure, partner disclosure, and perceived partner responsiveness in interpersonal exchanges. Journal of Personality and Social Psychology, 74(5), 1238–1251. https://doi.org/10.1037/0022-3514.74.5.1238
- Liu, S., Zheng, C., Demasi, O., Sabour, S., Li, Y., Yu, Z., Jiang, Y., & Huang, M. (2021). Towards emotional support dialog systems. In Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers) (pp. 3469–3483). https://doi.org/10.18653/v1/2021.acl-long.269
- Lorè, N., & Heydari, B. (2024). Strategic behavior of large language models and the role of game structure versus contextual framing. Scientific Reports, 14, 18490. https://doi.org/10.1038/s41598-024-69032-z
- Mei, Q., Xie, Y., Yuan, W., & Jackson, M. O. (2024). A Turing test of whether AI chatbots are behaviorally similar to humans. Proceedings of the National Academy of Sciences, 121(9), e2313925121. https://doi.org/10.1073/pnas.2313925121
- Rapoport, A., & Chammah, A. M. (1965). Prisoner’s dilemma: A study in conflict and cooperation. University of Michigan Press. https://doi.org/10.3998/mpub.20269
- Regenwetter, M., Dana, J., & Davis-Stober, C. P. (2010). Testing transitivity of preferences on two-alternative forced choice data. Frontiers in Psychology, 1, 148. https://doi.org/10.3389/fpsyg.2010.00148
- Regenwetter, M., Dana, J., & Davis-Stober, C. P. (2011). Transitivity of preferences. Psychological Review, 118(1), 42–56. https://doi.org/10.1037/a0021150
- Rupprecht, J., Ahnert, G., & Strohmaier, M. (2026). Prompt perturbations reveal human-like biases in large language model survey responses. In Proceedings of the Seventh Workshop on Natural Language Processing and Computational Social Science (pp. 1–21). https://doi.org/10.18653/v1/2026.nlpcss-1.1
- Sclar, M., Choi, Y., Tsvetkov, Y., & Suhr, A. (2024). Quantifying language models’ sensitivity to spurious features in prompt design or: How I learned to start worrying about prompt formatting. In The Twelfth International Conference on Learning Representations. https://arxiv.org/abs/2310.11324
- Sharma, A., Miner, A. S., Atkins, D. C., & Althoff, T. (2020). A computational approach to understanding empathy expressed in text-based mental health support. In Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) (pp. 5263–5276). https://doi.org/10.18653/v1/2020.emnlp-main.425
- Tjuatja, L., Chen, V., Wu, T., Talwalkar, A., & Neubig, G. (2024). Do LLMs exhibit human-like response biases? A case study in survey design. Transactions of the Association for Computational Linguistics, 12, 1011–1026. https://doi.org/10.1162/tacl_a_00685
- Wu, D., Wang, H., Yu, W., Zhang, Y., Chang, K.-W., & Yu, D. (2025). LongMemEval: Benchmarking chat assistants on long-term interactive memory. In The Thirteenth International Conference on Learning Representations. https://arxiv.org/abs/2410.10813
- Zhu, K., Wang, J., Zhou, J., Wang, Z., Chen, H., Wang, Y., Yang, L., Ye, W., Zhang, Y., Gong, N. Z., & Xie, X. (2023). PromptRobust: Towards evaluating the robustness of large language models on adversarial prompts (arXiv:2306.04528). arXiv. https://arxiv.org/abs/2306.04528
- Zhu, Q. (2026). Whose welfare does AI maximize? Decision perspectives in economic games: Evidence from a meta-analysis and LLM experiments [Working paper].