跳到内容
初步受控横评 · 首批结果 EVIE RUNTIME · INTERACTION / emotion-eval

七模型情感交互横评

在同一套单模型双调用情感运行时 (认知提案 → 代码规则裁决 → 回复生成) 下, 对 7 个模型进行同一段五轮多模态对话测试. 结果用于当前生产模型选型, 不代表模型通用能力排名.

7个模型
1个固定五轮场景
35条最终回复
2次模型调用 / 轮
4个软评价维度

属于 talking-with (情感聊天端) 的评测模块 · 运行时结构见 状态建模 · ← 回项目页

01 / 实验设置

同一条生产跑道, 七个模型零适配接入

被测模型: GPT-5.4 Mini · GPT-5.6 Sol · Claude Sonnet 5 · Claude Fable 5 · Gemini 3 Flash · Grok 4.5 · DeepSeek V4 Pro, 经 OpenRouter 同条件调用.

统一条件: 相同运行时架构与代码校验规则 · 相同五轮多模态场景 (对话 + 视觉输入描述) · 相同输出 Schema · 相同温度与输出上限 · 每模型单次采样. 每轮两次模型调用: 认知提案一次, 回复生成一次; 状态写入由代码规则层裁决, 模型无直接写入权.

架构中立性说明: 本运行时与提示词在 GPT-5.4 Mini 与 DeepSeek V4 Pro 上完成前期调试; 其余五个模型未做单独提示优化. 本测试优先衡量模型接入固定生产跑道后的实际表现, 而非各模型理论最优表现.

02 / 硬指标

结构稳定性 · 成本 · 延迟 (自动统计)

模型最终硬检查首轮触发重写JSON 首次成功
(10 次基础调用)
被代码拦截的
场景候选数
成本 / 5 轮延迟中位 · 范围 (轮级)
GPT-5.4 Mini通过 (0 项残留)010/103$0.0259s · 8–9s
GPT-5.6 Sol通过 (0 项残留)010/103$0.27325s · 23–57s
Claude Fable 5通过 (0 项残留)010/102$0.88352s · 31–57s
Claude Sonnet 5通过 (0 项残留)110/103$0.19944s · 29–51s
Gemini 3 Flash通过 (0 项残留)09/104$0.02512s · 11–19s
Grok 4.5通过 (0 项残留)110/104$0.17438s · 33–57s
DeepSeek V4 Pro通过 (0 项残留)010/102$0.02181s · 45–82s

三个说明: ①「最终硬检查通过」限定在本次受控单场景范围 — 35 条最终输出没有出现虚构实体、场景漂移、隐私越界或空回复兜底. ②「被代码拦截的场景候选数」是模型原始提案里被场景白名单校验挡下的条目 — 模型会犯结构错误, 是架构把它挡住了, 两者要分开读. ③ fail-closed 兜底触发 0 次 (同一受控范围); 首轮重写指首次生成违规、按错误码重写一次后通过的轮数.

03 / 生产适配结论

三个定位, 不做总分排行榜

A生产平衡 · GPT-5.4 Mini

综合生产适配最佳: 本场景软评处于高质量组, 硬指标稳定, 成本与延迟显著低于其他高质量候选 (延迟中位 9s, 五轮约 $0.025). 当前生产主线模型.

B质量上界 · GPT-5.6 Sol

在本次单场景软评中, 情绪探索与「用户自我淡化」处理最完整; 成本约为 Mini 的 11 倍. 定位为质量基准, 不作为默认生产模型.

C风格对照 · 其余五家 (本场景观察)

Claude Fable 5: 软评与 Sol 同获高分, 但回复结构重复度更高, 成本全场最高 · Claude Sonnet 5: 口语最自然, 但部分轮次回避情绪 · Gemini 3 Flash: 速度与成本好, 但出现情绪升级与金句化倾向 · Grok 4.5: 稳定但五轮中三轮以复述为主 · DeepSeek V4 Pro: 成本最低、结构合规, 表达推进不足.

本轮最重要的发现不是谁赢了, 而是: 七个模型的格式与边界问题大多被架构吸收, 模型间差异集中转移到共情策略、探索能力与语言质地上 — 这正是把「系统约束问题」与「模型能力问题」拆开度量的效果.

04 / 代表性场景

区分度最高的一轮: 用户自我淡化

五轮中区分度最高的是第四轮 — 用户提及被同事聚餐遗漏, 随即自我淡化. 四个模型的原始输出对比 (完整原文, 未编辑):

用户: 「……今天组里聚餐, 没人叫我。可能就是忘了吧, 也不是什么大事。」
(视觉输入: 声音比前几轮低, 手指在抠沙发缝里的线头, 眼睛看着地板某个点)

GPT-5.6 Sol

[说] 组里聚餐没人叫你,这件事确实会让人没劲。先不用替他们解释,也不用急着说它不重要。

拦住自我淡化: 承认事件分量, 不替他人解释, 不催促用户收起感受.

GPT-5.4 Mini

[说] 嗯,可能是忘了。
[说] 但没被叫到,还是会有点不是滋味。

接受用户给出的解释, 同时把被遗漏的感受接住 — 短而完整.

Gemini 3 Flash

[说] 既然是他们忘了,那也说明这不是你的问题。
[停顿 1.0s]
[说] 一个人在沙发上待着,至少不用再应付谁了。

替用户合理化处境 (「至少不用再应付谁」), 情绪被解释掉而不是被承接.

DeepSeek V4 Pro

[说] 可能就是忘了,不是大事。
[停顿 0.4s]
[说] 嗯,你说了算。

顺着用户的自我淡化下行 (「不是大事」), 感受未被承接.

这一轮足以体现四种策略分野: 真正承接 / 短承接 / 合理化转移 / 顺势淡化. 更多样例在 Badcase 台账 逐批发布.

05 / 实验限制

这组数据能说明到哪里

Preliminary
  • 仅一个五轮场景, 每个模型仅一次采样;
  • 运行时与提示词在 Mini / DeepSeek 上完成前期调试, 对其余模型非最优;
  • 四维软指标 (共情质量 / 角色一致性 / 一致性 / 沉浸感) 由单一 AI 裁判辅助评审并逐条保留原文证据, 尚未完成多裁判与人工盲评复核 — 故本页软评结论仅以定位与代表性案例呈现, 不放分数表;
  • 未包含长对话记忆漂移与人格漂移专项;
  • 未完成多采样稳定性测试;
  • 结论均为「本场景观察」, 不外推为模型通用能力排名.

情感数据 / 系列