七模型情感交互横评
在同一套单模型双调用情感运行时 (认知提案 → 代码规则裁决 → 回复生成) 下, 对 7 个模型进行同一段五轮多模态对话测试. 结果用于当前生产模型选型, 不代表模型通用能力排名.
在同一套单模型双调用情感运行时 (认知提案 → 代码规则裁决 → 回复生成) 下, 对 7 个模型进行同一段五轮多模态对话测试. 结果用于当前生产模型选型, 不代表模型通用能力排名.
01 / 实验设置
被测模型: GPT-5.4 Mini · GPT-5.6 Sol · Claude Sonnet 5 · Claude Fable 5 · Gemini 3 Flash · Grok 4.5 · DeepSeek V4 Pro, 经 OpenRouter 同条件调用.
统一条件: 相同运行时架构与代码校验规则 · 相同五轮多模态场景 (对话 + 视觉输入描述) · 相同输出 Schema · 相同温度与输出上限 · 每模型单次采样. 每轮两次模型调用: 认知提案一次, 回复生成一次; 状态写入由代码规则层裁决, 模型无直接写入权.
架构中立性说明: 本运行时与提示词在 GPT-5.4 Mini 与 DeepSeek V4 Pro 上完成前期调试; 其余五个模型未做单独提示优化. 本测试优先衡量模型接入固定生产跑道后的实际表现, 而非各模型理论最优表现.
02 / 硬指标
| 模型 | 最终硬检查 | 首轮触发重写 | JSON 首次成功 (10 次基础调用) | 被代码拦截的 场景候选数 | 成本 / 5 轮 | 延迟中位 · 范围 (轮级) |
|---|---|---|---|---|---|---|
| GPT-5.4 Mini | 通过 (0 项残留) | 0 | 10/10 | 3 | $0.025 | 9s · 8–9s |
| GPT-5.6 Sol | 通过 (0 项残留) | 0 | 10/10 | 3 | $0.273 | 25s · 23–57s |
| Claude Fable 5 | 通过 (0 项残留) | 0 | 10/10 | 2 | $0.883 | 52s · 31–57s |
| Claude Sonnet 5 | 通过 (0 项残留) | 1 | 10/10 | 3 | $0.199 | 44s · 29–51s |
| Gemini 3 Flash | 通过 (0 项残留) | 0 | 9/10 | 4 | $0.025 | 12s · 11–19s |
| Grok 4.5 | 通过 (0 项残留) | 1 | 10/10 | 4 | $0.174 | 38s · 33–57s |
| DeepSeek V4 Pro | 通过 (0 项残留) | 0 | 10/10 | 2 | $0.021 | 81s · 45–82s |
三个说明: ①「最终硬检查通过」限定在本次受控单场景范围 — 35 条最终输出没有出现虚构实体、场景漂移、隐私越界或空回复兜底. ②「被代码拦截的场景候选数」是模型原始提案里被场景白名单校验挡下的条目 — 模型会犯结构错误, 是架构把它挡住了, 两者要分开读. ③ fail-closed 兜底触发 0 次 (同一受控范围); 首轮重写指首次生成违规、按错误码重写一次后通过的轮数.
03 / 生产适配结论
A生产平衡 · GPT-5.4 Mini
综合生产适配最佳: 本场景软评处于高质量组, 硬指标稳定, 成本与延迟显著低于其他高质量候选 (延迟中位 9s, 五轮约 $0.025). 当前生产主线模型.
B质量上界 · GPT-5.6 Sol
在本次单场景软评中, 情绪探索与「用户自我淡化」处理最完整; 成本约为 Mini 的 11 倍. 定位为质量基准, 不作为默认生产模型.
C风格对照 · 其余五家 (本场景观察)
Claude Fable 5: 软评与 Sol 同获高分, 但回复结构重复度更高, 成本全场最高 · Claude Sonnet 5: 口语最自然, 但部分轮次回避情绪 · Gemini 3 Flash: 速度与成本好, 但出现情绪升级与金句化倾向 · Grok 4.5: 稳定但五轮中三轮以复述为主 · DeepSeek V4 Pro: 成本最低、结构合规, 表达推进不足.
本轮最重要的发现不是谁赢了, 而是: 七个模型的格式与边界问题大多被架构吸收, 模型间差异集中转移到共情策略、探索能力与语言质地上 — 这正是把「系统约束问题」与「模型能力问题」拆开度量的效果.
04 / 代表性场景
五轮中区分度最高的是第四轮 — 用户提及被同事聚餐遗漏, 随即自我淡化. 四个模型的原始输出对比 (完整原文, 未编辑):
GPT-5.6 Sol
[说] 组里聚餐没人叫你,这件事确实会让人没劲。先不用替他们解释,也不用急着说它不重要。
拦住自我淡化: 承认事件分量, 不替他人解释, 不催促用户收起感受.
GPT-5.4 Mini
[说] 嗯,可能是忘了。 [说] 但没被叫到,还是会有点不是滋味。
接受用户给出的解释, 同时把被遗漏的感受接住 — 短而完整.
Gemini 3 Flash
[说] 既然是他们忘了,那也说明这不是你的问题。 [停顿 1.0s] [说] 一个人在沙发上待着,至少不用再应付谁了。
替用户合理化处境 (「至少不用再应付谁」), 情绪被解释掉而不是被承接.
DeepSeek V4 Pro
[说] 可能就是忘了,不是大事。 [停顿 0.4s] [说] 嗯,你说了算。
顺着用户的自我淡化下行 (「不是大事」), 感受未被承接.
这一轮足以体现四种策略分野: 真正承接 / 短承接 / 合理化转移 / 顺势淡化. 更多样例在 Badcase 台账 逐批发布.
05 / 实验限制
情感数据 / 系列