跳到内容
building EVIE RUNTIME · COGNITION (核心) / evie-agent

evie-agent · 虚拟人的状态机

MLLM router + persona + 跨模态 dispatch — agent state machine for cross-modal orchestration.

在体系里属于 Evie Runtime 主体 · Cognition 核心 (Runtime 的中枢) · 上游接 Development Infrastructure (Claude Code skills) 仅作开发期辅助 + Offline Model Adaptation (LoRA / 音色资产) + Perception (presence 事件) · 下游被 Interaction 子模块 (PWA 调它) 与 Embodiment 子模块 (face / voice 受它驱动) 引用 (见 架构图) · 最近验证: 2026-06

01 / 在系统里的位置

为什么这一层需要它

Evie Runtime 的主体. 把 Offline Model Adaptation 产出的视觉身份与声音资产接入 Runtime, 并通过 persona state、emotion state、relationship state 与 user memory 维护连贯人格和跨模态调度. 是状态机, 不是单次问答接口.

记忆边界划清: Development Infrastructure (vault / Claude Code skills) 仅作为我开发 Evie 时的工具与工程文档, 不进入 Evie Runtime 的用户态记忆. Evie Runtime 单独维护 persona state、emotion state、relationship state 与 user memory 四类运行时状态, 避免开发知识库、工程文档与用户关系记忆混用. 下游的 Interaction 层 (PWA) 把它的对话面呈现给用户, Embodiment 层 (ue-realtime) 把它的情绪状态翻译成可见的身体.

因此这一层最重要的任务不是 "回答得好不好", 而是 "在长时间跨工具的存在里, persona 是否稳定, 决策是否一致, 多模态是否被正确编排".

02 / 想解决什么

vision-aligned 问题陈述

虚拟人不是 "一次性 prompt". 主流 chatbot 范式是 stateless: 每次对话从零拼上下文, 人格靠 system prompt 强行维持, 跨工具就断. 这套范式对"持久数字生命"的愿景是根本错位的.

evie-agent 想解决的是: 把多个 MLLM 当成 tool 来编排, 而不是把 MLLM 当成 chatbot. agent 自己持有 persona schema + emotion state + 跨日记忆, 然后按场景把请求 dispatch 给最合适的供应商 (对话给 LLM A, 生图给 SDXL pipeline, 表情给 emotion model, 语音给 TTS). persona 必须跨对话稳定, emotion → expression 必须可控.

如果这一层缺位, 虚拟人愿景会卡在"看上去像一个人, 但每次见都像新认识"——这正是当前所有 character AI 产品的死结.

03 / 现状 + 已知 limit

现在做到哪了

整体在 building 阶段. 骨架已经成型, 但"持续在场"和"情绪映射"两条主线还在探索, 距离一个真正自驱的 agent 还有一段路.

A已落地

persona schema (character card v3) 跑通; MLLM router 多供应商可切; dispatch.py 多 ckpt 场景化生图 pipeline 跑通; chat-image 多 pipeline 路由 (pony / ill / majic / realism / zit 自动选).

B探索中

emotion model (当前还是 mock, 未上 MLLM 推理); persona consistency 在跨长对话的稳定性验证.

C待解决

stateless invocation → 真正"持续在场" (需要一层常驻进程作底, 暂未起); emotion → UE face mapping (依赖 ue-realtime 的 blend shape 通道接通).

04 / 下一里程碑

接下来推什么

01

起一层常驻进程作底, 让 agent 从 "被调起才存在" 切到 "持续在场".

02

emotion model 上 MLLM — 用 Claude Opus 跑情绪推理, 替掉当前 mock.

03

persona 跨 7-day 长对话一致性测试 — 检验 persona state + relationship state 是否真能稳定人格 (不依赖开发期 vault).

04

把 emotion state 接到 ue-realtime 的 blend shape 通道 — 跨层链路第一次合拢.

05

router 的供应商 fallback / cost 策略 — 让 dispatch 在生产里足够稳.

体系 / 模块