外观
第一轮专家审阅:冻结版 v0.1
审阅对象:第一版
README、00—04及reviews/README
审阅方式:四位独立审阅者只获得最终目标、拆解对象和文档目录;只读,不获得研究过程
结果:四位均为BLOCKED
四位裁决
| 视角 | 裁决 | 一句话原因 |
|---|---|---|
| 严苛游戏设计师 | BLOCKED | 是正确的架构地图,但尚无可玩的核心循环、可读反馈、活性保证与量化验收 |
| 控制论 / 动态系统 | BLOCKED | 不变量仍是愿望;缺安全监督器、时限、资源所有权、仲裁状态机和有界学习 |
| 人类学 | BLOCKED | 已知道文化风险,却没有把角色义务、合法权威、物权、社会行为意义写入运行循环 |
| 心理学 | BLOCKED | 心理概念布线合理,但重复计分、归因、预期学习、信任、注意、习惯与反证没有状态转移规范 |
四方共同确认的优点
- 世界事实、身体事实、Agent 认识和语言解释分开;
- Tests、Utility、Queue、身体执行各自回答不同问题;
- 选择、入队、开始和完成没有混为一谈;
- 只有真实 Outcome 可以确认发生;
- 人类干预初步按来源分流;
- LLM 不得控制 Tick、身体、世界真值或自证成功;
- 对刚性马斯洛、离散情绪普遍论和文化本质主义已有明确警觉。
四位共同判断:这些边界值得保留,问题不在研究方向,而在尚未把边界写成会实际改变状态与轨迹的设计契约。
合并后的阻断问题
为避免同一问题被四种术语重复修四次,以下按运行链合并。
R1 · 没有核心玩家体验闭环
现有五种干预更像调试权限。缺少玩家为何观察、为何不总用直控、一次干预会获得或破坏什么,以及 Agent 如何用简短可见信号传达意图、来源、不确定、拒绝和失败。
R2 · Safety 不是独立监督器,Needs 也没有运行合同
Safety / Comfort 合并会让舒适抵消危险;Nourishment、Connection、Stimulation 也混合了不可互相抵消的来源。缺舒适带、进入/退出阈值、迟滞、响应时限、待实现收益、资源耗尽和不可控退化。
R3 · 感知边界会被世界真值 Tests 偷偷绕过
决策若直接用“目标已损坏/不存在/被锁”的世界事实淘汰候选,Agent 的行为会泄露视野外知识。必须分开“基于认识的候选检查”和“执行前的权威检查”,后者只返回感官可获得的失败证据。
R4 · Queue、Interaction 和对象交接没有活性与事务保证
缺最大等待、单一资源所有者、清理预算、不可逆提交点、部分 Outcome、幂等、对象版本、原子交接和系统编辑屏障。多任务在 v0 没有内容必要性,却扩大了死锁空间。
R5 · 人类共享控制没有唯一控制权和责任归属
需区分房间内人类、玩家/操作者和研究者/系统。自然语言命令仍是社会请求,不自动升级为直控。外部强制可以改变世界,但不能伪装成 Agent 同意或用作人格证据。
R6 · 承诺没有生命周期、提醒线索和跨意图失败预算
缺接受前可行性、容量、期限、暂停、阻塞、重议、违约、完成去活和恢复线索。只把重试次数挂在 Interaction 或当前意图上,会被重新规划重置而无穷重试。
R7 · Utility 缺分层仲裁、滞回和预期学习
生存、安全、承诺、习惯、角色义务、普通偏好和随机选择不能无区别相加。预期与实际虽已分开,却没有按 Interaction × Object × Context 更新成功概率、效果和成本。
R8 · 心理状态重复计分且缺归因
同一履约事件可能同时提高 Connection、Relatedness、Trust、Valence、关系与承诺权重,再多次进入 Utility。需要唯一 Event Reducer 和因果依赖图。Appraisal 不能只有一个标签,必须保留预期性、可控性、候选原因、责任置信度和规范关系。
R9 · Trust、关系与身份过度压缩
需至少分开领域化信息可靠性、承诺兑现、善意/安全预期和关系温暖;关系还要容纳依赖、权威范围、角色义务和未清互惠。Trait、Preference、Value、Skill、自我效能、胜任体验和 Habit 不能混写。
R10 · 文化只在输出端,缺情境化社会脚本
需引入轻量 RelationalContext、SituatedScript、ObjectSocialState 与 SocialActFrame。规范不能与物理不可能一起硬删除;应允许询问许可、援引例外、协商或承担违规后果。物理 Outcome 与社会意义是否被共同承认必须分开。
R11 · 记忆与 LLM 摘要会制造伪因果
需不可变事件 ID、来源分类、当前信念、因果假设、支持/反证、容量、TTL、幂等压缩和身份保护。LLM 只能引用证据生成假设或表达,不能直接写 Trust、Trait 或事实。
R12 · 注意、负荷、冲动和 Habit 未进入行为
需有限感知缓冲、显著性队列、Interaction 注意占用、漏检/延迟与任务恢复线索;冲动只能竞争注意或普通动作,不能越过 Tests。稳定情境中的成功行为可形成 Habit 快速路径,Cooldown 不应把所有日常惯例一并消灭。
R13 · 内容与验收不足以证明“会思考”或长期稳定
三项杯子任务只能验证机械链。至少需要一个跨日改变未来 Affordance 的项目、一个安全冲突、一个被兑现/违背的社会承诺和一组真假陈述。所有测试需固定种子、事件重放、候选分解与可判定阈值。
R14 · v0 范围仍过大
v0 应先锁定一个活动身体 Interaction、一只抽象手、离散 2D 路径、被动感知流和显式任务图。通用 GOAP、左右手并发和任意多任务必须由无法用简化结构通过的场景来证明必要性。
修改决策
| 决策 | 处置 |
|---|---|
| 接受 R1—R14 | 全部接受,不以“文档偏高阶”为由回避 |
| 保持用户要求的简单目录 | 仍以参数、循环、行为三章为主体;关键合同分别回写三章 |
| 新增一份验证矩阵 | 增加 05-validation.md,把不变量、场景、阈值和机制覆盖集中在一页体系内 |
| Safety | 从 Need 中拆出,成为硬监督模式 |
| v0 多任务 | 移除通用并发;只保留一个身体 Interaction,原作多任务继续作为研究结论 |
| 文化 | 不做“文化 Trait”;只做少量、可追溯、可争议的情境脚本 |
| 心理理论 | 给项目机制统一标注:研究支持约束 / 理论启发 / 游戏实现假设 / 待实验调参 |
| LLM | 所有输出带状态版本、TTL、证据 ID;不可用时确定性降级 |
第二轮复核门槛
四位专家复核时,不以“是否增加了相应词语”为准,而检查:
- 每个 R1—R14 是否映射到具体状态、转换或测试;
- 失稳轨迹是否被明确终止;
- 配对反事实是否会改变候选、Appraisal、Outcome 或责任记录;
- v0 是否真的删掉无内容证明的复杂度;
- 验收是否能重复判定,而非挑一段漂亮录像。