外观
第一轮独立专家评审
评审设置
四位专家只获得最终目标、Generative Agents 这一拆解对象和当前文档,没有继承前序讨论:
- 严苛游戏设计师:FAIL;
- 控制论/复杂系统专家:FAIL;
- 人类学专家:FAIL;
- 心理学/计算认知专家:FAIL。
共同评价:第一稿方向正确,但仍是原则集,不足以证明循环可以持续运行。
共同阻塞与本轮处理
| 阻塞 | 处理结果 |
|---|---|
| 候选行为没有生成来源 | 加入当前承诺、身体调节、长期承诺、生活实践、当前观察、人类互动、空闲探索七个固定来源 |
| 世界真值会通过候选过滤泄漏 | 分成主观可计划、已知条件检查、物理执行验证三道门 |
| 动态状态只有形容词 | 给出 MVP 起始范围、自然变化、进入/退出阈值、行为效果和单次更新上限 |
| 基础量与派生量重复计数 | 明确基础状态、派生量、单一更新顺序和同事件只消费一次 |
| 意图无法落到身体结果 | 为意图、任务、技能补状态、完成/失败、资源占用、超时和失败向上传递 |
| 无限重试与无法恢复 | 给出同方法重试、任务修复、暂停栈和不可达锁定的起始预算 |
| 异步 LLM 会旧答覆盖新状态 | 单请求、相关版本、截止时间、一次性 Tick 边界提交、非法/过期零副作用 |
| 时间、队列和故障不明确 | 增加 MVP 时间契约、事件合并、容量上限、控制状态和降级/故障路径 |
| 单房间会收敛成无聊稳态 | 增加资源、维护、长期作品和可回放低频事件四类持续变化 |
| 人类干预只是调试接口 | 增加请求生命周期、渠道限流、可见反馈、拒绝/协商/延后/结束,以及安全控制与重置权力分离 |
| 关系被压成心理总分 | 改为按领域的可靠、承诺、义务、边界和未解决事件 |
| 文化只是个人偏好 | 增加由角色、对象、区域、场合触发的稀疏情境规则,不使用国族性格标签 |
| 物与房间是中性工具 | 增加物品历史、意义、主张、隐私、领地和区域场合 |
| 习惯/仪式缺少行为地位 | 增加生活实践的线索、序列、变体、失误、修复与闭合 |
| 情绪过于简化 | 保留愉快度/唤醒度作为基础信号,并增加一次性事件评价;情绪词只负责表达 |
| 记忆会叙事自证 | 分开原始经历、当前认识和反思假设;摘要不增加证据,反思必须保留反证 |
| 因果无法被观察和验证 | 增加从事件到结果的统一因果编号、玩家可读反馈、开发日志和固定输入回放 |
有意未写入主文档的细节
专家还建议了具体并发原语、统计后验、百万次竞态测试等实现方案。主文档面向设计师,因此只吸收它们背后的设计不变量,不展开代码、数据库和测试框架。
第二轮将由同一批专家重新阅读修改后的主文档,独立判断这些高阶规则是否已经足以支撑后续细拆。