外观
03. 行为与不同颗粒度
本章回答什么
Agent 的想法必须逐层落到房间能够验证的身体结果。
text
为什么做
→ 这一阶段想得到什么
→ 接下来完成哪些任务
→ 身体现在执行哪个技能
→ 世界返回了什么结果1
2
3
4
5
2
3
4
5
一、四种行为颗粒度
| 层级 | 时间范围 | 回答的问题 | 示例 |
|---|---|---|---|
| 长期方向 | 数天或更久 | 想持续追求、照护或维持什么 | 维持一个适合创作的生活 |
| 阶段意图 | 数十分钟到数小时 | 当前承诺得到什么结果 | 完成一幅小画 |
| 任务 | 数分钟 | 当前阶段下一件完整工作 | 准备桌面、寻找材料、完成底稿 |
| 身体技能 | 数 Tick 到数十秒 | 身体下一步怎样做 | 看向、走近、伸手、抓取、放下 |
长期生活不只有个人目标。阶段意图也可以来自承诺、照护、义务、习惯、仪式、禁止事项或对关系的修复。
二、行为生命周期
阶段意图
状态只有:
text
planned → active → completed
→ suspended → active
→ abandoned1
2
3
2
3
每个意图必须包含:
- 来源:需要、长期目标、承诺、关系、实践、人类请求或观察;
- 完成条件:由世界或可观察结果判断;
- 放弃条件;
- 当前进度;
- 最短承诺时间;
- 被打断后的恢复点;
- 已尝试过的方法与失败原因。
MVP 同时只允许一个 active 阶段意图;被打断意图进入最多三项的暂停栈,防止无限积欠。
任务
任务状态为:
text
ready → active → succeeded
→ blocked
→ failed
→ aborted
→ timed_out1
2
3
4
5
2
3
4
5
一个近期计划最多先展开五个任务。超过深度或无法找到任务链时,明确返回“目前不可行”,不能无限继续分解。
身体技能
身体同一时刻只执行一个主技能。每个技能具有:
- 根据 Agent 认识判断的开始条件;
- 执行时由世界真值检查的物理条件;
- 占用的视线、位置、手和持有槽;
- 最大时长与进度心跳;
- 安全暂停点;
- 成功条件;
- 可感知失败结果;
- 中止后怎样释放或保持对象状态。
三、一个行为模板需要什么
设计师定义任务或技能时,至少回答:
- 为什么会成为候选;
- Agent 以为什么条件已经满足;
- 真正执行还需检查什么;
- 使用哪些对象、区域和身体资源;
- 如何判定进度与完成;
- 可能产生哪些失败结果;
- 哪些地方可以中断;
- 结果怎样反馈到目标、状态、关系和记忆;
- 哪些因素共同造成结果:技能、对象状态、布局、既有摆放、人类行为或未知;每项都带可观察证据与置信度。
只有可机器验证的物理完成条件才能结束任务。语言中的“我做完了”没有状态修改权。
四、主观候选与物理结果
行为要经过三道不同的门:
1. 主观可计划
根据 Agent 的认识、能力认知和已知物品用途,判断它是否认为这个行为值得尝试。
2. 已知条件检查
检查 Agent 当前已经感知到的限制,例如手中已有物体、眼前门明显关闭。
3. 物理执行验证
只有身体执行器读取世界真值,返回成功或 Agent 能感知的失败。
硬安全可以暗中阻止危险动作,但不能顺便把隐藏原因写入 Agent 认识。
五、“拿起杯子”怎样真正执行
text
Agent 记得杯子在桌上
→ 产生“拿杯子”任务候选
→ 走到记忆中的桌边
→ 主动看向目标区域
→ 若看见杯子,确认手空闲并伸手抓取
→ 世界判断抓取是否成功
→ 成功:建立手—杯子持有关系
→ 失败:返回够不到、太重、太热、被挡住或目标不在等可感知信息
→ 认知轮决定换位置、换方法、求助、稍后再做或放弃1
2
3
4
5
6
7
8
9
2
3
4
5
6
7
8
9
如果人类在视野外先移走杯子,“拿杯子”不会神秘地从候选集中消失。失败和重新寻找正是故事与学习发生的地方。
六、“完成一幅画”的垂直行为链
单房间需要至少一个能够产生持久结果的长期工程。首个垂直切片可选绘画:
text
长期方向:维持创作生活
→ 阶段意图:完成一幅小画
→ 任务 1:准备可用桌面
→ 任务 2:确认纸、画具和光线
→ 任务 3:制作底稿
→ 任务 4:上色或完成主体
→ 任务 5:签名并放入作品区域
→ 世界结果:新增一件有阶段、状态和作者的作品1
2
3
4
5
6
7
8
2
3
4
5
6
7
8
过程中可以真实遇到:
- 材料耗尽;
- 桌面被占;
- 工具损坏;
- 人类请求或移动关键物;
- 疲劳导致暂停;
- 作品不满意但物理上已经存在。
任务完成由作品状态和房间结果确认。Agent 对质量的评价可以影响继续修改或接受完成,但不能凭语言生成作品。
七、失败预算与恢复阶梯
MVP 起始规则:
- 同一个“方法 + 目标 + 失败原因”最多直接重试
2次; - 一个任务最多进行
3次方法级修复; - 超过预算后必须进入重新观察、换任务、求助、暂停或判定不可行;
- 等待人类回应设有期限,超时后恢复其他生活;
- 永久不可达目标会被标记,直到出现新证据才重新开放。
失败状态必须向上一层传递:技能失败不等于阶段意图失败;多个任务方法都不可行,才可能暂停或放弃阶段意图。
八、行为族
MVP 行为目录覆盖:
自我照顾
进食、休息、调整光线/温度、恢复姿势。
主动观察
环顾、看向、靠近检查、搜索、持续追踪变化。
移动与姿态
走近、远离、绕开、转向、坐下、站起、安全等待。
手和物体
伸手、抓取、持有、释放、放置、推、拉、打开、关闭、使用。
长期作品与维护
创作、研究、整理、修理、照护物品、推进工程里程碑。
社会行为
听、说、请求、接受、拒绝、协商、延后、结束互动、保护边界、修复关系。
生活实践
实行、变体、延后、失误和修复一个习惯或仪式。
内部与恢复
回忆、规划、反思、平复、等待、放弃、求助、回到安全状态。
内部行为也消耗时间,并必须最终影响一个可观察选择;无限思考视为停滞。
九、有限创造性
完全封闭的行为模板会让 Agent 机械,完全自由文本又无法执行。
每个认知轮最多允许大模型提出一个“新用途或新组合”:
- 指明想得到的结果;
- 只引用已知对象与已有身体技能;
- 由行为系统尝试组合成合法任务;
- 无法组合时返回物理、能力或情境原因;
- 不能因描述得合理就直接成功。
例如没有画笔时,Agent 可以提议使用合适布料制作纹理;系统仍需检查布料、颜料和手部操作是否支持。
十、人类在行为系统中的存在
MVP 把人类视为一个持续身份,而不是匿名 Prompt:
absent:不在场;present:在房间或有可定位声源;speaking/listening/waiting:当前对话状态;- 物理干预:由这个人移动或拿取对象,但只有可见时 Agent 才能正确归因;
- 内心声音:独立通道,Agent 不自动知道真正来源。
一个非安全类人类请求必须始终保留:接受、拒绝、协商、延后、结束互动五种可能。重复已拒绝请求不会自动提高吸引力;越界可触发静音、远离、保护物品或结束对话。
人类强行拿走物品的世界记录是“外部拿走”,不能写成“Agent 主动交出”。
十一、房间怎样避免无聊稳态
行为目录需要与四个房间循环配对:
- 可消耗且有明确补给来源的资源;
- 缓慢磨损、凌乱、修理与照护;
- 能留下不同作品与布置的长期工程;
- 可回放的低频环境事件与人类进出。
任何缺少资源来源的需要都必须允许适应和降级,不能让 Agent 永久重复呼救。
十二、可读性
画面至少让观察者看到:
- Agent 正在看什么;
- 哪只手正面向或持有什么;
- 当前阶段意图和任务进度;
- 最近一次改变主意的简短主因;
- 行为刚刚成功、失败、被拒绝还是等待。
这些反馈解释 Agent 的认识和决定,不泄露它尚未感知的世界真值。
本章的设计检查
每个高层意图都必须:
- 在有限层数内落到已注册任务和技能,或明确返回不可行;
- 有世界可验证的完成条件;
- 同一时刻只占用合法身体资源;
- 有进度、超时、中断和唯一终态;
- 失败能被 Agent 感知,并把有证据的多个贡献因素向上传递;
- 在重试预算内换方法、求助、暂停或放弃;
- 对房间或 Agent 状态产生持久反馈;
- 不要求大模型控制身体步骤。