Acting as Inverse Inverse Planning
MIT; UC San Diego
一句话总结
论文把”讲故事”形式化为对贝叶斯”逆规划”观众模型的再优化(逆逆规划):不再直接编排角色的最优动作,而是搜索那些能让模拟观众推断出创作者所要传达之含义的动作,从而自动生成更具表现力的动画。
研究背景
- 领域现状:程序化动画通常用规划算法(如 MDP + 值迭代)让角色执行”最优动作”,得到看似合理的行为;后续工作允许艺术家用低层目标/行为库做一些引导。认知科学一侧,Baker 等人自 2009 年起用贝叶斯推断建模人类的社会认知,把”理解他人动作”刻画为逆规划——从观察到的动作反推隐藏目标 \(P(\text{goal} \mid \text{action}) \propto P(\text{action} \mid \text{goal})P(\text{goal})\)。
- 核心痛点:单纯模拟”理性智能体”(作者称之为 naïve planning)走最短路径的动作往往语义高度歧义。例如婴儿想要蛋糕而非糖果,若按最短路南下,观众反而会觉得它想要糖果。现有动画系统缺少对”观众如何理解画面”的高层建模,因而无法直接面向”想让观众体验到什么”来创作。
- 本文 idea:既然人类用逆规划理解动作,那么讲故事就是逆逆规划——选择动作去操纵一个逆规划者的推断。创作者只需声明式地指定”希望观众推断出什么”(如 \(\arg\max_{\text{action}} P(\text{baby wants cupcake} \mid \text{action})\)),系统就在贝叶斯推断之上做优化,自动合成能达成该体验的动画。作者进一步指出这与图形学中把”描绘”视为”逆逆渲染”(Durand 等)一脉相承。
方法
整体框架分三层递归:底层是世界模型(规划),用 MDP 描述角色如何行动;中层是观众模型(逆规划),用贝叶斯推断从动作反推角色的隐藏目标;顶层是创作(逆逆规划),在中层的推断结果之上定义目标函数并用束搜索优化出一段”脚本”。
flowchart LR
A["创作者声明目标 f(σ):希望观众推断出的含义"] --> B["逆逆规划:束搜索优化脚本 σ"]
B --> C["逆规划:贝叶斯观众模型 P(H | σ)"]
C --> D["规划:MDP 值迭代得到 Q 函数与 softmax 策略"]
C --> B
B --> E["渲染出的动画"]
关键设计:
-
世界模型与规划:沿用 Ullman 等人的网格厨房世界——一个”强”机器人和一块只有 60% 概率移动成功的”弱”奶酪,各自想去粉/绿格子;机器人还有一个”社会奖励” \(\rho_{\text{robot}} \cdot r_{\text{cheese}}\),取值于 \(\{-3,-1,0,+1,+3\}\) 表示从”敌对”到”帮助”。对每个目标假设用值迭代(\(\gamma=0.99\))算出 \(Q\) 函数,并用带温度的层级 softmax 得到策略,允许两层”心智理论”(机器人建模奶酪、奶酪建模机器人)。
-
逆规划观众模型:把隐藏状态写成假设元组 \(H=\langle G_{\text{cheese}}, G_{\text{robot}}, \rho_{\text{robot}}\rangle\)。给定 \(H\),动作似然为 \(P(s \to a \mid H) \propto \exp(\beta \cdot Q_c^{H}(s,a))\);观察到动作后按贝叶斯规则更新 \(P(H \mid s \to a) \propto P(s \to a \mid H)P(H)\),初始用均匀先验。系统维护”假设→概率”的映射,随动画逐帧更新,模拟观众信念的演化。
-
逆逆规划的目标函数:创作者把叙事意图写成对脚本 \(\sigma\) 的目标。例如”帮助”是 \(f_{\text{help}}(\sigma)=\sum_{t} P(\rho_{\text{robot}}>0 \mid \sigma_{1:t})\),即每一时刻观众都强烈相信机器人在帮忙。同一语言还能表达情节反转(前半 \(\rho>0\)、后半 \(\rho<0\))、戏剧反讽(用条件概率让”若目标不同则显得在帮忙”)、闪回(在脚本尾部追加动作再回溯优化)、叙事弧(让机器人价值函数与 \(1.5\) 个周期的正弦相关,并用 KL 散度约束目标一致性,还引入”天降之物 deus ex machina”式的外部事件)。优化用束搜索:采样多个初始状态,对每条候选脚本按目标的”前缀值”做启发式搜索(默认 500 个初始态、束宽 1 的贪心)。
-
叙事专属的实现细节:为保证真实感额外加了三项——理性项 \(f_{\text{rational}}\)(引入布尔变量判断角色是否理性,非理性时动作视为均匀随机)、环境一致项 \(f_{\text{env}}(\sigma)=-(\hat p(\sigma)-0.6)^2\)(让奶酪的实际移动成功率贴合 0.6)、以及以极小概率 \(\epsilon=10^{-5}\) 重置所有隐变量以”折旧”过往证据,迫使故事持续提供新信息。此外还从网格世界扩展到物理世界的”哑剧”:用可微物理 + Short-Horizon Actor-Critic 训练一个”Luxo 台灯”式跳跃器,通过在最优策略上叠加残差动作,让它”假装”费力地拖一个其实很轻的箱子。
实验结果
作者做了两组 IRB 批准的真人实验,核心问题是:逆逆规划是否比 naïve planning 更能有效传达目标情境。
| 场景 / 目标 | 逆逆规划 | Naïve 规划 | 说明 |
|---|---|---|---|
| 厨房 · 帮助(识别为”帮助”占比) | 73% | 6% | \(p \ll 0.01\),差距最大 |
| 厨房 · 阻碍(识别为”阻碍”占比) | 62% | 29% | \(p \ll 0.01\) |
| 厨房 · 冷漠(识别为”冷漠”占比) | 73% | 75% | 无显著差异,naïve 本就易读 |
| 山坡 · 哑剧让轻箱看似比轻箱重 | 95.7% | — | \(p \ll 0.01\),同为轻箱 |
| 山坡 · 哑剧让轻箱看似比重箱重 | 68.6% | — | \(p < 0.01\),尽管实际轻 5 倍 |
厨房实验招募 98 名被试、每个条件用种子 0–19 各生成 20 段动画;被试并不知道视频来自不同算法或由计算机生成。结论是:逆逆规划在”帮助/阻碍”这类 naïve 规划难以清晰表达的情境上显著更优;而”冷漠”两者相当,因为 naïve 动画本就常常没有角色互动。山坡哑剧实验(35 名被试)表明跳跃器成功让观众相信箱子比真实更重。作者称在 44 核服务器上每个例子的优化加渲染均在两分钟内完成。
亮点与局限
- 亮点:
- 概念优雅统一:用”对贝叶斯推断做优化”这一条语言,从第一性原理自然涵盖角色、情节反转、反讽、闪回、叙事弧等多种叙事元素,把图形学的”逆逆渲染”类比推广到动画。
- 声明式高层接口:创作者只需说明”想让观众体验到什么”,无需指定角色初始位置、目标等与叙事无关的低层参数,实现模块化的高层创作。
- 有真人证据支撑:不止提出形式化框架,还用受控人类被试实验验证了生成动画确实在人群中产生了预期理解,帮助识别率相对基线提升可达约 9 倍。
- 局限:
- 可扩展性是主要瓶颈:计算量随状态空间、角色数、假设空间、脚本长度增长;本文在每一层都用精确但慢的算法(值迭代、枚举式推断)。作者建议用 SMC、摊还推断或图神经网络等近似方法提速,但指出近似方法可能牺牲对人类直觉的拟合精度。
- 世界模型是玩具级的网格厨房(外加一个简化物理山坡),距离真实动画制作的复杂度尚远。
- 不面向终端艺术家书写数学目标:作者设想艺术家像挑选材质/BRDF 一样从预置故事模板库中选择、定制,而设计这类直观交互界面仍是留待未来的 HCI 工作。
- 情感这一叙事核心尚未建模,仅作为未来方向提出。
延伸思考
- 该框架与逆强化学习中的”legibility”(让机器人意图对人可读,Dragan)以及”逆逆强化学习”(策略性欺骗对手,Pattanayak 等)形成有趣对照——本文相当于把”面向观众推断做优化”系统化为叙事工具。
- “对可微观众模型做梯度优化”的思路,与图形学里可微渲染 + 感知模型优化(作者自己的 illusion 工作)高度同构,暗示”面向感知/认知的内容生成”可能是一个可跨模态复用的范式:把可信的人类认知模型当作可微损失,反过来驱动内容合成。
- 若把精确贝叶斯推断替换为神经摊还推断,一个自然的追问是:加速后的观众模型是否仍能守住对”意料之外/分布外”故事的人类直觉?这正是把该框架推向实时交互式叙事(交互小说、人机即兴)时必须回答的效率–精度权衡。
- 把该模型接入语言模型时代的叙事生成,或许能为”观众建模”这一长期难题提供一个有原则的贝叶斯骨架,而不必依赖大量手工启发式规则。