【WAM篇】05:TesserAct——当视频世界模型学会“立体地“想象未来
最新推荐文章于 2026-08-01 22:18:08 发布
原创 于 2026-05-28 17:48:27 发布 · 347 阅读
级联式 WAM 系列的第五站。前面几篇里,世界模型”画出来”的未来都是一段平面的 RGB 视频。这一篇我们要看的 TesserAct 提出了一个朴素却关键的追问:机器人活在三维世界里,凭什么让它”想象”出来的未来只是二维的画面?
在 WAM(World Action Model,世界动作模型,即”先在脑海里预演未来、再据此行动”的一类具身模型)的大家谱里,TesserAct 属于 级联式这一支:先由世界模型 生成一段”任务执行视频”作为中间计划,再用一个独立的动作模型从这段视频里把可执行的机器人指令”读”出来。它和开山之作 UniPi、以及光流路线的 AVDC 站在同一条赛道上。但 TesserAct 做了一件别人没做的事:它不满足于生成 RGB 视频,而是让世界模型同时吐出深度图和表面法向图,把对未来的想象从”一张照片”升级成”一段会动的三维场景”。
论文的名字本身就是个隐喻。Tesseract(超立方体)是三维立方体在四维空间里的推广;作者用它来呼应自己要建模的对象——4D 具身世界模型 ,也就是”3D 空间 + 时间”的动态演化。所谓 4D 世界模型,它要预测的不是一张张孤立的图片,而是”在一个具身智能体的动作驱动下,整个三维场景随时间会怎样演变”——并且要求这种演变在空间上和时间上都保持一致:墙不会突然塌、被抓的物体不会忽大忽小、相邻时刻之间不会鬼畜地跳变。
一、要解决什么问题:平面想象的”三维盲区”
先回顾一下级联式 WAM 的标准玩法。以 UniPi 为代表的”像素 空间规划”流派,思路是这样的:
给定当前画面和一句语言指令(比如”把抽屉拉开”),让一个视频生成模型”脑补”出一段完成任务的视频;
再用一个逆动力学模型(IDM,Inverse Dynamics Model,通俗说就是”盯着前后两帧画面、倒推出中间机器人该执行什么动作”的网络) ,从相邻帧里回归出一串动作,交给机器人去执行。
这套路子的最大红利,是能直接”白嫖”互联网规模预训练的视频大模型——它们见过海量真实世界的运动,对”东西会怎么动”有很强的先验。但问题也很扎眼:这些视频通通是二维的。
二维想象的盲区在哪?打个比方。你闭上一只眼睛去倒水,会发现很难判断杯口到底离瓶口多远——这就是缺乏深度信息的窘境。机器人操作里这种”差之毫厘”的场景比比皆是:
深度模糊:画面里夹爪和苹果”看起来”贴在一起了,可在三维空间里它们可能还差着两厘米。靠 RGB 帧硬推动作,IDM 很容易在这种贴近接触的瞬间出错。
几何走形:纯 RGB 视频生成模型并不”懂”物体是刚性的、桌面是平的。它生成的画面里,物体可能莫名其妙地变形、悬浮,或者在不同帧之间”漂移”——视觉上挑不出大毛病,可一旦你试图把它还原成真实的三维场景,破绽百出。
TesserAct 的出发点就是:与其让动作模型去猜被压扁的三维信息,不如让世界模型一开始就把三维信息显式地预测出来。 深度和法向,正是补上这个盲区最直接的两味”几何调料”。
这里还藏着一个更深的动机。WAM 综述反复强调的一个核心标准是”耦合式动作生成”——动作必须严格对齐于所想象的未来状态,而不能凭空生成。可如果想象出的未来本身就缺了一整个维度(深度),那么再怎么对齐,动作也会”先天发育不良”。换句话说,世界模型对未来刻画得越完整、越符合物理几何,下游动作模型才越有可能做出靠谱的决策 。TesserAct 正是从这个角度,把”提升动作质量”的问题,前移成了”提升世界想象的几何完整度”的问题。
二、核心思想与直觉:RGB-DN 三件套 + 一次几何”提纯”
一句话概括 TesserAct 的核心 idea:让视频生成模型从预测 RGB 一种模态,升级到联合预测 RGB、深度(Depth)、表面法向(Normal)三种模态(合称 RGB-DN);再用一套带几何约束的优化算法,把这三种模态”焊接”成一段时空一致的 4D 点云场景;最后从这段三维场景里学习一个更准的逆动力学模型。
这里有两个新手友好的概念先点一句:
深度图:每个像素到相机的距离,本质上告诉你”这个点在三维空间里有多远”。有了它,平面像素就能反投影回三维点。
表面法向:每个像素所在物体表面”朝向哪个方向”的单位向量(想象在桌面上立一根垂直的针,针的方向就是桌面的法向)。它刻画的是局部的几何朝向,对”平面是不是平的、曲面弯得对不对”特别敏感。
为什么要同时要这两样、而不只要深度?因为单靠神经网络预测出来的深度图 往往”坑坑洼洼”、噪声很大,直接反投影出来的点云碎裂不堪。而法向恰恰是深度的”导数”层面的信息——它约束的是相邻像素深度变化的快慢方向。用法向去回过头来”打磨”深度,就能得到平滑、干净、几何自洽的三维表面。这正是 TesserAct 在”生成”之后追加一步几何优化的精髓:生成给出粗胚,几何约束做精修。
它属于 WAM 级联式中的”像素空间 + 学习式动作提取”一类,与前作最关键的区别就在于中间表征从 RGB 升级为 RGB-DN,把显式的几何约束注入了规划载体 ,从而给下游动作提取喂进了远比二维像素丰富的线索。
三、方法详解:从一帧画面到一段 4D 场景
TesserAct 的流水线可以拆成三块:RGB-DN 视频生成 → 几何优化重建 4D 场景 → 点云逆动力学提取动作。我们逐块拆开讲。
3.1…
========
前阵子我天天用Codex干活,那个桌面客户端是真好用。
搞搞小项目,写一写代码,比我自己敲快多了。
但有个问题一直膈应我。
就是它背后挂的是OpenAI官方的模型,要么你得开ChatGPT的订阅,要么你走官方API,反正都是在烧钱。
我做的很多活儿其实没那么难,结果还得用OpenAI家的模型去跑,心疼。
那么有没有这样一个工具,既能用上codex的架构,又能接便宜点的API,比如deepseek呢。
有的,这个工具就是,
CC-Switch。
现在GitHub上已经50k star了。
github.com/farion1231/cc-switch
先用大白话说清楚它是干嘛的
CC Switch是个桌面App,Windows、Mac、Linux都能装。
我这里直接让codex帮我拉git仓库安装了。
cc干的的活儿特别简单,就是帮你自动改大模型的配置文件。
改成你想要接的API。
你在界面上点几下,它在后台帮你把配置写进去,你完全不用碰代码。
它现在能管一大票Agent工具。
Claude Code、Codex、Gemini CLI、OpenCode、OpenClaw