8月17日,智象未来发布了交互式世界模型HiDream-O1-World。用户可以进入生成场景,自由移动视角,通过文字、语音或图片控制人物动作,改变场景接下来的发展。
传统视频模型生成一段画面就结束了。交互式世界模型要解决的是"视频生成之后的问题":用户介入时,模型能否记住此前的空间和人物,根据新操作继续运行这个世界。
难点在于空间一致性。普通视频生成以像素为基础,前后两帧出一点误差,短视频里看不出来;生成时间一长,误差累积,人物变形、物体漂移、场景结构改变。用户操作又进一步打破平衡——移动镜头、改变动作,模型既要响应新指令,又要保留此前的空间关系。
HiDream的解法是把"几何结构"和"外观信息"分开处理。空间结构决定墙在哪、人物和桌子距离多远;纹理光照决定墙面材质和场景风格。两部分相对独立,镜头移动时不必把整个画面推倒重来。这就像影视制作:先在虚拟片场搭好舞台,确定人物和物体位置,镜头动后再重新打光和上色。
它还用了两套机制维持长期一致。3D先验注入Memory上下文:模型维护持续更新的空间记忆,物体暂时离开画面,仍记得它曾经的位置,用户再进入时能衔接上。Test-Time Training:推理阶段根据当前场景在线适应,让后续生成继续遵循已建立的空间关系。
动作也要产生合理的后果。抓取一杯水,手指要准确接近、杯子随手移动、松开后受重力落下。碰撞、流体、柔性形变、重力抛射,都需要模型理解物体间的因果关系。
创始人梅涛把世界模型的目标概括为两句话:"model the world"和"mold the world"。前者是理解和表达世界,后者是允许人进入其中,改变世界接下来的运行方式。视频模型只能看,世界模型能进去改——从理解到改造,是这条技术路线最本质的跨越。
结构(几何)与状态(外观)分离,记忆让断开的场景续上,运行时在线适应——世界模型的技术内核,恰恰是任何复杂系统维持长期稳定的通用解法。