8月17日,合肥人工智能企业智象未来(HiDream.ai)正式发布原生全模态交互式世界模型HiDream-O1-World。该模型基于企业自主研发的UiT原生全模态架构,具备漫游、编辑、交互三大功能,支持文本、图像、交互指令等多模态输入,可一键生成可持续探索和交互的数字世界,并在时空一致性和物理一致性两项关键能力上实现突破。
与传统视频生成模型主要生成连续画面不同,交互式世界模型需要在用户不断移动视角、改变环境和操控角色的过程中,持续保持场景稳定,并让物体运动符合现实世界的基本规律。
针对这一难题,HiDream-O1-World重点提升了长时程时空一致性和物理一致性。模型通过引入3D空间记忆和测试时训练机制,在生成过程中持续记录场景的几何结构、物体位置及空间关系,使镜头在多轮移动和视角切换后,仍能保持物体尺寸、位置和遮挡关系相对稳定,减少场景漂移、物体消失等问题。
(正文已结束)