香港大学首发UE渲染定制化视频世界模型数据集 支撑视频生成与合成数据领域技术攻关
近年来,随着世界模型、AIGC视频技术进入产业化落地关键期,长视频生成的场景一致性差、动态物体记忆偏差、遮挡场景泛化能力不足等痛点,已经成为制约技术从短内容生产向长视频、交互式3D内容生产升级的核心瓶颈。而高质量标注的训练数据集,是攻克上述技术难题的核心基础:现有开源视频数据集大多来自真实场景采集,不仅标注成本高、精度参差不齐,也缺乏系统性设计的复杂动态遮挡场景长序列样本,难以满足视频世界模型的训练需求,成为领域共性卡脖子问题。
近日,香港大学研究团队正式发布的定制化视频世界模型专用数据集,正是瞄准上述行业痛点研发的成果,该数据集全部基于Unreal Engine(虚幻引擎)渲染构建,于2026年6月30日首发于学术预印本平台arXiv,填补了细分领域的优质数据集供给缺口。
据介绍,该数据集是专门为视频世界模型研发设计的专用训练数据集,相较于人工采集标注的数据集,其通过游戏引擎渲染生成的特性,天然具备100%精确的相机姿态标注、场景参数标注,从源头上解决了训练数据标注误差带来的模型效果天花板问题。在数据集构建过程中,研发团队通过定制化场景设计,系统性地在虚拟场景中引入各类遮挡物、动态运动对象,最大程度模拟真实世界的复杂环境,最终生成的数据集包含了大量具备复杂场景遮挡、动态对象交互的长视频序列样本,覆盖了现有数据集普遍缺失的边缘场景。
该数据集的核心应用方向为视频世界模型的训练与评估,可针对性解决现有算法在遮挡场景、动态对象处理中泛化能力不足的问题,为学习型上下文查询机制的研发提供关键训练支撑。除此之外,作为高可控性的合成数据源,该数据集还可广泛应用于合成数据生成领域,衍生适配不同行业需求的训练数据:比如可为自动驾驶感知模型提供虚拟动态路况训练样本、为元宇宙场景内容生成提供动态交互参考、为智能安防算法提供异常行为模拟样本、为影视特效预演提供低成本场景素材等,具备极高的学术研究与产业复用价值。
当前我国数据要素市场建设持续推进,面向人工智能前沿方向的高质量训练数据集是数字经济核心生产要素的重要组成部分,本次香港大学发布的专用数据集,不仅为全球相关领域的学术研究提供了公共数据供给,也为产业界突破视频生成、世界模型落地瓶颈提供了新的基础设施支撑,将进一步推动相关技术从实验室走向实际应用场景。
查看基于Unreal Engine的自定义视频世界模型数据集





_1769672084863.jpg)