7所海内外顶尖科研机构联合发布Reflect-R1系列数据集 破解多模态大模型长视频理解幻觉难题

五号数据雷达开源数据市场25
2026年6月26日,由清华大学、广东人工智能与数字经济实验室(深圳)牵头,联合南洋理工大学、中国科学技术大学等共7所海内外顶尖科研机构研发的Reflect-R1系列数据集正式在arXiv首发,合计12万条结构化样本填补了长视频理解多模态反思训练领域的数据空白,有望大幅降低多模态大模型的推理幻觉率。

随着多模态大模型在内容生产、智慧城市、安防监控等领域的落地应用,长视频理解、复杂场景自主推理已经成为行业公认的技术攻坚方向。传统多模态大模型在处理时长超过半小时的长视频内容时,普遍存在信息遗漏、推理链路断裂的问题,而此前主流的反思训练机制多为内部闭环模式,缺乏外部视觉证据的锚定支撑,容易出现“越纠正幻觉越严重”的错误循环,高质量的专项训练数据缺失已经成为制约该领域技术升级的核心瓶颈。

2026年6月26日,清华大学联合广东人工智能与数字经济实验室(深圳)、南洋理工大学、中国科学技术大学、深圳大学、加州大学、上海交通大学共7所海内外顶尖科研机构,正式在arXiv平台发布Reflect-R1系列专项训练数据集,包含Reflect-R1-CoT-90k和Reflect-R1-RL-30k两个子数据集,总计12万条结构化样本,精准瞄准长视频理解反思训练、多模态自我纠正两大核心场景的训练数据需求。

据介绍,该系列数据集的样本全部由系统化的标注流程构建,核心内容为带完整推理链路的长视频问答对,不仅包含问题与标准答案,还整合了对应推理环节的视觉证据定位标注、逻辑推导步骤拆解,为大模型训练提供了可验证的外部参照基础。其中Reflect-R1-CoT-90k主打思维链训练场景,适配大模型长视频理解的逻辑推导能力优化;Reflect-R1-RL-30k则针对强化学习驱动的多阶段自我纠正框架设计,专门用于训练大模型的自主错误识别、证据检索、路径修正能力,从数据层面解决传统内部闭环反思机制的幻觉循环、修正失效问题。

从行业应用来看,该系列数据集未来可支撑多个垂直领域的技术升级:在文娱内容领域,经其训练的多模态大模型可实现长视频的智能内容梳理、伏笔挖掘、精准剪辑,大幅降低影视、长视频内容的制作成本;在公共服务领域,可应用于超长监控视频的事件自动回溯、关键线索定位,提升智慧城市安防系统的响应效率;在通用多模态大模型研发领域,该数据集可用于优化大模型的自我纠正能力,降低图文推理、跨模态内容生成等场景的幻觉率,提升大模型输出结果的可靠性。

作为当前首个面向多模态反思训练的公开长视频数据集,本次发布的Reflect-R1系列不仅填补了细分领域的公共数据空白,也为相关科研方向提供了统一的基准测试参考,对推动多模态大模型的落地应用、完善AI训练数据要素供给体系具有重要意义。

查看Reflect-R1-CoT-90k, Reflect-R1-RL-30k

详情页内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们