Meta AI发布多模态评测基准数据集Gamut 填补大模型事实完整性评估空白

五号数据雷达开源数据市场3
Meta AI于2026年7月22日在arXiv首发多模态事实完整性基准数据集Gamut,针对当前大模型评测仅关注事实精确性、忽略完整性的行业痛点,为多模态及纯文本生成系统提供更严谨的事实性评估框架。

随着生成式AI多模态能力的快速迭代,大模型在图文问答、长文本生成场景下的事实性问题已成为制约其向专业领域落地的核心瓶颈——当前行业主流的评测体系普遍仅关注输出内容的“事实精确性”,即是否存在错误信息,却往往忽略“事实完整性”要求,大量大模型输出看似无错误、却存在关键信息遗漏、结论片面等问题,无法适配医疗、科研、公共服务等高要求场景的应用需求。针对这一行业痛点,Meta AI推出了名为Gamut(Grounded Assessment of Multimodal Factuality)的多模态事实完整性基准数据集,专门用于评估开放生成模型在长文本回答中的事实完备性,该成果于2026年7月22日首次发布在学术平台arXiv。

据公开信息显示,Gamut数据集共包含1813个基于真实可穿戴设备图像的日常深度研究问题,覆盖10个细分领域,所有问题均配套经过专家验证的、基于证据的结构化元评分标准。该数据集的原始数据来源于CRAG-MM图像集,通过“前沿大语言模型预标注+人类专家多轮校验修正”的流程构建完成,有效保证了问题场景的真实性和评分体系的可靠性。相较于传统评测基准,Gamut的核心价值在于填补了事实完整性评估的空白,不仅可用于评估多模态大模型在知识寻求任务中的事实召回能力,其评估框架也可直接适配纯文本生成系统的事实性评测,为全品类生成式AI的能力校验提供了更全面的标尺。

作为AI基础数据资源领域的重要成果,Gamut数据集的落地应用空间十分广阔:一方面可作为通用大模型迭代的核心评测基准,帮助研发团队定位模型在信息召回环节的短板,优化长文本生成的完备度;另一方面也可用于专业领域大模型的适配测试,比如可穿戴设备配套的健康咨询AI、科普类多模态问答产品、科研辅助生成工具等对事实准确性、完备性要求较高的场景,均可依托Gamut搭建评测体系,降低大模型输出片面结论的风险,推动生成式AI的可信落地。对于数据要素市场而言,该类垂直领域评测数据集的出现,也进一步完善了AI基础数据资源的供给体系,为生成式AI产业的规范化发展提供了重要的基准支撑。

查看Gamut (Grounded Assessment of Multimodal Factuality)

详情页内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们