首页 / 开源数据市场
开源数据市场
卡塔尔哈马德·本·哈利法大学发布HalluTruthQA基准数据集 完善阿拉伯语大模型幻觉评估体系

··HalluTruthQA

2026年7月22日,卡塔尔哈马德·本·哈利法大学联合相关机构在预印本平台arXiv首发细粒度阿拉伯语问答幻觉检测基准数据集HalluTruthQA,该数据集覆盖四大知识密集领域,为阿拉伯语大模型的事实可靠性评估提供多维度标准化框架,将推动阿拉伯语自然语言处理领域的幻觉治理研究落地。

丹麦奥胡斯人文计算中心发布CHR_detection_trees绘画主题分割数据集 赋能艺术史研究与计算机视觉应用

CHR_detection_trees

欧洲领先数字人文研究机构丹麦奥胡斯人文计算中心(CHCAA)黄金矩阵项目团队于2026年7月23日在HuggingFace首发CHR_detection_trees绘画主题分割数据集,基于4727幅19世纪北欧绘画的结构化标注生成,可广泛应用于艺术史图像分析、实例分割等领域,为人文与计算机交叉研究提供高质量数据支撑。

地平线联合南洋理工发布InsScene4D-147K大规模4D数据集 填补动态场景长序列标注数据空白

线InsScene4D-147K4D

国内AI技术厂商地平线联合南洋理工等机构正式发布大规模4D场景理解数据集InsScene4D-147K,该数据集于2026年7月22日首发于arXiv,覆盖真实/合成、静态/动态多场景共14.7万份样本,可支撑4D场景理解、实例空间跟踪等下游AI任务,解决动态环境下长序列几何-实例一致性预测的训练数据痛点。

Forvis Mazars联合法国学术机构发布美国企业财报欺诈检测基准数据集 填补风控标注数据空白

Forvis Mazars

国际审计咨询机构Forvis Mazars联合法国学术机构于2026年7月22日在预印本平台arXiv首发美国企业财报欺诈检测综合数据集,该数据集整合多维度财务数据、文本信息与官方欺诈标签,可广泛应用于财务欺诈识别、金融风控模型评估等场景,为破解传统风控模型泛化能力高估的行业痛点提供基础支撑。

阿里联合清华发布ExpertVerse-100K基准数据集 助力知识密集型视觉合成与多跳推理技术迭代

ExpertVerse-100K

阿里巴巴集团联合清华大学于2026年7月22日在预印本平台arXiv首发大规模多模态基准数据集ExpertVerse-100K,通过高知识密度的全链路标注样本体系,为生成式AI在专业领域的跨模态推理能力训练、效果评估提供标准化支撑,将有效推动知识密集型视觉合成、多跳知识推理等前沿AI技术的落地应用。

展开显示更多
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们