Forvis Mazars联合法国学术机构发布美国企业财报欺诈检测基准数据集 填补风控标注数据空白

五号数据雷达开源数据市场3
国际审计咨询机构Forvis Mazars联合法国学术机构于2026年7月22日在预印本平台arXiv首发美国企业财报欺诈检测综合数据集,该数据集整合多维度财务数据、文本信息与官方欺诈标签,可广泛应用于财务欺诈识别、金融风控模型评估等场景,为破解传统风控模型泛化能力高估的行业痛点提供基础支撑。

随着全球资本市场合规监管趋严,财报欺诈手段的隐蔽性、复杂度持续提升,金融机构、监管部门对高精度财务风险识别模型的需求水涨船高。但长期以来,金融风控领域缺乏带权威标注的高质量基准数据集,传统模型评估普遍采用随机数据划分方式,极易导致模型泛化能力被高估,实际落地时识别准确率大幅下滑,成为掣肘金融风控数字化升级的核心痛点之一。

国际知名审计与咨询机构Forvis Mazars聚焦这一行业共性问题,联合法国学术机构共同打造的《Comprehensive U.S. Company Dataset for Financial Statement Fraud Detection(美国企业财报欺诈检测综合数据集)》,是面向财务欺诈检测场景的首份综合性美国公司基准数据集。该数据集整合了结构化财务数据与文本信息,累计收录10,159条公司季度记录,覆盖2009-2024年期间13,332家美国企业的核心财务指标,同时配套经大语言模型提炼的管理层讨论与分析(MD&A)摘要文本,所有欺诈标签均通过人工审核关联美国证监会发布的会计审计执行公告,构建过程采用自动化提取与专家验证相结合的双阶段流程,充分保障了标签的时序准确性与标注质量。

不同于传统通用财务数据集,本次发布的数据集专为支撑公司隔离式财务欺诈检测任务设计,核心目标就是解决传统随机划分方法导致的模型泛化能力高估问题,推动金融风控领域模型评估范式的革新。从应用场景来看,该数据集的价值可覆盖多个领域:银行、券商、股权投资机构等市场参与方可依托该数据集训练适配性更强的财报欺诈识别模型,在信贷审批、股权投资、债券承销等业务环节提前排查上市企业财务造假风险,降低资产损失概率;监管部门与会计师事务所可基于该数据集优化违规筛查算法,提升财务合规核查的效率与精准度,减少人工排查的盲区;金融科技研发团队与学术研究机构可将其作为通用基准测试集,统一风控模型的评估标准,避免传统评估方法的指标失真问题,推动金融风控技术的迭代创新。

查看Comprehensive U.S. Company Dataset for Financial Statement Fraud Detection

详情页内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们