德国哈根大学发布GouDa可控合成数据集 为数据质量评估与合成数据研发提供标准化基准
当前,随着全球数据要素市场建设提速,以及AI大模型训练、企业数据治理等领域的快速发展,数据质量评估、合成数据生成相关技术的研发需求持续高涨,但行业长期面临缺乏标准化、可复现、可控错误类型的基准测试数据集的痛点:真实业务数据集往往涉及隐私合规问题无法公开流通,通用公开数据集的错误类型固定、可定制性差,难以满足不同场景下的算法测试、技术验证需求。近日,德国哈根大学研究团队正式发布GouDa合成数据集工具,相关成果首发于学术预印本平台arXiv,为上述行业痛点提供了新的解决方案。
据介绍,GouDa是一款面向数据质量基准测试场景打造的综合性合成数据生成工具,无需依赖现有真实数据集即可生成高度拟真的模拟数据,支持JSON格式的表格化、半结构化两类数据输出,覆盖了当前企业业务中主流的数据存储形态。用户可通过自定义属性值列表、调用多种内置生成函数调整数据的字段特征、分布规律,同时可按照测试需求以可控方式插入缺失值、语法违规等20余种常见数据错误,完全匹配不同场景下的测试变量控制要求。
为了提升评估的准确性与可复现性,GouDa的创建过程基于专属GouDa模式定义(GSD)模板,搭配图形用户界面支持交互式操作,在生成带错测试数据的同时,将自动同步生成对应的干净数据版本与完整错误日志作为基准真值,大幅降低测试过程中的对照校验成本,有效提升了不同研发主体之间测试结果的可比性。
从应用场景来看,GouDa当前已明确可覆盖数据清洗算法评估、机器学习模型测试、数据质量学术研究三大核心领域:数据治理服务商可借助GouDa生成的可控测试集,量化评估自家数据清洗工具的错误识别率、修复准确率,针对性优化产品性能;合成数据研发团队可将其作为校准基准,提升生成模型的真实性、错误规避能力;机器学习研发团队可通过注入不同类型错误的数据集测试模型的鲁棒性,降低模型在真实脏数据场景下的泛化误差;高校、科研院所的研究人员也可依托其可复现的标准化能力,开展数据质量相关的对照研究,减少实验变量误差。业内分析指出,GouDa的推出针对性解决了当前合成数据基准测试领域普遍存在的真实性不足、错误类型覆盖不全、多格式支持能力弱等核心挑战,对降低数据治理、AI研发等领域的测试成本,推动数据质量评估环节的标准化建设具有重要价值。





_1769672084863.jpg)