阿里巴巴发布ASAP作文评分基准数据集 填补教育AI自动评估公开训练数据缺口

五号数据雷达开源数据市场3
2026年7月21日,阿里巴巴集团于预印本平台arXiv首发ASAP dataset数据集。该数据集为Kaggle自动学生评估竞赛配套的英文作文评分基准数据集,覆盖12978篇带统一人工评分标签的真实学生作文,将为自动作文评分、个性化教育反馈等场景提供标准化数据支撑,推动教育评估技术数字化迭代。

当前教育数字化转型已进入深水区,AI辅助教育评估成为降低一线教学负担、提升教育资源普惠性的核心方向之一,但长期以来,教育AI领域尤其是自动作文评分赛道,普遍面临标注规范、来源合规的公开训练数据集不足的痛点:不同机构研发的评估模型缺乏统一的效果验证基准,评分维度的一致性、客观性难以横向对比,直接制约了行业技术的标准化迭代与落地应用。

2026年7月21日,阿里巴巴集团正式发布的ASAP dataset数据集,为上述行业痛点提供了标准化的解决方案。据公开信息显示,ASAP数据集最初为Kaggle平台主办的自动学生评估竞赛所构建的官方英文作文评分基准数据集,由学术机构联合教育部门合规采集编纂,所有数据均严格遵循教育数据隐私保护相关规范,不存在个人信息泄露风险。

本次公开的数据集共包含12978篇真实学生作文,涵盖议论文、源文本依赖型写作、叙事文三大国内外教育场景中最常见的写作类型,涉及八个不同的写作提示场景,覆盖不同年龄段、不同能力层级学生的真实写作水平;每篇作文均附有多轮人工评定的分数标签,评分过程严格遵循标准化教育评估流程,由专业评分员根据统一量规从内容立意、逻辑结构、语言表达等多个维度完成评定,作文平均长度在150至650词之间,数据标注的一致性、场景的丰富度均处于行业领先水平。

从应用价值来看,该数据集主要面向教育技术领域的自动作文评分和反馈生成研究方向,基于该数据集训练的机器学习模型,可实现对学生写作能力的自动化、多维度评估:一方面可直接减轻一线教师的作文批改负担,让教师将更多精力投入到针对性的个性化教学指导中;另一方面也可为学生提供实时的写作反馈,针对其薄弱点给出具体的提升建议。除此之外,该数据集还可应用于教育评估技术标准化校验、区域学生写作能力整体调研、英语类考试智能评卷系统优化等多个潜在场景,为教育数字化治理提供可靠的数据支撑。

作为教育领域合规开放的高质量标注数据集,本次ASAP dataset的发布,也为数据要素在公共教育服务领域的流通应用提供了参考样本,将进一步推动教育AI技术的普惠落地,助力缩小不同区域间的教育资源差距,为数字经济背景下的公共服务数字化升级提供新的实践路径。

查看ASAP dataset

详情页内容:

数据合作广告位
二维码
社区交流群

面向社区/商业的数据集话题

二维码
科研交流群

面向高校/科研机构的开源数据集话题

二维码
关注我们