新加坡管理大学发布128GB超大规模科学代码数据集SCICODEPILE 填补AI for Science代码生成与评测资源空白
随着AI for Science(科学智能)赛道进入产业化落地关键期,大模型在计算化学分子模拟、生命科学序列分析、复杂工程建模等场景的代码生成需求持续攀升,但长期以来,跨学科、高可信度、支持可执行验证的科学代码训练资源缺口明显,成为制约科研类代码大模型性能提升的核心瓶颈之一。2026年7月21日,新加坡管理大学联合相关机构在预印本平台arXiv首发超大规模科学代码语料库SCICODEPILE,为这一行业痛点提供了全新的解决方案。
作为迄今为止全球规模最大的科学代码语料库,SCICODEPILE总量达128GB,源自37737个经过严格筛选的公共代码仓库,覆盖化学、生命科学、计算方法和AI建模等多个核心科研领域,内容以原始代码文件、仓库摘要、函数指令及问题-解决方案对四种互补格式呈现,可满足代码大模型预训练、微调、指令对齐等不同阶段的训练需求。不同于普通代码数据集直接抓取公共仓库内容的粗放式构建模式,SCICODEPILE采用了严格的“检索-过滤”双阶流程,同时引入大语言模型辅助完成关键词扩展与内容质量校验,最大程度剔除了无效代码、低质量注释与非科研用途代码片段,保障了数据集的专业适配性。在此基础上,研发团队还专门提炼出包含200个典型科研任务的可执行评测集,配套沙箱执行环境与自动化测试框架,解决了过往数据集仅能做文本层面匹配、无法验证代码实际运行效果的行业通病。
从潜在应用方向来看,SCICODEPILE可以覆盖科研、产业、教育等多个场景:在科研端,计算科学领域的研发团队可基于该数据集训练垂直领域代码大模型,快速生成分子动力学模拟、基因序列分析、多物理场建模等场景的可执行代码,大幅降低科研人员的代码编写与调试成本;在产业端,生物医药、新能源、先进制造等领域的企业研发部门,可利用配套的评测集完成自研代码大模型的科学场景能力校验,筛选出适配自身研发需求的模型版本;在教育端,高校计算科学、生物信息学、计算化学等专业可将数据集作为教学案例库,帮助学生快速掌握不同学科的科研代码规范与实现逻辑。
该数据集的发布填补了当前跨学科科学代码数据集在规模、领域覆盖度、功能可验证性三大维度的短板,也为AI for Science领域的基础设施建设提供了新的参考范式。随着数据要素市场对专业领域高质量数据集的需求持续增长,这类垂直场景的优质数据集供给,将进一步加速AI技术与科研场景的融合落地,为科研数字化、科研效率提升提供核心资源支撑。





_1769672084863.jpg)