HuggingFace 本次发布的数据集 OnlySports Dataset, 该数据集是一份全面的专业体育英文资料集合,涵盖了新闻文章、博客、比赛报告、访谈以及教程等内容,这些资料均来源于FineWeb数据集。此外,该数据集是目前为止最大的体育领域数据集,包含了多种与体育相关的文档,总文字量达到1.2TB,相当于大约6000亿个RWKV令牌。这一数据集的任务是用于训练针对体育相关任务的专业领域语言模型。
Dataset card 内容:
Files and versions 内容:
关于 HuggingFace , HuggingFace是一家专注于自然语言处理技术的公司,提供开源的机器学习模型和工具,广泛应用于文本生成、翻译和情感分析等领域。
关于 arXiv , arXiv 是一个免费分发服务和开放获取的学术文章档案库,涵盖了物理学、数学、计算机科学、定量生物学、定量金融、统计学、电气工程和系统科学以及经济学等领域。该网站上的材料并未经过 arXiv 的同行评审。





_1769672084863.jpg)