
布加勒斯特大学发布全球首个罗马尼亚语词汇简化数据集RALS 填补低资源NLP领域资源空白
布加勒斯特大学研究团队于2026年7月22日在arXiv平台首发RALS(罗马尼亚语自动词汇简化)数据集,作为全球首个针对罗马尼亚语构建的综合性词汇简化专项数据集,其将填补该语种词汇复杂性研究与应用的资源缺口,为低资源语言自然语言处理发展及公共信息包容性建设提供支撑。

布加勒斯特大学研究团队于2026年7月22日在arXiv平台首发RALS(罗马尼亚语自动词汇简化)数据集,作为全球首个针对罗马尼亚语构建的综合性词汇简化专项数据集,其将填补该语种词汇复杂性研究与应用的资源缺口,为低资源语言自然语言处理发展及公共信息包容性建设提供支撑。

加拿大多伦多大学联合AI研究机构Vector Institute于2026年7月22日在预印本平台arXiv首发SeededGrasp多末端执行器桌面抓取数据集,覆盖256万标注抓取姿态、三类主流夹爪与数百种复杂杂乱场景,可为具身智能机器人抓取技术研发、多模态操作模型训练提供高质量数据支撑。

2026年7月22日,香港城市大学研究团队于arXiv平台首发智能体安全专项基准数据集OpenSkillRisk,聚焦第三方技能引入的潜在风险量化评估,为大模型智能体的安全测试、防御机制迭代及行业安全治理提供标准化公共支撑。

印度德里信息技术学院联合本土多所研究机构于2026年7月22日在预印本平台arXiv首发ENTRAP-VL专用数据集,聚焦视觉-语言模型双上下文牵引现象的行为评估,为跨模态AI可信性研究及产业落地提供标准化评估支撑。

研究团队于2026年7月23日在预印本平台arXiv发布大规模波斯语合成OCR数据集Persian Pixel,覆盖34.3万对高保真图像-文本标注,可直接用于波斯语OCR模型训练、合成文档图像生成等场景,破解波斯语文字识别领域长期面临的高质量标注数据稀缺痛点。

德国哈根大学研究团队于2026年7月22日在学术预印本平台arXiv首发GouDa合成数据集工具,支持自定义生成多格式拟真数据并可控注入20余种常见数据错误,可为数据清洗评估、机器学习模型测试、数据质量研究等场景提供可复现的标准化基准参照。

2026年7月22日,同济大学在arXiv平台首发面向高分辨率三维占据预测的专用数据集TJScenes,该数据集聚焦动态校园非道路场景,可支撑自动驾驶、服务机器人领域的细粒度场景理解技术迭代,弥补现有主流公开数据集偏道路场景的供给缺口。

2026年7月22日,卡塔尔哈马德·本·哈利法大学联合相关机构在预印本平台arXiv首发细粒度阿拉伯语问答幻觉检测基准数据集HalluTruthQA,该数据集覆盖四大知识密集领域,为阿拉伯语大模型的事实可靠性评估提供多维度标准化框架,将推动阿拉伯语自然语言处理领域的幻觉治理研究落地。

2026年7月23日,天津大学联合相关机构在预印本平台arXiv首发全球首个针对斯里兰卡社会价值观对齐的资源套件LKValues,可有效解决大模型在多元文化场景下的偏见问题,为低资源语言模型微调、跨文化AI落地提供核心数据支撑。

上海交通大学联合华东理工大学研究团队于2026年7月22日在arXiv首发Dream of the Red Chamber corpus数据集,该数据集基于古典名著《红楼梦》构建高质量中日双语文化负载语料,将为跨文化机器翻译性能评估、大语言模型文化翻译能力优化提供核心基准支撑。

欧洲领先数字人文研究机构丹麦奥胡斯人文计算中心(CHCAA)黄金矩阵项目团队于2026年7月23日在HuggingFace首发CHR_detection_trees绘画主题分割数据集,基于4727幅19世纪北欧绘画的结构化标注生成,可广泛应用于艺术史图像分析、实例分割等领域,为人文与计算机交叉研究提供高质量数据支撑。

2026年7月23日,艾伦人工智能研究所(Allen Institute for AI)在HuggingFace平台首发deepresearch-bench多语言基准数据集,面向文本生成模型的文章写作任务打造多维度、细粒度的人工标注评估框架,可广泛应用于大模型性能评测、AI写作工具质量校准等场景。

AI技术服务商Trelis于2026年7月23日在HuggingFace平台首发tiron-eval-meetings会议语音评估数据集,为自动语音识别、说话人日志技术提供统一的基准测试工具,将有效降低语音AI相关研发的评测成本,推动智能办公场景技术落地。

2026年7月21日,新加坡管理大学联合相关机构在预印本平台arXiv首发全球迄今为止规模最大的科学代码语料库SCICODEPILE,该数据集覆盖多学科科研场景,配套可执行评测框架,将为AI for Science领域的代码大模型研发提供核心基础设施支撑。

国内AI技术厂商地平线联合南洋理工等机构正式发布大规模4D场景理解数据集InsScene4D-147K,该数据集于2026年7月22日首发于arXiv,覆盖真实/合成、静态/动态多场景共14.7万份样本,可支撑4D场景理解、实例空间跟踪等下游AI任务,解决动态环境下长序列几何-实例一致性预测的训练数据痛点。

Meta AI于2026年7月22日在arXiv首发多模态事实完整性基准数据集Gamut,针对当前大模型评测仅关注事实精确性、忽略完整性的行业痛点,为多模态及纯文本生成系统提供更严谨的事实性评估框架。

国际审计咨询机构Forvis Mazars联合法国学术机构于2026年7月22日在预印本平台arXiv首发美国企业财报欺诈检测综合数据集,该数据集整合多维度财务数据、文本信息与官方欺诈标签,可广泛应用于财务欺诈识别、金融风控模型评估等场景,为破解传统风控模型泛化能力高估的行业痛点提供基础支撑。

2026年7月21日,阿里巴巴集团于预印本平台arXiv首发ASAP dataset数据集。该数据集为Kaggle自动学生评估竞赛配套的英文作文评分基准数据集,覆盖12978篇带统一人工评分标签的真实学生作文,将为自动作文评分、个性化教育反馈等场景提供标准化数据支撑,推动教育评估技术数字化迭代。

阿里巴巴集团联合清华大学于2026年7月22日在预印本平台arXiv首发大规模多模态基准数据集ExpertVerse-100K,通过高知识密度的全链路标注样本体系,为生成式AI在专业领域的跨模态推理能力训练、效果评估提供标准化支撑,将有效推动知识密集型视觉合成、多跳知识推理等前沿AI技术的落地应用。

欧洲空间局于2026年7月21日在arXiv首发全球最大规模农田边界实例分割数据集FBIS-73M,该数据集整合多分辨率卫星影像与全球地籍数据资源,为农业遥感制图、粮食安全评估、农田碳核算等领域的地理空间AI模型训练提供核心基础支撑。