艾伦人工智能研究所发布deepresearch-bench多语言基准数据集 为文本生成模型写作质量评估提供标准化标尺
随着通用大语言模型技术的快速迭代,AI文本生成能力已经从“可生成通顺内容”向“可产出高质量、符合特定场景需求的专业内容”升级,而长文本写作能力的评估,始终是行业面临的共性痛点——过往的评估体系要么维度单一、缺乏统一标尺,要么仅覆盖单语言场景,无法支撑跨语言模型的横向对比,也难以为模型写作能力的精细化迭代提供明确的优化方向。
2026年7月23日,全球顶尖AI研究机构艾伦人工智能研究所(Allen Institute for AI)正式发布专门解决上述痛点的基准数据集deepresearch-bench,首发渠道为全球最大的AI模型与数据集开源社区HuggingFace。作为聚焦文章写作任务的专项评估基准,该数据集为文本生成模型的性能评测提供了标准化的参考体系。
目前deepresearch-bench共开放三个配置的数据集版本:包含100个样本的通用版本(default)、包含50个样本的英文专项版本(en)与包含50个样本的中文专项版本(zh),覆盖中英两大主流语言场景,可同时满足中文大模型、英文大模型以及跨语言大模型的写作能力评测需求。每个数据样本均包含唯一标识符(id)、语言类型(language)、主题(topic)、生成指令(prompt)、参考文章(reference_article)以及结构化的评估标准(criteria)六大核心字段,所有评估标准均经过专业人工标注校准,保障评测结果的客观性。
该数据集的评估标准体系共设置四大核心维度,分别为可读性(readability)、洞察力(insight)、全面性(comprehensiveness)和指令遵循(instruction_following),每个维度都配套明确的权重分配与可落地的具体评判准则,涵盖标准描述、解释说明、权重值三大内容,避免了过往评估中主观判断占比过高的问题。其中,可读性维度重点评估生成内容的逻辑通顺度、表达规范性;洞察力维度关注内容是否具备独立观点、信息增量;全面性维度考核内容对指定主题的覆盖完整度;指令遵循维度则判断生成内容是否匹配prompt提出的格式、风格、内容边界等要求。
从应用场景来看,deepresearch-bench既可以用于大模型研发过程中的性能评测,为模型的写作能力迭代提供明确的优化目标;也可以为AI写作工具厂商提供内容质量评估的统一框架,帮助其筛选更符合用户需求的模型输出结果;在学术研究领域,该数据集还可以作为文本生成方向研究的通用基准,解决不同研究团队评测标准不统一、实验结果无法横向对比的行业痛点。作为AI基础数据要素体系的重要组成部分,高质量的基准评测数据集是推动AI技术向精细化、场景化升级的核心基础设施,本次deepresearch-bench的发布,也为全球文本生成技术从“可用”向“好用”升级提供了重要的支撑工具。





_1769672084863.jpg)