哥伦比亚大学联合四校发布CaptchaArena数据集 赋能验证码安全与智能体交互研发
随着生成式AI与通用智能体技术的快速落地,验证码作为人机身份核验的核心技术工具,其形态已经从早期的静态字符识别逐步迭代为多模式交互式验证,同时,智能体要实现全场景自主网页操作,也需要具备复杂验证码的自主交互能力——但此前全球范围内针对交互式验证码的训练数据集普遍存在类型覆盖不全、交互场景单一、标注颗粒度不足等问题,极大限制了相关领域的技术研发。2026年9月26日,由哥伦比亚大学牵头,联合浙江大学、罗切斯特大学、伊利诺伊大学厄巴纳-香槟分校共同构建的大规模细粒度人机交互验证码训练数据集CaptchaArena正式首发于预印本平台arXiv,为相关研究提供了高质量的基础数据支撑。据介绍,CaptchaArena共包含50000个交互式验证码谜题,覆盖20种主流验证码类型和单击、多击、箭头循环、实时、文本输入共5种交互模式,同步配套50000条屏幕截图-动作轨迹配对数据,其中46000条数据附带逐步推理注释。所有谜题均通过执行验证并经过人工质量检查,针对不规则目标还额外提供像素级掩码注释,数据质量能够满足高要求的模型训练需求。从应用价值来看,该数据集可覆盖两大核心研发方向:其一在网络安全领域,可用于训练更先进的验证码识别模型,反向推动互联网平台迭代验证码防护体系,提升电商、金融、社交等场景对抗网络黑灰产批量爬取、账号盗用、虚假交易等风险的能力;其二在智能体研发领域,细粒度的动作轨迹与推理标注可帮助网页智能体、RPA机器人学习不同验证码场景下的交互逻辑,提升智能体在跨平台自动化操作任务中的完成率,可支撑政务服务自动化办理、企业合规巡检、电商运营自动化等多个场景的智能体技术落地。作为当前全球覆盖类型最广、标注颗粒度最高的交互式验证码专项训练数据集,CaptchaArena的发布填补了现有训练资源在类型覆盖、交互保真度和轨迹监督之间的空白,也为后续垂直场景AI训练数据集的构建提供了标准参考,对数据要素支撑AI细分领域研发具有典型示范意义。





_1769672084863.jpg)