浙江完成短视频场景分类标注训练数据知识产权登记 覆盖6大类场景适配多领域需求
当前我国数据要素市场化建设进入合规落地的关键阶段,数据知识产权登记作为明确数据权属、保障数据合法流通的核心基础设施,正在为高价值数据资产的市场化应用扫清制度障碍。作为数字内容产业规模最大的赛道之一,国内短视频行业近年来AI驱动的内容分发、场景化投放、智能内容治理等业务快速发展,对标准化、合规化的标注训练数据需求持续攀升,但训练数据权属不清晰、标注标准不统一、合规性不足等问题长期制约行业效率提升。本次登记事件正是行业需求与制度落地结合的典型成果。
本次登记的数据集主要面向短视频平台、品牌投放方、内容服务商三类核心主体,可广泛应用于多个典型场景:对短视频平台而言,基于该数据集训练的分类模型可大幅提升内容推荐精准度,优化用户内容消费体验,降低无效信息推送占比;对品牌方而言,可实现美妆、运动器材、食品等不同品类商品与短视频场景的精准匹配,提升场景化投放的转化效率;对内容服务商而言,可替代大量人工标注工作,实现海量短视频的快速自动归类,降低内容运营成本。
杭州晨伴芯曜科技有限公司本次登记的数据知识产权短视频内容场景类型分类标注训练数据,适用于短视频场景识别、内容检索、推荐分发和商业投放匹配。通过融合关键帧图像特征与去标识化字幕语义,并计算主场景持续时长和时长占比,可形成办公学习、运动健身、室内生活、餐饮美食、购物消费和户外自然六类场景标签,为场景分类模型训练、同类视频自动归类和内容运营提供结构化数据。使用时需同时取得可辨认主要环境和活动对象的视频画面、关键帧及对应字幕。数据使用方可结合主场景识别依据回查画面与文本证据,利用持续时长和时长占比评价场景稳定程度,并按数据集划分标识完成模型训练、验证和测试。
一、加工前的数据说明:
原始数据来源于企业自有内容平台的短视频、字幕和时间轴记录,原始字段包括视频编号、内容类别、原始视频、字幕文本和视频时长,从源头保障了数据权属清晰无争议。
二、处理规则:
1.数据清洗:按视频编号去重,删除视频损坏、字幕或时长缺失及与任务无关的记录;统一视频方向、字幕编码和空白符,对字幕中的身份信息进行不可逆去标识化,完全符合数据安全、个人信息保护相关法律法规要求。
2.特征融合:按视频时间轴抽取能够反映环境、人物活动和主要物体的关键帧,图像分类模型从画面中提取场所、对象和动作特征;文本分类模型对字幕文本脱敏值进行分词和语义编码,提取与场景相关的活动及环境表达。将两类模型输出按同一六类场景体系进行对应,综合比较画面与字幕证据的一致方向,确定占主要内容的场景类型;同时记录关键帧图像编号,并将支持分类的画面特征和字幕语义整理为主场景识别依据,确保标注结果可追溯可核验。
3.时长计算:聚合同一场景的连续帧得到主场景持续时长,主场景时长占比=主场景持续时长/视频总时长,采用十进制定点四舍五入保留三位小数。关键帧时间和主场景持续时长均不得超过视频总时长,为场景稳定度评估提供量化支撑。
4.算法校验:逐条复算主场景时长占比,核对关键帧时间、主场景持续时长、视频总时长、内容场景类型和主场景识别依据之间的一致性。画面或字幕证据不能支持所选场景类型的记录不进入最终数据集,相同核心场景签名仅保留一条;按视频匿名编号和“字幕文本脱敏值+内容场景类型+主场景识别依据”核心场景签名联合分组,并按场景类型分层以8:1:1划分训练集、验证集和测试集,避免同一视频或相同核心场景内容跨集合出现,保障数据集用于模型训练的科学性。
三、数据内容描述:
最终形成结构化的短视频内容场景类型分类标注训练数据集合,包含以下字段:1)样本编号:样本匿名唯一标识;2)视频匿名编号:视频去标识化编号;3)内容类别:短视频内容;4)关键帧时间(秒):关键帧在视频中的时间;5)关键帧图像编号:关键帧图像匿名标识;6)字幕文本脱敏值:去除身份信息后的字幕;7)主场景持续时长(秒):主场景连续出现的时长;8)视频总时长(秒):视频总时长;9)主场景时长占比:主场景持续时长与视频总时长之比;10)内容场景类型:办公学习、运动健身、室内生活、餐饮美食、购物消费或户外自然;11)主场景识别依据:支持场景分类的画面与文本证据;12)数据集划分标识:训练集、验证集或测试集,全字段覆盖模型训练所需的各类维度,可直接投入使用。
本次数据集的成功登记,是浙江省数据知识产权制度在数字内容领域落地的重要成果,既为数据持有方的合法权益提供了官方背书,也为下游使用方消除了数据合规风险,对推动国内数据要素市场的规范化发展、加速AI技术在内容产业的落地应用具有重要的示范意义。





_1769672084863.jpg)