[发明专利]将中英混合及语气标签化的数据标注方法及装置有效

专利信息
申请号: 201911404092.9 申请日: 2019-12-31
公开(公告)号: CN111145719B 公开(公告)日: 2022-04-05
发明(设计)人: 戴健;周伟东;刘华;刘凯;喻凌 申请(专利权)人: 北京太极华保科技股份有限公司
主分类号: G10L13/02 分类号: G10L13/02;G10L13/033;G10L15/06;G10L15/26;G10L25/30
代理公司: 北京艾格律诗专利代理有限公司 11924 代理人: 王子溟
地址: 102200 北*** 国省代码: 北京;11
权利要求书: 查看更多 说明书: 查看更多
摘要:
搜索关键词: 将中英 混合 语气 标签 数据 标注 方法 装置
【权利要求书】:

1.一种将中英混合及语气标签化的数据标注方法,其特征在于,所述方法包括:

从数据源中抓取训练文本,所述训练文本涵盖有中英文字符;

为所抓取的所述训练文本添加情感标签;

记录发音人根据情感标签标注后的训练文本的朗读音频文件,作为训练用音频文件;

核检训练用音频文件与对应的训练文本的情感标签是否一致,不一致的部分对音频文件进行修订;

将训练文本映射为文本向量,将文本向量及发音人的朗读音频文件,提交给神经网络的深度学习引擎进行训练,通过深度学习训练,学习中文、英文、情感标签的各种组合搭配下的文本的发音特点。

2.根据权利要求1所述的标注方法,其特征在于,所述将训练文本映射为文本向量,包括:

对所述训练文本中的文字、数字及英文字符进行读音标注,将标注后的读音中的字母按字母与标定数字之间的对应关系,将句子标注的语音转换为数字串,将文字对应的声调转换为对应的数字,将句子的情感标签转换为对应的数字标识;音素之间以设定标识符标识,将该设定标识符转换为数字;

将转换为数字串的文本映射成向量。

3.根据权利要求2所述的标注方法,其特征在于,所述方法还包括:

对训练文本中的文字进行儿化音进行标注,文字的轻声不进行标注;

在将标注后的文本映射成向量之前,将文字对应的声调中的儿化音转换为对应的数字。

4.根据权利要求1所述的标注方法,其特征在于,对音频文件进行修订后,所述方法还包括:

音频文件修订后无法达到需求时,将音频文件删除或基于音频文件对应的训练文本重新进行朗读而重新生成音频文件。

5.一种将中英混合及语气标签化的数据标注装置,其特征在于,所述装置包括:

抓取单元,用于从数据源中抓取训练文本;所述训练文本涵盖有中英文字符;

添加单元,用于为所抓取的所述训练文本添加情感标签;

记录单元,用于记录发音人根据情感标签标注后的训练文本的朗读音频文件,作为训练用音频文件;

核检单元,用于核检训练用音频文件与对应的训练文本的情感标签是否一致,不一致时触发修订单元;

修订单元,用于对训练用音频文件的与对应的训练文本不一致的部分进行修订;

映射单元,用于将训练文本映射为文本向量;

训练单元,用于将文本向量及发音人的朗读音频文件,提交给神经网络的深度学习引擎进行训练,通过深度学习训练,学习中文、英文、情感标签的各种组合搭配下的文本的发音特点。

6.根据权利要求5所述的标注装置,其特征在于,所述映射单元,还用于对所述训练文本中的文字、数字及英文字符进行读音标注,将标注后的读音中的字母按字母与标定数字之间的对应关系,将句子标注的语音转换为数字串,将文字对应的声调转换为对应的数字,将句子的情感标签转换为对应的数字标识;音素之间以设定标识符标识,将该设定标识符转换为数字;

将转换为数字串的文本映射成向量。

7.根据权利要求6所述的标注装置,其特征在于,所述映射单元,还用于对训练文本中的文字进行儿化音进行标注,文字的轻声不进行标注;

在将标注后的文本映射成向量之前,将文字对应的声调中的儿化音转换为对应的数字。

8.根据权利要求5所述的标注装置,其特征在于,所述修订单元,还用于:

对音频文件进行修订后,确定音频文件修订后无法达到需求时,将音频文件删除或基于音频文件对应的训练文本重新进行朗读而重新生成音频文件。

下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京太极华保科技股份有限公司,未经北京太极华保科技股份有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/pat/books/201911404092.9/1.html,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top