2019-07-06 11:55:12 网易科技 编辑:玉米 浏览数:23集趣网
脸书人工智能研究中心的肖恩·瓦斯奎兹(Sean Vasquez)和迈克·刘易斯(Mike Lewis)于本周表示,他们已经努力模仿人类语言有一段时间了。然而,模仿人类语言显然是件难事,当人们听到斯蒂芬·霍金所使用的那套最...“”
脸书人工智能研究中心的肖恩·瓦斯奎兹(Sean Vasquez)和迈克·刘易斯(Mike Lewis)于本周表示,他们已经努力模仿人类语言有一段时间了。然而,模仿人类语言显然是件难事,当人们听到斯蒂芬·霍金所使用的那套最著名的说话机器发声时,会发现它听起来仍然很不像人类。
但是现在,研究员们似乎已经取得了进展。如果你听了盖茨的克隆所发出的声音,我想你是会同意的。因为它听起来很像比尔·盖茨,你甚至很难分辨出它和他真实声音的区别。
研究人员展示了他们的研究。在这里,机器模仿着盖茨的腔调发声,“请给你珍爱的朋友发一封充满爱意的短信。”其中最不可思议的是,这台机器在说“珍爱(cherish)”时,准确无误地捕捉到盖茨不断上升的语调变化的。
这项技术被称为MelNet,可以用来人类的语调。到目前为止,盖茨和其他许多人的声音都被它完美地再现了。瓦斯奎兹和刘易斯说,克隆的音频取自各类Ted演讲。
两位研究人员还表示,直到最近,文本到语音转换软件还不能很好地工作的原因是它使用了波形图记录声音。这些图显示了声音在几秒钟内的音阶变化。如果你听到过盖茨说“珍爱”这个词,就知道他的语气是变化剧烈的。在试图模仿一个人的时候,深度学习机器必须预测到所有这些细微的变化,这很不容易。
瓦斯奎兹和刘易斯说,他们通过使用一种叫做光谱图的东西来训练机器,成功地克隆了声音。
研究人员说:“光谱图的时间轴比波形图的时间轴紧凑几个数量级,这意味着在波形中跨越数万个时间步长的依赖关系在光谱图中只跨越数百个时间步长。这使得我们的光谱图模型能够在数秒内记录各种语音和音乐样本,并保持它们一致性。”
不过,他们也经历了一些挫折。研究小组表示,对他们来说,几乎完美地一个句子并不难,难的是那些在长达几十秒或几分钟的时间里,显示了情绪变化的复杂语调”。尽管如此,当涉及到人机交互时,研究小组说,在只涉及简短对话的情境中,这项技术可能会带来革命性的变化。
版权与免责声明:
凡未注明"稿件来源"的内容均为转载稿,本网转载出于传递更多信息的目的;如转载稿涉及版权问题,请作者联系我们,同时对于用户评论等信息,本网并不意味着赞同其观点或证实其内容的真实性;
本文地址:http://www.zjzgh.net/news/2019/07/06/92334617.html
转载本站原创文章请注明来源:集趣网
“”
IT之家10月30日消息 荣耀MagicBook Pro Linux版16.1寸全面屏轻薄笔记本电脑11月1日将在京东平...[详细]
“”
有人爆出了在微博借钱提现可以让点赞数翻倍的消息,借款后利息年化利率高达 54% ,比高利贷还黑。另外有位网友在今年 6 ...[详细]
“”
2019年11月9日——一年一度购物狂欢节“双11”即将到来,而育碧游戏商城也在这个特殊的节日为中国地区的玩家开启了专属...[详细]
“”
IT之家11月2日消息 苹果iOS 13.2正式版更新本应该是为了解决iOS 13初始版本带来的错误或问题,并添加了一些...[详细]
“”
IT之家11月17日消息 随着2019年接近尾声,英特尔和AMD的主流CPU也都已经发布完毕,知名硬件类外媒AnandT...[详细]