国内首次！这家中国企业的语言AI实力被公认全球(2)-语言研究

一、稿件要求： 1、稿件内容应该是与某一计算机类具体产品紧密相关的新闻评论、购买体验、性能详析等文章。要求稿件论点中立，论述详实，能够对读者的购买起到指导作用。文章体裁不限，字数不限。 2、稿件建议采用纯文本格式(*.txt)。如果是文本文件，请注明插图位置。插图应清晰可辨，可保存为*.jpg、*.gif格式。如使用word等编辑的文本，建议不要将图片直接嵌在word文件中，而将插图另存，并注明插图位置。 3、如果用电子邮件投稿，最好压缩后发送。 4、请使用中文的标点符号。例如句号为。而不是.。 5、来稿请注明作者署名(真实姓名、笔名)、详细地址、邮编、联系电话、E-mail地址等，以便联系。 6、我们保留对稿件的增删权。 7、我们对有一稿多投、剽窃或抄袭行为者，将保留追究由此引起的法律、经济责任的权利。二、投稿方式： 1、请使用电子邮件方式投递稿件。 2、编译的稿件，请注明出处并附带原文。 3、请按稿件内容投递到相关编辑信箱三、稿件著作权： 1、投稿人保证其向我方所投之作品是其本人或与他人合作创作之成果，或对所投作品拥有合法的著作权，无第三人对其作品提出可成立之权利主张。 2、投稿人保证向我方所投之稿件，尚未在任何媒体上发表。 3、投稿人保证其作品不含有违反宪法、法律及损害社会公共利益之内容。 4、投稿人向我方所投之作品不得同时向第三方投送，即不允许一稿多投。若投稿人有违反该款约定的行为，则我方有权不向投稿人支付报酬。但我方在收到投稿人所投作品10日内未作出采用通知的除外。 5、投稿人授予我方享有作品专有使用权的方式包括但不限于：通过网络向公众传播、复制、摘编、表演、播放、展览、发行、摄制电影、电视、录像制品、录制录音制品、制作数字化制品、改编、翻译、注释、编辑，以及出版、许可其他媒体、网站及单位转载、摘编、播放、录制、翻译、注释、编辑、改编、摄制。 6、投稿人委托我方声明，未经我方许可，任何网站、媒体、组织不得转载、摘编其作品。

国内首次！这家中国企业的语言AI实力被公认全球(2)

作者:

关键词:

摘要：

企业正在开发大规模语言模型，以提供更广泛的语言服务。主要云服务商正在利用其云基础设施开发专有语言模型。较小的供应商正在利用开源软件、数据和机器学习模型进行竞争。

业界通行的端到端语音识别 (End-to-End ASR) 技术，在单语种任务上效果很好，但一切换到多语种混说 （Code-Switch）场景下，还是不太理想。

今天回归本源，讲点不那么玄幻的。AI为什么会进化？底层其实没有秘密，无非是语言、视觉等几大基本功。

语言AI，包含语音、语义两个大类。

据了解，目前阿里达摩院语音语义领域的研究已有300百多篇论文被国际顶会收录，相关研究已应用于医疗、电力、电商等领域。

另一方面，这背后的技术也产生了革命性的迭代变迁，例如近几年Transformer、Bert等技术的爆发，极大地推动了语音语义技术的发展。

人类语言并不难，几岁孩童便可轻松掌握一门语言。但计算机有自己的编程语言，要它理解人类语言难如登天。

看多了这种故事，你是不是也觉得，AI太卷了，要上天了。

达摩院的语音AI，在常规的近场语音识别、远场语音场景、多人交谈“鸡尾酒会场景”语音识别技能之外，还有一些别致的长尾技能，比如“中英自由说”、“方言自由说”。

就像中国计算机学会副理事长、澜舟科技创始人兼CEO周明所评价的那般：

也就是以通用的预训练模型为基础，加入简单的任务层、结合少量场景语料，以较低成本训练出优质的任务模型。

除了语音AI技术之外，阿里在语义层面同样形成了一套强大的技术体系。

在人工智能发展长河中，语音语义是最早起步的技术之一，也是人工智能的基石。

在端到端语音识别模型中，对中文和英文分别设计了一个子网络，最后通过门控模块对每个子网络的输出进行加权。

例如StructBERT，是达摩院在谷歌BERT模型基础之上所提出的优化模型，它可以让机器更好地掌握人类的语法、理解自然的语言。

达摩院的阿里的大规模预训练语言模型体系，拥有阅读、写作、翻译、问答、搜索、摘要生成、对话等多种能力。

为了减少模型参数量，中、英文子网络采用底层共享，高层独立的方式。最终使模型在中文、英文、中英文混说场景下都能取得比较好的效果。

阿里在语音识别、自然语言生成/语音合成、语言理解/处理、文本分析这几项关键能力都获得了最高分。

达摩院的AI技术主要通过阿里云对外提供服务，以“被集成”方式，广泛应用于运营商、电商、物流、电力等多个行业。

最近，咨询机构Gartner发布《云AI开发者服务关键能力报告》，对全球云服务商的AI能力做了排行。

NLP技术的进化，是AI从感知智能向认知智能演进的前提。而在过去十几年内，NLP技术进化最具标志性的事件，就是大规模预训练语言模型的出现。

— 完 —

去年年中，北京首都机场和大兴机场均开通了语音购票的服务，只需要乘客张张嘴说出目的地，便可以在1.6秒内快速完成选站。

“前大模型时代”，NLP技术解决问题的方法，是为每个任务单独设计模型。模型开发往往很复杂，缺乏算力、数据、技术力量的中小团队往往难以负担。

大模型通常并不直接用于解决应用问题，而是通过与具体任务、应用场景的结合，逐层孵化“中模型”、“小模型”。

达摩院在语音AI领域最早以语音识别技术起家，技术能力涵盖语音识别声学模型和基础框架、说话人区分、语音合成声学模型和声码器、口语语言处理、联合优化的声学前端等。

这一系列突破将给各行各业乃至个人生活带来巨大的价值，很高兴看到以阿里巴巴为代表的的中国科技公司在该领域进入了世界第一梯队。”

此前，IDC发布《2021H2中国AI云服务市场研究报告》中，阿里在语音和语义市场上的份额便取得了第一的成绩。

语音技术最早可以追溯到1952年，贝尔实验室的Davis等人研制出了世界上第一个能识别10个英文数字发音的实验系统Audry，从此拉开了语音识别发展的序幕。

语言AI这一项，第一名毫不意外是谷歌

文章来源：《语言研究》网址: http://www.yyyjzzs.cn/zonghexinwen/2022/0708/1449.html