华为诺亚方舟实验室主任李航:神经符号处理开启自然语言处理新篇章互联网+

雷锋网 2017-07-26 19:57
分享到:
导读

现在自然语言处理,这是为什么自然语言处理(甚至是广义的人工智能)都非常具有挑战性的原因,介绍自然语言处理相关的技术。

雷锋网按:7 月 23 日,第二届语言与智能峰会在北京举行,华为诺亚方舟实验室主任李航以《神经符号处理开启自然语言处理新篇章》作了报告,就自然语言领域的发展、神经符号处理对自然语言处理的影响等方面阐述了他的看法。 李航博士,华为诺亚方舟实验室主

  雷锋网按:7 月 23 日,第二届语言与智能峰会在北京举行,华为诺亚方舟实验室主任李航以《神经符号处理开启自然语言处理新篇章》作了报告,就自然语言领域的发展、神经符号处理对自然语言处理的影响等方面阐述了他的看法。

  李航博士,华为诺亚方舟实验室主任,北京大学、南京大学客座教授,IEEE Fellow、ACM 杰出科学家,研究方向包括信息检索、自然语言处理、统计机器学习以及数据挖掘。

  深度学习(神经处理)给自然语言处理带来了革命性的进步,基于深度学习的机器翻译等任务的性能优良大幅度的提升。面向未来,自然语言处理技术将如何发展和演进?在哪些方面会有新突破?

  以下为李航博士演讲内容实录,雷锋网做了不改变原意的编辑。

  今天想跟大家一起看一下,我们现在一个主要研究的方向,也希望跟大家一起推动的这个研究方向,它是神经符号处理。

  神经符号处理是未来自然语言处理非常重要的一个方向,这个报告大概分以下几个部分:

  一,对自然语言领域做一个概述。我从我的角度把最近几个报告的主要观点,再重新梳理一下。

  二,为什么我们觉得神经符号处理是未来重要的一个研究方向,它的主要应用就是更广义的问答(我们叫智能信息知识管理系统)。同时,介绍一些业界的相关工作和我们自己做的一些研究。

  三,抛砖引玉,大家一起探讨一些相关的问题。

  自然语言处理的终极目标是做自然语言理解,就是让计算机能够理解人类的语言。具体来说有两个方面:像人一样能够去说话;像人一样能去阅读。理解大概有两层定义:基于表示的;基于行为的。

  如果计算机系统听到一句话,它能够对应它内部的表示,我们就认为这个计算机理解了这个语言。或者是基于行为的,机器人(行情300024,诊股)听到一句话,能够按照话的内容去做一些行为,就认为这个机器人理解了这个自然语言。我们这个领域终极目标就是,期望我们能够开发出这个技术,使计算机能达到这样的智能识别。

  但我们也知道,语言其实是一个非常复杂的现象,不做自然语言处理、人工智能,可能人类自己都不知道,我们自己的语言是这么复杂的一个现象。让我来总结的话,语言有五个特性,使得我们把语言放在计算机上,变得非常具有挑战性。

  既有规律又有很多例外;

  组合性;

  递归性,造成了语言非常复杂;

  比喻性;

  语言的本质就是产生新的语言进行表示,其实都是在做比喻。所以,比喻性是语言非常重要的特性。语言的理解跟世界知识是密切相关的,如果你撇开了知识这些东西谈语言,其实都是无从谈起的。

  交互性。

  我们人类的语言其实是人跟外界做互动的一种手段,离开了对外环境的交互,谈论语言其实也是没有意义的。所以,因为语言有这么复杂的特性,使得我们在计算机上去实现自然语言理解,非常具有挑战性的。这就相当于这些特性使得我们要用现在的技术做计算的话,基本上都是做全局搜索,全局的这种计算还不知道该怎么做。这是非常复杂,具有挑战性的。

  主要原因有以下几点:

  原因一,最近写的一篇文章,在计算机学会通讯上,叫做迎接自然语言处理新时代,有这样一些观点,做了比较详细的介绍和总结。而在去年在中文信息处理大会上报告的内容,也是这个观点。

  原因二,我们现在总结看的话,为什么自然语言处理这么难,因为本质的原因就是,我们还不知道,是不是能够用数学的模型刻画语言现象,这个是自然语言处理的本质。这件事情可能不可能做我们不知道,我们只能是部分地实现这个目标。

  所以,这是为什么自然语言处理(甚至是广义的人工智能)都非常具有挑战性的原因。

  现实当中大家采用的办法,我们不叫自然语言理解,而是叫自然语言处理。我们的策略是,把人类做语言理解的这个复杂过程进行简化。

  第一个,我们现在能去做的事情。人类要是理解语言的话,比如人做这种问答,问我姚明身高是多少,我想一想可能是 2 米 29。我回答的这个过程,可能包含了多个步骤。比如语言的分析、理解、推理、知识的检索,最后做判断,最后产生我的回答,是一个非常复杂的过程。

  但是,我们现在要用计算机来做这种智能问答或者知识问答的时候,其实我们大幅度地简化了这个过程。就是只做分析、检索和生成。今天大会里面有很多老师做报告,介绍自然语言处理相关的技术,基本上做问答的时候,都是把这个问答的过程简化。

  第二个,现在自然语言处理,非常主流的做法就是数据驱动。我们主要的核心技术是机器学习,现在是用深度学习来做。同时,我们把人的知识放进去。深度学习的重要的特点是,整个技术其实是一种机器学习,但是它的模型是从人的大脑处理机制中得到启发,然后我们定义这个模型。

  所以,现在人工智能、自然语言处理,我们采用的基本工具是机器学习,尽量能够把人的知识导入进来,同时让这个模型尽量去参考跟人一样的处理机制,实现自然语言处理。

  现实当中,我们看到深度学习、大数据,确实给自然语言处理带来了很多新契机。这条路到目前为止看,是最有希望能够再往前推进的一条路。

  这个观点前年在一次大会上我作报告介绍的观点,也是在计算机学会通讯上有写过一篇文章,简论 AI,就是这里面介绍的观点。

  大家也看到,我们现在的自然语言处理包括人工智能都是这样一个过程。基于数据,我们的系统有了用户,之后我们根据数据改进算法、改进系统,使系统的性能不断提高。在人工智能闭环的时候,我们就可以不断地去给用户提供更好的服务,使得我们这个系统变得更加智能化。

  我们看一些自然语言处理技术,就是说数据驱动,自然语言处理大概有五类技术,我们用数学建模,用统计机器学习办法建模,基本上就是这五类模型。主要的应用、方法基本上都属于这五类技术,包括分类、匹配、翻译、结构预测和序列决策过程。

  分类。文字的序列,我们要打印标签,这是我们常做的最基本的自然语言处理。

  匹配。两个文字序列都匹配,看它们匹配的程度,最后输出一个非负的实数值,判断这两个文字序列它们的匹配程度。

  翻译。把一个文字序列,转换成另外一个文字序列。

  结构预测。你给我一个文字序列,让它形成内部结构的一个信息。

  序列决策过程。在一个复杂的动态变化环境里面,我们怎么样不断去决策。比如描述序列决策过程的马尔可夫随机过程,这是一个有效的、非常常用的数学工具。

语言 处理 自然 过程 非常
分享到:

1.TMT观察网遵循行业规范,任何转载的稿件都会明确标注作者和来源;
2.TMT观察网的原创文章,请转载时务必注明文章作者和"来源:TMT观察网",不尊重原创的行为TMT观察网或将追究责任;
3.作者投稿可能会经TMT观察网编辑修改或补充。


观点约架