院士陆汝铃:六问机器学习

陆汝铃,中国科学院数学与系统科学研究院数学研究所研究员、复旦大学教授。在知识工程和基于知识的软件工程方面作了系统的、创造性的工作,是中国该领域研究的开拓者之一。1999年当选为中国科学院院士。

在人工智能界有一种说法,认为机器学习是人工智能领域中最能体现智能的一个分支。从历史来看,机器学习似乎也是人工智能中发展最快的分支之一。

在二十世纪八十年代的时候,符号学习可能还是机器学习的主流,而自从二十世纪九十年代以来,就一直是统计机器学习的天下了。不知道是否可以这样认为:从主流为符号机器学习发展到主流为统计机器学习,反映了机器学习从纯粹的理论研究和模型研究发展到以解决现实生活中实际问题为目的的应用研究,这是科学研究的一种进步。

 

平时由于机器学习界的朋友接触多了,经常获得一些道听途说的信息以及专家们对机器学习的现状及其发展前途的评论。在此过程中,难免会产生一些自己的疑问。借此机会把它写下来放在这里,算是一种“外行求教机器学习”。

◆ ◆ ◆

一问:符号学习该何去何从

 

问题一:在人工智能发展早期,机器学习的技术内涵几乎全部是符号学习。可是从二十世纪九十年代开始,统计机器学习犹如一匹黑马横空出世,迅速压倒并取代了符号学习的地位。人们可能会问:在满目的统计学习期刊和会议文章面前,符号学习是否被彻底忽略?它还能成为机器学习的研究对象吗?它是否将继续在统计学习的阴影里生活并苟延残喘?

对这个问题有三种可能的回答:一是告诉符号学习:“你就是该退出历史舞台,认命吧!”二是告诉统计学习:“你的一言堂应该关门了!”单纯的统计学习已经走到了尽头,再想往前走就要把统计学习和符号学习结合起来。三是事物发展总会有“三十年河东,三十年河西”的现象,符号学习还有“翻身”的日子。

第一种观念我没有听人明说过,但是我想恐怕有可能已经被许多人默认了。第二种观点我曾听王珏教授多次说过。他并不认为统计学习会衰退,而只是认为机器学习已经到了一个转折点,从今往后,统计学习应该和知识的利用相结合,这是一种“螺旋式上升,进入更高级的形式”,否则,统计学习可能会停留于现状止步不前。王珏教授还认为:进入转折点的表示是Koller等的《概率图模型》一书的出版。至于第三种观点,恰好我收到老朋友,美国人工智能资深学者、俄亥俄大学Chandrasekaran教授的来信,他正好谈起符号智能被统计智能“打压”的现象,并且正好表达了河东河西的观点。全文如下:“最近几年,人工智能在很大程度上集中于统计学和大数据。我同意由于计算能力的大幅提高,这些技术曾经取得过某些令人印象深刻的成果。但是我们完全有理由相信,虽然这些技术还会继续改进、提高,总有一天这个领域(指AI)会对它们说再见,并转向更加基本的认知科学研究。尽管钟摆的摆回还需要一段时间,我相信定有必要把统计技术和对认知结构的深刻理解结合起来。”

 

看来Chandrasekaran教授也并不认为若干年后AI真会回到河西,他的意见和王珏教授的意见基本一致,但不仅限于机器学习,而是涉及整个人工智能领域。只是王珏教授强调知识,而Chandrasekaran教授强调更加基本的“认知”。

 

◆ ◆ ◆

二问:“独立同分布”条件对于机器学习来讲必需吗

问题二:王珏教授认为统计学习不会“一帆风顺”的判断依据是:统计机器学习算法都是基于样本数据独立同分布的假设。但是自然界现象千变万化,王珏教授认为“哪有那么多独立同分布?”这就引来了下一个问题:“独立同分布”条件对于机器学习来讲真的是必需的吗?独立同分布的不存在一定是一个不可逾越的障碍吗?

无独立同分布条件下的机器学习也许只是一个难题,而不是不可解决的问题。我有一个“胡思乱想”。认为前些时候出现的“迁移学习”也许会对这个问题的解决带来一线曙光。尽管现在的迁移学习还要求迁移双方具备“独立同分布”条件,但是不能分布之间的迁移学习,同分布和异分布之前的迁移学习也许迟早会出现?

 

◆ ◆ ◆

三问:深度学习代表了机器学习的新方向吗?


问题三:近年来出现了一些新的动向,例如“深度学习”、“无终止学习”等等,社会上给予了特别关注,尤其是深度学习。但它们真的代表了机器学习的新的方向吗?包括周志华教授在内的一些学者认为:深度学习掀起的热潮也许大过它本身真正的贡献,在理论和技术上并没有太多的创新,只不过是由于硬件技术的革命,计算机速度大大提高了,使得人们有可能采用原来复杂度很高的算法,从而得到比过去更精细的结果。当然这对于推动机器学习应用于实践有很大意义。但我们不禁要斗胆问一句:深度学习是否又要取代统计学习了?

事实上,确有专家已经感受到来自深度学习的压力,指出统计学习正在被深度学习所打压,真如我们早就看到的符号学习被统计学习所打压。不过我觉得这种打压还远没有强大到像统计学习打压符号学习的程度。这一是因为深度学习的“理论创新”还不明显;二是因为目前的深度学习主要适合于神经网络,在各种机器学习的方法百花盛开的今天,它的应用范围还有限,还不能直接说是连接主义方法的回归;三是因为统计学习仍然在机器学习中被有效的普遍采用,“得到多助”,想抛弃它不容易。

◆ ◆ ◆

四问:只有统计方法适合于在机器学习方面应用吗?

 

问题四:机器学习研究出现以来,我们看到的主要是从符号方法到统计方法的演变,用到数学主要是概率统计。但是,数学之大,就像大海,难道只有统计方法适合于在机器学习方面应用吗?

当然,我们也看到看了一些其他数学分支在机器学习上的应用的好例子,例如微分几何在流形学习上的应用,微分方程在归纳学习上的应用。但如果和统计方法相比,它们都只能算是配角。还有的数学分支如代数可能应用得更广,但是在机器学习中代数一般是作为基础工具来使用,例如矩阵理论和特征值理论。又如微分方程求解最终往往归结为代数问题求解。它们可以算是幕后英雄:“出头露面的是概率和统计,埋头苦干的是代数和逻辑”。

是否可以想想以数学方法为主角,以统计方法为配角的机器学习理论呢?在这方面,流形学习已经“有点意思”了,而彭实戈院士的倒排随机微分方程理论之预测金融走势,也许是用高深数学推动新的机器学习模式的更好例子。但是从宏观角度看,数学理论的介入程度还远远不够。这里指的主要是深刻的、现代的数学理论,我们期待着有更多数学家参与,开辟机器学习的新模式、新理论、新方向。

◆ ◆ ◆

五问:符号机器学习时代和统计机器学习时代的鸿沟在哪里?

问题五:上一个问题的延续,符号机器学习时代主要以离散方法处理问题,统计学习时代主要以连续方法处理问题。这两种方法之间应该没有一条鸿沟。

流形学习中李群、李代数方法的引入给我们以很好的启示。从微分流形到李群,再从李群到李代数,就是一个沟通连续和离散的过程。然后,现有的方法在数学上并不完美。浏览流形学习的文献可知,许多理论直接把任意数据集看成微分流形,从而就认定测地线的存在并讨论起降维来了。这样的例子也许不是个别的,足可说明数学家介入机器学习研究之必要。

 

◆ ◆ ◆

六问:大数据给机器学习带来了本质影响吗?


问题六:大数据时代的出现,有没有给机器学习带来本质性的影响?

理论上讲,似乎“大数据”给统计机器学习提供了更多的机遇,因为海量的数据更加需要统计、抽样的方法。业界人士估计,大数据的出现将使人工智能的作用更加突出。有人把大数据处理分成三个阶段:收集、分析和预测。收集和分析的工作相对来说已经做得相当好了,现在关注的焦点是要有科学的预测,机器学习技术在这里不可或缺。这一点大概毋庸置疑。然而,同样是使用统计、抽样方法,同样是收集、分析和预测,大数据时代使用这类方法和以前使用这类方法有什么本质的不同吗?量变到质变是辩证法的一个普遍规律。

那么,从前大数据时代到大数据时代,数理统计方法有没有发生本质的变化?反映到它们在机器学习上的应用有无本质变化?大数据时代正在呼唤什么样的机器学习方法的产生?哪些机器学习方法又是由于大数据研究的驱动而产生的呢?

原文发布时间为:2016-08-23

 

时间: 2024-10-24 03:45:03

院士陆汝铃:六问机器学习的相关文章

360大战腾讯,不明真相网友六问“周大人”

题记:这是一个网友写的文章,很不错,想必代表了广大网民的心声和疑虑.我们越来越发现,360的产品越来越离谱,不是根据产品本身性质来定性产品善恶,而是根据对方是否为自己的竞争对手来判定该软件产品是否为恶意流氓软件,可笑之极!一个健康的中国互联网环境需要各个IT企业的自身自律来进行有序合理的竞争和合作,近几年来,周宏伟这位"红衣教主"打遍天下无敌手时,我们不仅为其生生不息的战斗精神而敬佩,但我们转而一想,以一个人的不懈精神而影响着中国互联网环境良性发展,这种行为是否可取?相信广大网民自由决

六问网宿科技 还要欺骗客户多久?

广东 2012-03-05(中国商业电讯)--去哪网打不开了,4399游戏网也打不开了.....数百家将服务器托管至网宿科技(300017,股吧)佛山IDC电信机房的网站从2月4日起,遭受到了为期数周以上的断网事件. 对去哪网(www.quna.com)百家网站因断网遭受到的巨额损失,和因断网不便遭受到的众多网友投诉,当网站向网宿追讨说法时,网宿当时的态度是"无解释说明""无恢复日期"或用VPN虚拟网络代替双线,而至今网宿科技仍未就此事作出真相说明. 网宿科技将自己

做产品前六问自己

最近做产品很迷茫,不知道自己做的产品到底干嘛的,有时做到一半时或者遇到难题时才反过来思考自己做的产品到底是干什么的,哪类用户会去用,用户会喜欢吗--当这一切问题烦绕着自己时,才发现迷失在产品怪圈里了.当然不排除很多产品的需求来自市场.来自于BOSS敲板定的,但你是产品经理,当你都没办法说服自己时,这产品是否还值得继续做下去呢?做产品前六问自己: 第一问:你的产品定位是什么? 1.产品是什么? 你要做的产品是被http://www.aliyun.com/zixun/aggregation/6579

六问社交趋势:李开复对话Youtube陈士骏

[导读]"未来我们会看到更多社交媒体产品是将现有内容聚合起来,而不是纯粹只产生内容." 社交网络正爆发出前所未有的魅力.当Facebook超越谷歌成社交霸主的时候,怎么也不会想到以WhatsApp和微信为代表的大批手机通讯应用,正以轻巧体量完成更大革命.当用户可能关掉电脑不再使用Facebook时,Facebook Home又横空出世,试图成为主导手机功能的"超级应用",并由此引爆一股新的潮流趋势. 新的社交应用正层出不穷,什么将是社交网络下一浪潮?什么时候到来?已

六问教育现代化

编者按 2009年底,袁贵仁刚履新教育部部长时,安徽高校的11位教授向这位部长及全国教育界发布公开信,提出"为什么我们的学校总是培养不出杰出人才"的"钱学森之问".日前,袁贵仁接受采访时指出,未来10年,教育改革发展的主要目标和任务是"基本实现教育现代化,基本形成学习型社会,进入人力资源强国行列".然而,教育要实现现代化,绕不开六个重要问题. 六问教育现代化 教育可以优先发展吗? 一些地方政府在GDP论英雄的大环境下,往往是只重经济发展的投入,而

万言六问湛江发展

近期,在南方报网网络问政平台,一篇上万字的网帖<对湛江发展的思考>引人关注.网帖作者通过在湛江.顺德两地的生活和工作经历,对比两地的发展现状,从政治环境.历史文化.社会治安等方面分析湛江发展滞后的原因.网帖引起众多网友的共鸣,不少网友跟帖建言献策. 湛江市委书记刘小华实名回复该网帖,对发帖的网友表示感谢. 随着网络问政不断深入,官民良性互动走向善治,成为广东的一大亮点. 万言六问湛江发展 发帖的是网友"cwbqiuyu",网文作者自称不是湛江人,但读小学时落户湛江赤坎,在湛

百家争鸣:软文写作技巧十六问 用心就不困难

中介交易 http://www.aliyun.com/zixun/aggregation/6858.html">SEO诊断 淘宝客 云主机 技术大厅 关于软文,相信站长们都十分熟悉,软文写作技巧也是说的最多的话题.一篇好的软文,可以为网站带来丰富的流量,还能让读者对网站有个好印象.一篇好的软文是润物细无声的,潜移默化之间,影响读者.软文推广的效果为大众所肯定和接受,如何写的一篇好文章是大多数站长孜孜以求的. A5论坛bbs.admin5.com 13号推出"只要你用心,其实软文写

六款机器学习云测评报告

摘要:在本文中,我们将分别对亚马逊.微软.谷歌.Databricks.HPE和IBM各大公司的机器学习工具套件的运行从广度.深度和易用性等方面进行深入的测评分析. 我们所谓的机器学习可以有多种形式.而最纯净的形式则为分析人员们提供了一组数据探索工具.一个ML模型选择.强大的解决方案算法和一种使用解决方案来进行预测的方法.亚马逊.微软.Databricks.谷歌和IBM的云服务产品都提供了预测API,使得分析人员有了不同量的控制.而HPE的云大数据分析平台解决方案Haven OnDemand则为二

【玩转数据系列十六】机器学习PAI通过声音分辨男女(含语音特征提取相关数据和代码)

背景 随着人工智能的算法发展,对于非结构化数据的处理能力越来越受到重视,这里面的关键一环就是语音数据的处理.目前,许多关于语音识别的应用案例已经影响着我们的生活,例如一些智能音箱中利用语音发送指令,一些搜索工具利用语音输出文本代替键盘录入. 本文我们将针对语音识别中最简单的案例"男女声音"识别,结合本地的R工具以及机器学习PAI,为大家进行介绍.通过本案例,可以将任何用户的语音数据标记出性别,并且保持高准确率.我们把整个实验流程切分为两部分,第一部分是声音信号的特征提取,通过R的信号处