数据挖掘与统计分析的区别

      多元统计老师说:“数据挖掘是以统计分析为基础的,多数在采用统计分析的方法”。我有不同的观点,就写点东西出来,大家可以自己评述。

我们过去曾给予数据挖掘方法智能的生命力,把它看作商务智能重要的发展方向。但统计学作为一个学科是否应该关心它的发展。我们是否应该将它看成统计的一部分?那意味作什么?最起码它表明我们应该:在我们的杂志上发表这类文章;在我们的本科课程中讲授一些这方面的内容,在我们的研究生中讲授一些相关的研究课题。我们的博士生专业课就有《多元统计》一课;给那些这方面较优秀的人提供一些奖励(工作,职称,奖品)。

答案并不明显,在统计学的历史上就忽略了许多在其它数据处理相关领域发展的新方法。如下是一些相关领域的例子。其中带*的是那些在统计科学中萌芽,但随后绝大部分又被统计学忽略的方法领域。
1 模式识别*–CS/工程
2 数据库管理–CS/图书馆科学
3 神经网络*–心理学/CS/工程
4 机器学习*-CS/AI
5 图形模型*(Beyes 网)-CS/AI
6 遗传工程–CS/工程
7 化学统计学*–化学
8 数据可视化**–CS/科学计算

可以肯定地说,个别的统计学家已经致力于这些领域,但公平地说他们并未被我们的统计学学术圈接纳,主流的学术圈并未接纳这些,至少我没有听到哪个统计学教师钻研神经网络。

既然象上面的一些从数据获取知识的课题和统计学的关系如此冷淡,我们不禁要问:`什么不是统计学`。如果和数据联系并不是一个课题成为统计学一部分的充分理由,那么什么才是充分的呢?到目前为止,统计学的定义好象依赖于一些工具,也就是我们在当前的研究生课程中讲授的那些东西。如下是一些例子:
.概率理论
.实分析
.测度论
.渐近理论
.决策理论
.马耳可夫链
.遍历理论

统计领域好象被定义成一族能提出如上或相关工具的问题。当然这些工具过去和将来都会很有用。就象Brad Efron(Brad Efron, Department of Statistics Sequoia Hall 390 Serra Mall Stanford University Stanford)提醒我们一样:“统计是最成功的信息科学。那些忽略了统计的人将受到惩罚,他们将在实际中自己重新发现该统计方法。”
有人认为在当前数据(及其相关应用)以指数方式增长,而统计学家的数量显然赶不上这种增长的情况下,我们统计学应该将精力集中于信息科学中我们作得最好的部分,也就是基于数学的概率推断。这是一种高度保守的观点,当然它也有可能是最好的一种战略。然而,如果我们接受这一种观点,我们统计学家在‘信息革命’浪潮中的作用肯定会逐渐消失殆尽(在这个舞台上的演员越来越少)。当然这种战略的一个很好的优点是它对我们创新的要求很少,我们只需要墨守成规就可以了。

另一种观点,早在1962年就由John Tukey[Tukey (1962)]提出来了,他认为统计应该关注数据分析。这个领域应该依据问题而不是工具定义,也就是那些和数据有关的问题。如果这种观点成为一种主流观点,那就要求对我们的实践和学术课题作较大的改变。
首先(最重要的),我们应该跟上计算的步伐。哪里有数据,哪里就有计算。 一旦我们将计算方法看成是一个基本的统计工具(而不是一种方便地实现我们现成工具的方法),那么当前许多和数据密切相关的领域将不复存在。他们将成为我们领域的一部分。
认真对待计算工具而不是简单地使用统计包–虽然这一点也很重要。如果计算成为我们的一个基本的研究工具,毫无疑问,我们的学生应该学习相关的计算科学知识。这将包括数值线性代数,数值和组合优化,数据结构,算法设计,机械体系,程序设计方法,数据库管理,并行体系,和程序设计等等。我们也将扩展我们的课程计划,它应该包括当前的计算机 定向数据分析方法,它们大部分是在统计学科之外发展起来的。

如果我们想和其它的数据相关领域争夺学术和商业的市场空间,我们的某些基本模式将不得不改变,我们将不得不调节对数学的幻想。数学(象计算)只是统计的一个工具,虽然非常重要,但并不是唯一能证实统计方法有效性的工具。数学不等价于理论,反之亦然。理论本来是创造理解力和数学,虽然这很重要,但并不是作此的唯一方法。比如,在疾病的基因理论中数学内容很少,但它却使人们更好地理解许多医学现象。我们将承认经验确认方式,虽然有一定局限性,但的确是一种确认方式。
我们可能也不得不改变我们的文化。每一个参与其它数据相关领域的统计学家都被他们和统计学的‘文化差距’所震撼。在其它的一些领域,‘想法’比数学技术(基础)更重要。一个有启发的‘想法’就被认为是有价值的,若有更详细的确认(理论的或经验的)人们才去讨论它的最终价值。思维方式是‘如果没有证明是有罪的,那就是清白的’这和我们领域的思路是不一致的。过去如果一个新方法不是用数学证明是有效的,我们常常诋毁它,即使不这样,我们也不会接受它。这种思路在数据集比较小和信息噪声比较高时是合理的。特别地,我们应该改变我们诋毁那些表现很好(通常在其它领域),但却没被我们理解的方法的习惯。

个人感觉,也许,现在的统计学正处在一个十字路口,我们可以决定是接受还是拒绝改变。如上所说,两种观点都极富说服力。虽然观点丰富,但谁也不能肯定哪一种战略能保持我们领域的健康发展和生命力。大多数统计学家好象认为统计学对信息科学的影响越来越小。它们也不太同意为此作些什么。站主导的观点认为我们有市场问题,我们在别的领域的顾客和同事不了解我们的价值和重要性。这也是我们的主要专业组织,美国统计协会的看法。在战略计划委员(A mstat News-Feb.1997)会所作的五年计划报告中有一节‘增强我们学科的声望和健康’,报告中提及“以下的内容意思是:统计学面临危机,市场的,人才的危机。”统计学可以在数据挖掘科学中发挥作用,统计学应该和数据挖掘合作,而不是将它甩给计算机科学家。

有一部分统计专家认为计算机和他们争抢了市场,这个是表面现象。以我们的课程为例,老师讲得很认真,但很多人都没有统计基础,这严重影响了学生对分析过程和结果的理解。SPSS、SAS等分析软件已很优秀,但运行出来的结果仍需进行解释,统计专家的价值也在于此。数据挖掘的可视化比统计分析工具更成功,在目前BI风起云涌的大背景下,企业数据仓库发展到一定阶段,数据挖掘的市场会越来越大,统计专家们的担忧正变为现实。数据挖掘是面向最终用户的,而统计分析的中间转换环节提高了应用成本。

原文发布时间为:2013-08-27


时间: 2024-09-20 22:51:00

数据挖掘与统计分析的区别的相关文章

机器学习和数据挖掘的联系与区别

从数据分析的角度来看,数据挖掘与机器学习有很多相似之处,但不同之处也十分明显,例如,数据挖掘并没有机器学习探索人的学习机制这一科学发现任务,数据挖掘中的数据分析是针对海量数据进行的,等等.从某种意义上说,机器学习的科学成分更重一些,而数据挖掘的技术成分更重一些. 本文选自<大数据架构详解:从数据获取到深度学习> 机器学习(Machine Learning,ML)是一门多领域交叉学科,涉及概率论.统计学.逼近论.凸分析.算法复杂度理论等多门学科.其专门研究计算机是怎样模拟或实现人类的学习行为,以

数据挖掘与数据化运营实战. 2.2 统计分析与数据挖掘的主要区别

2.2 统计分析与数据挖掘的主要区别 统计分析与数据挖掘有什么区别呢?从实践应用和商业实战的角度来看,这个问题并没有很大的意义,正如"不管白猫还是黑猫,抓住老鼠才是好猫"一样,在企业的商业实战中,数据分析师分析问题.解决问题时,首先考虑的是思路,其次才会对与思路匹配的分析挖掘技术进行筛选,而不是先考虑到底是用统计技术还是用数据挖掘技术来解决这个问题. 从两者的理论来源来看,它们在很多情况下都是同根同源的.比如,在属于典型的数据挖掘技术的决策树里,CART.CHAID等理论和方法都是基于

数据挖掘与数据化运营实战

大数据技术丛书 数据挖掘与数据化运营实战:思路.方法.技巧与应用 卢辉 著 图书在版编目(CIP)数据 数据挖掘与数据化运营实战:思路.方法.技巧与应用 / 卢辉著.-北京:机械工业出版社,2013.6 (大数据技术丛书) ISBN 978-7-111-42650-9 I. 数- II. 卢- III. 数据采集 IV. TP274 中国版本图书馆CIP数据核字(2013)第111479号 版权所有·侵权必究 封底无防伪标均为盗版 本书法律顾问 北京市展达律师事务所     本书是目前有关数据挖

数据挖掘与数据化运营实战. 2.3 数据挖掘的主要成熟技术以及在数据化运营中的主要应用

2.3 数据挖掘的主要成熟技术以及在数据化运营中的主要应用 2.3.1 决策树 决策树(Decision Tree)是一种非常成熟的.普遍采用的数据挖掘技术.之所以称为树,是因为其建模过程类似一棵树的成长过程,即从根部开始,到树干,到分枝,再到细枝末节的分叉,最终生长出一片片的树叶.在决策树里,所分析的数据样本先是集成为一个树根,然后经过层层分枝,最终形成若干个结点,每个结点代表一个结论. 决策树算法之所以在数据分析挖掘应用中如此流行,主要原因在于决策树的构造不需要任何领域的知识,很适合探索式的

物联网区别于云计算技术的几大看点分析

本文讲的是物联网区别于云计算技术的几大看点分析,物联网和云计算在很多方面有对等的可比性,例如,云计算有SPI(即SaaS.PaaS.IaaS)三层的划分,物联网也有DCM(即感知层.传输层.应用层)的三层划分.美国NIST(美国国家标准技术研究院)把云计算的部署模式分为共有云.私有云.社区云和混合云,物联网的存在方式分为内网.专网和外网;也可和云计算一样,把物联网的部署模式分为公有物联网(Public IoT).私有物联网(Private IoT).社区物联网(Community IoT)和混合

如何系统地学习数据挖掘

数据挖掘:What?Why?How? 这个问题思考了很久,作为过来人谈一谈,建议先看下以前的一些回答. 什么是数据挖掘? 怎么培养数据分析的能力? 如何成为一名数据科学家? 磨刀不误砍柴工.在学习数据挖掘之前应该明白几点: 数据挖掘目前在中国的尚未流行开,犹如屠龙之技. 数据初期的准备通常占整个数据挖掘项目工作量的70%左右. 数据挖掘本身融合了统计学.数据库和机器学习等学科,并不是新的技术. 数据挖掘技术更适合业务人员学习(相比技术人员学习业务来的更高效) 数据挖掘适用于传统的BI(报表.OL

深入浅出:如何从0开始学习大数据挖掘分析?

最近有很多人咨询,想学习大数据,但不知道怎么入手,从哪里开始学习,需要学习哪些东西?对于一个初学者,学习大数据挖掘分析的思路逻辑是什么?本文就梳理了如何从0开始学习大数据挖掘分析,学习的步骤思路,可以给大家一个学习的建议. 很多人认为数据挖掘需要掌握复杂高深的算法,需要掌握技术开发,才能把数据挖掘分析做好,实际上并非这样.如果钻入复杂算法和技术开发,只能让你走火入魔,越走越费劲,并且效果不大.在公司实际工作中,最好的大数据挖掘工程师一定是最熟悉和理解业务的人.对于大数据挖掘的学习心得,作者认为学

[置顶].NET平台机器学习资源汇总,有你想要的么?

接触机器学习1年多了,由于只会用C#堆代码,所以只关注.NET平台的资源,一边积累,一边收集,一边学习,所以在本站第101篇博客到来之际,分享给大家.部分用过的 ,会有稍微详细点的说明,其他没用过的,也是我关注的,说不定以后会用上.机器学习并不等于大数据或者数据挖掘,还有有些区别,有些东西可以用来处理大数据的问题或者数据挖掘的问题,他们之间也是有部分想通的,所以这些组件不仅仅可以用于机器学习,也可以用于数据挖掘相关的. 按照功能把资源分为3个部分,开源综合与非综合类,以及其他网站博客等资料.都是

深扒一个独角兽公司标配但仍被低估的行业

文章要点: 6500 人在 LinkedIn (领英)上称自己是数据工程师. 2013 到 2015 年,数据工程师的数量至少翻了一倍. 50% 的数据工程师都在美国. 42% 的数据工程师都是软件工程出身. 数据工程师主要供职于信息科技与服务产业. 数据工程师前 5 项主要技能是:SQL, Java, Python, Hadoop, 和Linux.R语言甚至都没进前 20. 美国数据工程概况: 目前,LinkedIn 上有 6500 人称自己是数据工程师.而仅在旧金山,就有 6600 个这样的