大数据的真正意义-大数据自动挖掘

  现在大数据火得不行,几乎人人都在说大数据,但到底什么是大数据,恐怕没有多少人知道,鱼目混珠的人太多。

  大数据不是指很多很多数据。

  所以不是存储了很多数据就是在搞大数据了,因为“大数据”只是个简称,说全一点应是“">大数据挖掘”,没经过挖掘的大数据只是没有开采出来的原油,一点用处都没有。

  大数据也不是指一般意义上的数据挖掘。

  有很多人以前是搞数据分析或数据挖掘的,当《大数据时代》这本书一问世、大数据开始火的时候,他们摇身一变就成了搞大数据的专家了。如果真是这样,就根本没必要提大数据这事儿,因为它本来就一直存在着,只不过换个说法。就好像我们没必要今天突然提出个说法“饮H2O”来代替“喝水”。嗯,对,那叫玩概念。

  “大数据挖掘”其实还没有说全,再说完整点,应该是“大数据自动挖掘”。

  以前的数据分析或挖掘,是指人通过数据去进行分析,挖掘出一些规律性的东西以供以后使用。

  但面对大数据,由于不光是数据量太大,而且往往包括数据的维度也很多,人已不可能去处理这样海量的数据,甚至是如何处理都不知道,这时必须用电脑来自动处理,挖掘出数据中的规律。

  但是目前电脑还不能像人那样进行严密、复杂的逻辑思维,因此它们也无法用我们人的思维模式去分析数据,人可能只要较少的数据就能分析出其中的规律,数据多了反而没有办法,所以我们人类都是采用抽样分析。

  电脑则正好相反,无法根据少量数据去分析出规律,但它有一个优势,那就是运算速度非常快,因此有可能处理海量数据以后找出其中的规律。

  由于电脑还不能进行复杂的逻辑思维,所以它的处理方法很简单,就是进行简单的统计运算,也就是“硬算”,统计出在什么情况会出什么样的结果,然后当类似的情况再出现时,它就会告诉我们可能会出现某种结果了。

  由这里也可看大数据的另一个特点,即大数据主要是进行预测,告诉你未来将会出现什么样的结果。而不是只分析出过去的走势和现状,未来还是要由人去判断。

  为什么这种简单的方法会有效呢?这就回到“大数据”这个词上来了,那就是因为数据量非常大,统计出来的结果就往往是正确的。

  大家一定都知道这个例子,扔硬币来统计正、反面出现的机率,如果只扔10次,也许正面出现9次,以此来得出结论肯定是错的;但如果你扔10万次、100万次,甚至更多,那你统计出来的结果基本是正确的,正、反面出现的机率一定是各50%。

  是的,大数据自动挖掘就是依据这一原理。

  这里没有严密的因果分析,不是通过数据分析出原因再推导出结果;而是通过统计知道有这样的情况,一般就会有这样的结果,也即现象与结果的相关性。所以大数据就有一个显着的特点,只关心相关性,不关心因果;用更通俗的话说就是“只知道结果,不知道原因”。

  这实际是人们根据电脑的优势,找出了一个全新的数据分析、挖掘方式,与传统的方式完全不同,所以传统那些搞数据分析或挖掘的专家并不能称作为搞大数据的。

  不过你一定要小心,冷不防你就会碰上一个这样的专家,他们甚至可能是来自某名牌大学的知名教授之类。进到书店你也会看到许多讲大数据的书,封面无一例外都有很大的“大数据”三个字,但其实都是在讲传统、人工的数据分析方式,和大数据一点边都不沾。当然,这里不包括《大数据时代》这本书。

  另外,传统搞神经网络、深度学习等人工智能的,也基本不算大数据,因为这里面还是很多人为因素,包括建模型、对程序进行训练等,这里人仍需要对所分析的业务逻辑非常熟悉才能做,目前这种方法也难以达到实用的效果。而大数据只是让电脑根据一些简单却巧妙的算法,去进行大量数据的统计,找出连人都想不到的规律。大数据在这里基本是与业务逻辑无关的,人不需要知道这是什么业务,比如分析移动互联网行业的数据,他不需要知道这个行业的来龙去脉、当前状况等,他只需要对大量历史数据进行统计,就能够找出其未来的走势。

  说到这,你一定很想问,那就找不到一个真正搞大数据的了?

  先来讲个小故事:

  80年代有俩计算机呆子在IBM做翻译系统。当时的砖家都在探索语言之间的内在联系,语法、句法神马的。俩呆子路数不同,他们把能找到的各种语言相对应的文献全部做成数据,旁人批评“这种计算机蛮力不算科学”,后来他俩被一个对冲基金老板招走了。现这俩呆子是复兴科技co-CEO,老板是Jim Simons。

  复兴科技co-CEO每位年收入大概是1亿美元,比华尔街各大行CEO的年收入要高一些,关键是这两位几乎名不见经传。他们老板James Simons比较有名,是位数学家,跟陈省身一起写过定理,跟杨振宁是同事,年收入超过10亿美元,现在退休做慈善。清华有Chern-Simons楼,是杨振宁拉Simons掏钱修的。

  在金融投资领域,只关注相关性、不关注因果的对冲基金做得很好(复兴科技,DE Shaw),但金融理论基础深厚、大数据分析能力欠佳的公司却没有类似的业绩,MIT金融学家罗闻全坦言不明白复兴科技在干什么。

  喂,说你呢,别老盯着人家年收入1亿美元。

  这里关键的是很多人批评“这种计算机蛮力不算科学”(这些人肯定都是砖家,否则估计也没资格批评),还有就是金融学家们完全不明白他们在干什么。

  这说明了什么?说明了在国外发达国家赞成这种方式的人很少,知道怎么用这种方式的人就更少了,那么各位可以想像下在中国能有多少人知道这种方法该怎么做。

  在中国,如果谁用这种非主流的野路子做事,别说评专家、教授了,更别说什么收入上亿了,你估计不被饿死的机率有多大。

  反正笔者知道一个家伙,从2000年开始,就像美国那两个呆子,用这种“不科学的蛮力的硬算方法”进行语义相关度分析,做的事与那两个呆子搞的翻译系统异曲同工,都是有关语言的。可以说他在这方面做出了突破性成果,然而他写的成果文档,博士、专家们看都不看。他现在也就在一家小公司做一份普通IT工作,勉强维持温饱,曾经好长一段时间找不到合适工作,差点去洗碗、当保安。

  也许有人要问了,搞语言方面的去搞数字,这靠谱吗?用大数据的思路,你别管原因,那两个复兴科技的呆子已经告诉你结果了。

  非要知道原因,也可以跟你说说:

  其实语言比数字复杂太多了,举个简单的例子吧:1和2,电脑天然就知道它们的关系,知道哪个大、哪个小,以及大多少;但是“人”和“大”,电脑怎么知道这二者有什么关系,要知道也行,传统的方法就是进行很多人工注解(专业叫词性标注)。要让电脑自己通过数据挖掘来知道文字的意义和相关性,甚至连基本的词库都不给电脑,而让它自己去建,那实在太难了点,简直就是匪夷所思,然而那个家伙做到了。

  也就是说在大数据方面,语言处理与数字相比,难度绝对不是一、两个数量级的差别,因此能做语言的,做数字就很简单了。在有就还是大数据的特点,大数据是不管你什么样的数据,它就是找出相关性,所以文字和数字并没有太大区别。

  前段时间那家伙碰到有人提出一个行业趋势分析的问题,他说只用一个小时就想出了算法,只要把大量数据拿来就能出结果,但是在中国没人敢相信他。

  好了,有点跑题,不好意思。不过你现在知道什么是真正的“大数据”了吧。首先记得大数据是用来进行预测的,即直接告诉你未来的结果,另外就是牢牢记住7个字“大数据自动挖掘”,那就谁也忽悠不了你了。

时间: 2024-10-29 04:25:22

大数据的真正意义-大数据自动挖掘的相关文章

Hadoop历史、HDFS特点及对大数据时代的意义

如今Apache Hadoop已成为大数据行业发展背后的驱动力.Hive和Pig等技术也经常被提到,但是他们都有什么功能,为什么会需要奇怪的名字(如Oozie,ZooKeeper.Flume). Hadoop带来了廉价的处理大数据(大数据的数据容量通常是10-100GB或更多,同时数据种类多种多样,包括结构化.非结构化等)的能力.但这与之前有什么不同? 现今企业数据仓库和关系型数据库擅长处理结构化数据,并且可以存储大量的数据.但成本上有些昂贵.这种对数据的要求限制了可处理的数据种类,同时这种惯性

数据-请大神用oracle中存储过程的自动统计+JOB为我解答问题

问题描述 请大神用oracle中存储过程的自动统计+JOB为我解答问题 比如我有两张表A和B,我想每隔一个小时统计一下"FLOW"这个字段的所有数据的总和,然后将结果保存到B表中的"FLOW_SUM"字段中?我想用存储过程中的自动统计+JOB写,各位大神,求解答,最好写出sql语句来 解决方案 我已经解决了!!!!!!!!!!!!!!!!!!! 解决方案二: 给你个提示想一想 触发器

TalkingData业务数据相结合,讲述大数据生命新意义

不久前刚刚结束的钛媒体大会上,TalkingData副总裁,高铎先生就如何赋予大数据生命力,向企业展现大数据魅力一题发表了深入浅出的精彩演讲.针对性地提出了大数据的核心生命力:作为一个数据公司,要产生价值就必须有数据人才与企业业务问题结合,针对性地提出算法模型,帮助企业成长.只有做到这些,数据才能真正实现商业价值,改变企业效率和决策模式,乃至最终改变人类的自身和环境. 单个的数据并没有价值,但越来越多的数据累加,量变就会引起质变,就好像一个人的意见并不重要,但一千人.一万人的意见就比较重要,百万

工业大数据的真正意义和价值

近年来,以 .移动互联网.大数据.云计算为代表的新一代信息技术,以 . .人机协作为代表的新型制造技术,与新能源.新材料与生物科技呈现多点突破.交叉融合,智能制造技术创新不断取得新突破.2016年是我国"十三五"开局之年,也是我国系统推进智能制造发展元年,智能制造将成为实施< >的重要抓手,推动我国经济发展保持中高速增长,助力产业完成中高端升级. 在西方国家有这样一句话:To live well,a nation mustproduce well,说明制造业是一个国家综合国

大数据的终极意义

如今,人人都在谈论大数据,任何一个行业都意识到了大数据的重要.然而,一个更深层次的问题开始浮上水面:仅仅有了大数据就有了优势吗?法院为什么要做大数据?运用大数据的终极意义是什么? 在黄浦江畔,记者感受到了上海法院对大数据的深层次思考:法院不仅要有大数据,更要能够通过数据的有效分析创建自己的法院文化.要让人民群众在每一个司法案件中感受到公平正义,这才是法院运用大数据的真正意义所在. 回想今年3月13日,最高人民法院院长周强在十二届全国人大四次会议上庄严承诺:"向执行难全面宣战,用两到三年时间,基本

XTools CRM:从粗放大数据中提炼精确厚数据

ZDNET至顶网CIO与应用频道 07月28日 综合消息:随着互联网时代的到来,越来越多的社交方式开始普及,人们在网上留下的"痕迹",不断地以数据的形式被记录下来.许多人现在似乎相信,理解我们这个世界的最佳方式,就是坐在电脑屏幕前分析我们称之为"大数据"的海量信息.与此同时,随着智能设备和移动网络的发展,人们在线时长正在不断增长,于是这些数据以惊人的速度增长,以至于我们可以更快的去了解一个人.更诱人的是,对大量数据的分析预测和判断,这将会产生商业财富. 但对于企业生

《大数据导论》采用大数据的商业动机与驱动

本节书摘来自华章出版社<Spark大数据分析:核心概念.技术及实践>一书中的第1章,第节,作者托马斯·埃尔(Thomas Erl),瓦吉德·哈塔克(Wajid Khattak),保罗·布勒(Paul Buhler)更多章节内容可以访问"华章计算机"公众号查看. 采用大数据的商业动机与驱动 在当今世界的许多组织中,业务可以像其所采用的技术那样进行"架构".这种观念上的转变体现在当今企业架构领域的不断扩大,即过去只与技术架构紧密结合,而现在却也同样包含业务架

挖掘大数据应用价值 把大机遇变成大红利

5月24日,提升政府治理能力大数据应用技术国家工程实验室在贵阳国家高新区揭牌成立,这是全国首个大数据领域国家工程实验室,也是贵州第一个国家工程实验室.实验室将致力于为推动政府治理大数据应用的技术进步.产业转型和产业发展提供技术支撑. 实验室的成立,意味着贵阳在大数据应用领域又迈出坚实一步,在贵州大数据发展史上具有里程碑意义. 大数据既是大机遇.大变革,又是大产业.大红利.作为贵州省会,贵阳是"国家大数据(贵州)综合试验区"建设的主战场.在大数据领域,贵阳并不只是探路者.理论者,更是耕耘

孕育中的数据服务业——六谈大数据时代

自从苹果公司先后推出iPhone和iPad红遍全球,全世界进入了若干产业被颠覆,若干产业被重组,若干公司被干掉的大乱局面.以近来谷歌和微软相继推出平板电脑为标志,再加上它们在手机操作系统以及手机制造上的努力,可以说传统的产业划分和商业模式分析需要重新来过了. 从产业分析的角度看,今天再把网络业,IT业,电信业和软件业分开看已经什么都说不清楚了.传统的TMT概念(电信,媒体和信息技术业的统称)更是应该被扔进历史垃圾堆.一个重新定义过的大网络业概念可能会更加贴切地反映高度变动中的世界和日益模糊的产业