大数据时代,what比why重要

  对于大数据的四个特性我们当然了解,相关性也找到了,接下来就是如何利用大数据创造出价值。“大数据是什么”,“大数据跟我有什么关系”,这是很多人第一次听到大数据心中所产生的疑问。

  据《30杂志》报道,麦尔•荀伯格在千余名想了解">未来趋势的观众面前,做了一场精彩易懂的演说,告诉了企业及民众,什么是大数据。

大数据找出相关性

  2009年,全球出现一种新的流感病毒H1N1,当时美国也无法幸免,疾病管制局(CDC)要求第一线的医师遇到H1N1流感病例,必须立刻通报。即使如此,通报速度仍总是慢一步,会晚1到2个星期。这样的时效让疾管局无法掌握真实情况,对症下药。

  当时有几位Google 工程师在著名的《自然》科学期刊中发表了一篇论文。他们透过美国最常使用的前5000万个搜寻关键字,再与疾管局2003-2008年间的流感传播资料加以比对,用高达4.5亿种不同的数学模型,找出这些字出现的频率、时间及地点,有没有统计上的相关性(correlation)。最后被他们挖到宝了,这套软件找出了45个流感关键字眼,放进数学模型之后,预测结果与官方公布的真实资料吻合,有强烈的相关性。

  Google 运用这套数学模型,再一次精准地掌握了流感发生的高峰及地区,让防疫工作同步进行,不落后。

  再说另一例子,天文学来说,美国太空总署执行一项叫史隆数码巡天计划(Sloan Digital Sky Survey),从2000年开始,他们用位于美国新墨西哥州的天文望远镜去收集资料,计划开始不过几星期,收到的天文资料量就已超过了过去所有天文学历史的总和。到了2010年,这个计划收到了140TB 的资料量。但是接续的新计划,预计2016年登场,未来的巡天望远镜在5天内,就可收到这些资料量。

  荀伯格说,当资料进入天文数字时代,荀伯格提醒:到底大数据有多大?其实不是那么重要,重点是在放大,扩大资料量等级,就能做出少量资料做不到的事。

  举例来说,画一张马的图画,不是太难的事,但如果画了很多张马的图画,再以每秒24帧来呈现这些图画,就成了动画。这里要强调的是“量变”产生了“质变”,巨量就是这个道理,量的不同,也改变了本质。

what比why重要

  量增加了,就出现另一项大数据的特色:乱(messy)。巨量资料的内容常是混乱不齐,质量不一。这是因为,巨量资料的收集过程中,它只要一个大方向即可,不需要讲究到一寸、一分。“这并不是说我们放弃了精准这件事,只是不再将精准奉为圭臬,”荀伯格说。

  举例来说,我们要测量某个葡萄园的温度,如果整片葡萄园只有一支温度计,那这支温度计就要十分精准,不能故障,但也意味着它会很贵。换句话说,就是不能有任何杂乱或出错;相反的,如果我们今天在葡萄园里放了100支温度计去测温度,就可以用便宜一些,简单的温度计测出很精准的温度。

  100支温度计代表的是量大,尽管其中几支可能不那么精准,但却可以收集到大量数据。比起只靠一支温度计来说,更可看到全貌,代表全体。那此时,一点杂乱就显得微不足道。

  重点又来了,荀伯格忽然站起来向所有在场的观众说,大数据时代,资料数量比资料质量更重要。更不要为了一点点信息的偏差而影响了整体分析,想处理掉不精准的信息,成本会很高,也没有必要!

  另一个有趣的例子是沃尔玛(73.54, 0.00, 0.00%)(Walmart),他们从庞大的交易记录上发现,在飓风来袭前,销量大增的不只是手电筒,还有一种美国小甜点 Top-Tarts,店家会在每次飓风来临前,把一盒一盒的 Top-Tarts放在风灾的必需品架上,方便急忙的顾客一次满足,“特别是草莓口味的,卖得最好。”

  请注意,这里Walmart不去弄清楚为什么飓风时人们特别想吃Top-Tarts,而是把这个相关性找出来,直接采取更有利的营销动作。

  荀伯格特别强调,大数据时代,what比why重要。

  再举一个例子,发生在他朋友,也是大数据专家,任教于华盛顿大学的教授伊兹奥尼(Oren Etzioni)身上。2003 年时他想从西雅图塔机到洛杉矶参加弟弟的婚礼,他想愈早订票愈能买到便宜,几个月前他就买好了机票,也觉得买得很便宜。没想到他在航程中,出于好奇问了隔壁乘客买多少钱,何时买的。结果,一问之下,都回答最近才买,且都比他买得便宜,他十分生气。

  下了飞机后,他决定去好好研究一下购买机票这件事。他发现,如果平均票价呈现下跌,买票就可以慢慢来;如果价格上扬中,你就要先订票,以免它水涨船高。

  伊兹奥尼花了41天的时间去比对一旅游网站中超过12000笔的票价资料,他建立了一个模型,让模拟的消费者都省下了大笔的机票钱。在这模型里,消费者不懂“为什么(why)”,只知道“正是如此(what)”,消费者要决定现在是“买或是不买”。

  后来这套模型发展出创业计划,他创了一个Farecast网站,消费者可以做出最佳判断,何时该买,还是不买。

大数据与价值

  当我们知道了大数据的特性,也找到了相关性,接下来就是靠着它创造出价值来。

  美国西雅图有一家专门收集车辆实时定位的资料公司Inrix,它的资料来自上亿台的车辆。同时,它也推出手机 App服务,通过提供服务换取特定的司机资料,包括他们曾开车去的地方、天气及路况等。他们将收到的资料再出售给一家投资基金,该基金根据大型零售商场附近的路况推测业绩,在零售商公布季报前,抢先决定该买入或卖出。因为车潮就是钱潮。这就是价值。

  英国的罗尔斯罗伊斯是著名的飞机引擎制造商,它通过在引擎上安装了一个监控器,以掌控引擎是否正常运转。结果随着他们收集到的资料中发现,当引擎出现哪些信号异常,引擎可能会发生问题,这个监控变成了预测,大大减少飞安事故。罗尔斯罗伊斯从过去单单的制造引擎公司,转型为服务咨询,他们让数据产生出价值。

  荀伯格说了许多大数据的美好,但他强调,大数据有其黑暗面:隐私当然是一个该关注的焦点,但他强调,更可怕的是各种算法,去预测是不是会患心脏病?或你是否会犯罪等。有时,依靠大数据做出的演算与预测,如果与自由意志不符时,孰轻孰重?

  同时,我们也担心,愈来愈多的企业会掌握更多资料,但如此庞大的资料为他们所收集,拿去做了什么?什么用途?不一定能受到监督与管理,这是重要议题。

  “巨量资料是为人类所掌控,而不是被巨量资料所掌控,”这是荀伯格最后的提醒。

时间: 2024-09-27 12:51:35

大数据时代,what比why重要的相关文章

大数据时代的小数字感

目前,"大数据"概念已经深入人心.很多人都喜欢谈论大数据.而我们利用数据,其中一个很重要的目的在于,用之为决策提供支持.因此,如何有效地呈现出大数据给出的结果,并把数据以"人话"说出来的,并让受众(很可能是你的领导)听得懂,就显得非常重要的! 想做到这一点,就得迎合人性,或者,更具体点说,要迎合人类大脑的喜好. 一部经典电影引出来的数字感 如果你看过巴里•莱文森导演的经典奥斯卡电影<雨人>(Rain Man),或许你不会忘记其中一个非常有意思的桥段:在餐

大数据时代来临

前言:最近读了很多大数据分析的文章,感觉大数据时代来临.哈佛商业评论也开了一个新的栏目叫做"大数据".整理了一下所有收藏并准备记录的大数据分析文章,本文是最适合做第一篇分享的.文章以案例为支持,讲述了大数据分析的4个基本点.文章记录完后,yoyo也根据与英雄联盟数据分析组负责人的聊天,记录一些对大数据分析的思考. http://blogs.hbr.org/cs/2012/10/getting_started_on_a_big_data.html Inspiration: Big dat

分析师:“大数据时代”的生存法则

在Talend Connect大会上,一名IT业内分析专家指出,企业若不抓住大数据带 来的机会,将很有可能在同行中遭到淘汰. Jeff Kelly是Wikibon.org的 首席研究员,也是SiliconANGLE的编辑.他说,诸如Hadoop和MapReduce这样的大 数据技术才刚刚起步:很多人由于技术有限或观念陈旧,仍然将它们拒之门外. 然而,在不久的将来,当软件使用门槛变低大量企业开始采用的时候,这些今天 已经采用了大数据技术的企业将再次占领高地.到那时,他们会具备更丰富的信 息来进行决

院士演讲:大数据时代的位置服务

 摘要: 中国工程院院士李德毅院士为大家带来<大数据时代的位置服务>的主题演讲,李德毅院士同时指出:大数据引发新理念,实践中的研究也许胜过研究中的实践,较多的数据也许胜过较好的算法  以"智慧城市与移动信息化"为主题的"第七届中国电子政务高峰论坛"于2013年6月23日在北京大学英杰交流中心阳光大厅隆重举办.本次论坛由工业和信息化部信息化推进司指导,北京大学信息化与信息管理研究中心主办,中央机构编制委员会办公室电子政务中心.北大CIO班教务办公室协办,C

“棱镜门”为人们反思大数据时代个人隐私与公共安全提供一个范本

摘要: 随着美国中情局前雇员斯诺登将美国的棱镜计划公之于众,全球舆论鼎沸,斯诺登是不是叛国者,美国政府是否违宪,诸如此类的讨论热火朝天.棱镜门为人们反思大数据时代的个人隐 随着美国中情局前雇员斯诺登将美国的"棱镜"计划公之于众,全球舆论鼎沸,斯诺登是不是叛国者,美国政府是否违宪,诸如此类的讨论热火朝天."棱镜门"为人们反思大数据时代的个人隐私与公共安全提供了一个范本,斯诺登潜逃.引渡以及政治庇护这样的情节增加了戏剧性,却无碍于反思这个问题的内核. 经过一段时间的辩论

大数据时代电视剧市场的价值观转型

倘若将近十余年来最具话题性的现象级热播剧拉出一份长长的列表,不难看出某种绵延变化的轨迹与隐含其中的价值观断裂.从<雍正王朝>到<琅琊榜>,从<步步惊心>到<太子妃升职记>,一个巨大的转型已悄然发生.势不可挡. 这一转型始于2014年中,那时,针对热播电视剧的网络大数据分析开始逐渐成为与电视收视率并行的重要行业指标.这事实上意味着,业已抛弃电视平台的年轻一代数码原住民的欣赏趣味,得以摆脱过往"不可见"的状态,并凭借这一指标而被数值化,从而纳

大数据时代的绝代双湖

古龙武侠小说<绝代双骄>中的小鱼儿与花无缺,这两个武艺超群,有胆有识的大侠,在如今的大数据时代也存在着,它们不仅是中国数据中心的"双骄",同时也是数据时代的"双湖". 它们就是阿里千岛湖数据中心和云巢东江湖数据中心. 2016年第四季度,东江湖大数据中心将正式启动,它将成为阿里云千岛湖大数据中心之后的又一个大型"自然水冷"技术的数据中心. 千岛湖大数据中心位于浙江省,属于长江三角洲的后花园,它们采用湖水制冷,预计全年平均PUE1.3,

大数据时代 你的数据属于谁?

在这个所谓的DT(数据科技)时代,数据的价值正在为人所知,由此而来的个人信息泄露事件也层出不穷.然而,当人们将矛头指向黑客入侵系统漏洞.撞库拖库等,却忽略了掌握数据源的互联网企业. 记者调查:诸多网站默认可以转让你的信息个人数据至今无法确权 在这个所谓的DT(数据科技)时代,数据的价值正在为人所知,由此而来的个人信息泄露事件也层出不穷.然而,当人们将矛头指向黑客入侵系统漏洞.撞库拖库等,却忽略了掌握数据源的互联网企业. <IT时报>记者在调查中发现,数据价值虽已传递到产业链的各个环节,但数据交

马云:大数据时代,最重要的是做到“事前诸葛亮”

文/魏鸿 "上医治未病.中医治欲病.下医治已病".阿里巴巴集团董事局主席马云关于<科技创新在未来社会治理中的作用>专题讲座,给百万政法干警带来一场头脑风暴.大数据时代,最重要的是做到"事前诸葛亮".马云用生动的案例解读了大数据如何识别坏人.如何协助执法部门打击犯罪.我们来详细了解一下阿里巴巴是如何运用大数据技术服务社会治理创新的. "城市大脑":用数据创造价值 今年3月,浙江省杭州市政府开始启动"城市大脑"项目,包

初创公司:大数据时代,如何靠数据挣钱

大数据时代下,数据就如同矿石,如果能够充分挖掘并善加利用,大数据将会成为大财富.在很多情况下虽然大数据的价值还没得到充分证明,但分析人士指出这一市场正在扩大,越来越多的有经验的投资者希望能得到不为人知的独家数据. 大数据时代下,数据就如同矿石,如果能够充分挖掘并善加利用,大数据将会成为大财富.在很多情况下虽然大数据的价值还没得到充分证明,但分析人士指出这一市场正在扩大,越来越多的有经验的投资者希望能得到不为人知的独家数据. 目前已经有很多初创公司认识到了这一点,接下来本文将介绍三家利用大数据挣钱