给大数据降降温:关于大数据的九个问题

  “大数据”突然间变得无处不在,似乎每个人都想收集、分析大数据、并从中获利,同时也有人在夸耀或者害怕它的巨大影响。不论我们是在讨论利用谷歌庞大的搜索数据来预测流感的爆发还是利用通话记录来预测恐怖活动,又或者是利用航空公司的数据找到买机票的最佳时机,大数据都可以帮上忙。将现代计算技术和数字时代众多的数据结合起来,似乎可以解决任何问题——犯罪,公共卫生,用语的变化,约会的危险,只要我们把这些数据利用起来。

  似乎它的拥护者这样宣称。“在接下来的二十年,”记者帕特里克·塔克在他最近的大数据声明中这样写道,“是透明的未来,”“我们可以以一种前所未有的准确度预测未来的诸多领域,甚至包括一些长久以来被认为人类无法干预的领域。”但大数据其实从来没有听上去那么好。

  大数据真的像说的那么好?毫无疑问大数据确实是一个有价值的工具,并在某些领域产生了至关重要的影响。比如,几乎近二十年人工智能计算机程序的成功,从谷歌的搜索引擎到IBM的沃森电脑问答系统,都包括了大量数据的处理。但是正是因为它最近如此受欢迎并得到广泛应用,我们需要清晰的看待大数据究竟能做什么和不能做什么。

大数据能告诉我们是什么,但不能告诉我们为什么

  首先,尽管大数据能够非常好地检测相关性,特别是那些用小数据集可能无法测出的微妙相关性,但是它并不会告诉我们哪一种相关性是有意义的。比如,大数据分析可能会揭示从2006年到2011你那美国谋杀案比例与IE浏览器的市场份额是极度相关的,都呈急速下降趋势。但是很难相信这两者之间有什么因果关系。又比如,从1998到2007被诊断出的自闭症患者与有机食物的销售具有相关性(都呈急速上升趋势),但是这种相关性本身不会告诉我们饮食和自闭症的关系。

大数据只能是辅助工具

  第二,大数据可以辅助科学调查,但不可能成功地完全代替。比如,分子生物学家很想从潜在的DNA序列中推断出蛋白质的三维结构,有一些科学家已经在用大数据来解决这个难题。但是没有任何科学家认为你可以完全依靠处理数据来解决这个难题,不论这个数据分析是多么的强有力,你依旧需要基于对物理和生物化学的理解上来处理这些数据。

基于大数据的工具易造假

  第三,基于大数据的很多工具很容易造假。批改学生作文的大数据程序通常依赖于句子长度和用词的复杂性,数据表明这和老师批改的分数很相关。但是一旦学生知道这个程序如何运作,他们就开始写一些长句子并用晦涩的词语而不是去学会如何规范清晰的表达,组成连贯的篇章。甚至谷歌的著名的搜索引擎,这个通常被认为成功的大数据案例也不能免于信息繁杂,无用的搜索结果,一些人为的原因使得一些搜索结果排在前面(搜索广告)。

通过大数据下结论是有风险的

  第四,即便大数据的结果没有人为地造假,但是它看上去也不那么有效。比如谷歌预测流感的案例曾经是大数据的典范。2009年,谷歌通过相当大的宣传称它可以通过分析与流感相关的搜索预测流感爆发的趋势,这种准确性和快速甚至超过了疾病控制和预防中心等官方机构。但是几年后,谷歌宣称的流感预测并没有得到好的结果,最近两年,它做的更多地是不准的预测。

  最近一篇《科学杂志》的文章解释道,谷歌流感预测的失败很大程度上是因为谷歌搜索引擎自己在不断的更新,这个时候收集的数据未必能够适用于下一个时候收集的数据。正如统计学家冯启思(《数据统治世界》的作者)所说的,依赖于网站的大数据收集常常把一些用不同方法、有不同目的数据整合起来,有时候这会产生负面的影响。从这样的数据样本得出结论是需要冒风险的。

  大数据的智能应用会导致错误被加强

  第五个需要注意的就是“恶性循环”,这也是因为大量的数据都来自于网络。不论何时,大数据分析的信息源本身就是一种大数据产品,这很可能会导致恶性循环。谷歌翻译等翻译程序是从不同语言中抽取相似的文本去辨别这些语言的翻译模式,比如同样的维基百科条目有两种语言。这是一个很合理的策略,要不是有很多语言并不具有太多相似性,维基百科自己都可以用谷歌翻译写条目。在这种情况下,任何谷歌翻译的错误都会影响维基百科,而这又会反映到谷歌翻译上,使这种错误不断加强。

大数据可能会导致大错误

  第六个需要担心的就是太多相关性导致的危险。如果你在两个变量中不断地寻找相关性,那么你很可能会纯粹出于偶然发现虚假的相关性,即便在这些变量中并没有实际意义的联系。缺乏谨慎的检查,大数据的量级会扩大这些错误。

听上去科学的解释未必正确

  第七,大数据很容易对那些无法精确的问题给出听上去很科学的解释。比如在过去几个月,基于维基百科的数据给人们排名有两个不同的尝试:根据历史重要性或者文化贡献。其中一本书叫做《谁更强?历史人物真实的排名在哪里》,作者是电脑工程师Steven Skiena 和工程师Charles Ward,另一本叫做《万神殿》,来自于麻省理工学院媒体实验室项目。

  这些尝试在某些方面是正确的,耶稣、林肯、莎士比亚确实是极为重要的人物,但是两者都犯了一些严重的错误。《谁更强?》指出法兰西斯.史考特.凯伊(Francis Scott Key )在历史上是19世纪最重要的作家,远远超过简·奥斯汀(第78名)和乔治·爱略特(第380名)。更严重的是,两本书呈现出了利用所谓的精确误导人,而在本质上是模糊升值无意义的。大数据可以把任何事都简化为数字,但是你不应该被这些“科学”的表现愚弄。

罕见事件,大数据不起作用

  最后,大数据在分析那些普通事件很在行,但是在分析罕见事件常失败。比如,用大数据处理文本的程序如搜索引擎和翻译程序,常常依赖于所谓的“三字”:连续三个词的序列(比如“in a row”)。可靠的数据信息可以编制常规的三字模型,正是因为他们常出现,但是现有的数据并没有多到足够包括人们可能使用的所有“三字”,因为人们在不断创造新语言。

  随便挑一个例子,Rob Lowe 最近为报纸写的书评有九个“三词序列”比如“dumbed-down escapist fare”,这在谷歌的文本里从未出现过。对于这些新鲜词汇谷歌有很多限制,谷歌将“dumbed-down escapist fare”西安翻译为德文然后再翻译为英文,最后出现了这样一个不合逻辑的词语“scaled-flight fare.”Lowe先生的本意和利用大数据的翻译真是完全不搭边。

  等等,我们几乎忽略了最后一个问题:炒作。大数据的支持者宣称它是革命性的进步。但是即便是给出大数据的成功例子,比如谷歌流感趋势的预测,即便有用但对于一些更大的事这些显得微不足道。相比19世纪和20世纪的伟大发明比如抗生素,汽车,飞机,大数据所得出的东西实在算不了什么。

  我们需要大数据,毫无疑问。但是我们也需要更加清醒的认识到,这只是一种每个人都可以分析的重要资源,并不是什么新技术。

  是在讨论利用谷歌庞大的搜索数据来预测流感的爆发还是利用通话记录来预测恐怖活动,又或者是利用航空公司的数据找到买机票的最佳时机,大数据都可以帮上忙。将现代计算技术和数字时代众多的数据结合起来,似乎可以解决任何问题——犯罪,公共卫生,用语的变化,约会的危险,只要我们把这些数据利用起来

  似乎它的拥护者这样宣称。“在接下来的二十年,”记者帕特里克·塔克在他最近的大数据声明中这样写道,“是透明的未来,”“我们可以以一种前所未有的准确度预测未来的诸多领域,甚至包括一些长久以来被认为人类无法干预的领域。”但大数据其实从来没有听上去那么好。

  大数据真的像说的那么好?毫无疑问大数据确实是一个有价值的工具,并在某些领域产生了至关重要的影响。比如,几乎近二十年人工智能计算机程序的成功,从谷歌的搜索引擎到IBM的沃森电脑问答系统,都包括了大量数据的处理。但是正是因为它最近如此受欢迎并得到广泛应用,我们需要清晰的看待大数据究竟能做什么和不能做什么。

  我们需要大数据,毫无疑问。但是我们也需要更加清醒的认识到,这只是一种每个人都可以分析的重要资源,并不是什么新技术。

时间: 2024-09-29 07:46:42

给大数据降降温:关于大数据的九个问题的相关文章

【大数据100分】大数据架构及行业大数据应用(中级教程)

[大数据100分]南大通用CTO武新:大数据架构及行业大数据应用[大数据中级教程] 主讲嘉宾:武新 主持人:中关村大数据产业联盟 副秘书长陈新河 承办:中关村大数据产业联盟 武新,南大通用高级副总裁兼CTO,法国奥尔良大学和法国国家科研中心博士:南大通用GBASE系列数据库产品的总设计师.在著名的甲骨文公司任职12年,是世界顶级的Oracle数据库专家.2010年获得中组部实施的国家"千人计划"荣誉(海外高层次人才引进计划),是国内基础软件行业唯一入选的数据库技术专家.对目前最新兴的列

2016年大数据金融领域10大趋势

2015 年对于银行和金融业公司来说是一个开局之年,在这一年中他们继续用大数据来帮助他们进行业务和组织架构的演进. 现在,放眼2016年将要面对的,我们猜测: 金融服务公司为了利益最大化进而不断整合大数据环境而言,他们面前的路依旧漫长. 银行家们也正在起草大数据战略,制定入门和随后的用例. 对于银行来说,大数据主要还是围绕提高客户情商,减少风险,符合监管.在可见的未来处于第一梯队的大型金融集团都会继续围绕大数据展开各种动作. 在低端市场,一些中小型的公司(经纪.资产管理.区域银行.顾问等)能够更

数据开放共享是大数据竞争战略核心

文章讲的是数据开放共享是大数据竞争战略核心,随着大数据时代的到来,国家间的竞争正从对资本.土地.人口.资源及能源的争夺,转向对大数据的争夺.大数据颠覆性地改变了世界经济形态.国际安全格局.国家治理模式与资源配置方式.作为基础性.战略性资产的大数据,如何用.怎么用,不仅与经济基础的改造有关,也与上层建筑的改造高度相关,通过大数据来全面提升国家治理能力在当下是个紧迫的课题. 大数据带来的变革是全方位的.作为具有强大变革能力的大数据,不仅引发技术革命.经济变革,更引发政府治理的变革.事实上,信息技术革

大数据服务还是那个大数据服务吗?

2012年大数据是个流行词,没想到4年过后,在一些大数据论坛上还有人会说"如果我有大数据,我会怎样怎样--"好吧,如果还停留在如果上,就不该随便上论坛演讲,讲不好说不准工作都没了.现在大数据挖掘的技术都很成熟,更完善更系统的解决方案早已有人做得非常好.如果连数据都还没有,那就什么都不用提了.毕竟,人工智能+大数据的生态模式已经开启. 7月初,据外媒福布斯报道百度将人工智能+大数据为中国政府采集数据提供支持.7月13日,李彦宏在百度的开放云战略发布会上首度公开百度开放云"人工智

受物联网和大数据推动 2020年92%数据将在云端处理

北京时间11月14日消息,据外媒报道,思科发布云计算市场展望报告称,到2020年时,92%的工作量将由云数据中心处理,只有8%的工作量由传统数据中心处理. 思科称,到2020年时,云数据流量很可能将增长2.7倍,从2015年的每年3.9 ZB增长到2020年的每年14.1 ZB.大数据与其关联的物联网将是推动这一增长的主要力量. 到2020年时,数据库.分析以及物联网工作量将占据总商业工作量的22%,这一占比在2015年为20%.届时,物联网生成的总数据量将达到每年600 ZB,是终端用户或设备

Excel数据透视表10大常用技巧

  Excel数据透视表10大常用技巧           1.样式改变为表格样式 2.计数项改为求和项 3.套用样式 4.隐藏和显示汇总项 5.合并单元格 6.列宽及格式保持不变

初学者,想问大神,如何比较一组数据, 不同类型的 数据 ?求指教

问题描述 初学者,想问大神,如何比较一组数据, 不同类型的 数据 ?求指教 想问大神,如何比较一组数据, 不同类型的 数据 ?求指教,别人说可以用链表(我不会)有别的方法吗 解决方案 比较数据的关键不在链表还是数组,而在于算法本身. 如果你觉得链表复杂,就用数组,以及任何你可以用来表示一组数字的类型. 解决方案二: 不同类型的 数据,你的比较规则是什么? 一组数据,是如何保存的呢?如果是连续保存,直接按内存中的内容比较,简单一些:除非是按链表保存的,才可以用链表.否则不是在自找麻烦! 解决方案三

用sql语句遍历一个表里异常(时间段内很大或者很小)的数据,并将异常数据修改成相应时间段前的数据

问题描述 用sql语句遍历一个表里异常(时间段内很大或者很小)的数据,并将异常数据修改成相应时间段前的数据 我有一张表,里面3字段id.time.value. 由于value中的部分值异常的大,我想批量修改数据,比如说4.1日-4.20日出现中出现异常大的数据,我想把异常大的数据修改成和他时间段(时间段前或者后)差不多的数据,请问下这个sql应该怎么写啊.我用游标的方法怎么实现.谢谢啊! 解决方案 不知道你的数据库是什么,用MS SQL SERVER示意 建表SQL如下 CREATE TABLE

2017年大数据向左走、向右走?且看阿里数据经济研究中心六位大咖怎么看

2016年的市场热点从大数据已经过渡到了人工智能,但大数据.计算能力和算法这三大要素结合在一起才真正造就了人工智能在2016年的崛起.那么,业内专家如何看过去的2016和2017年大数据的发展呢?让我们看下6位ADEC(阿里数据经济研究中心)的特邀研究员的观点吧. 数据隐私界定和保护是焦点 田杰棠 国务院发展研究中心技术经济部副部长 2016年是大数据从探索性应用走向纵深发展的一年,两批共八个国家级大数据综合试验区启动建设,越来越多的行业试水数据分析和应用,一些高校已经开设大数据专业,大数据和人