大数据的三个思维变换

维克托·尔耶·舍恩伯格在《大数据时代:生活、工作与思维的大变革》中最具洞见之处在于,他明确指出,大数据时代最大的转变就是,放弃对因果关系的渴求,而取而代之关注相关关系。也就是说只要知道“是什么”,而不需要知道“为什么”.这颠覆了千百年来人类的思维惯例,对人类的认知和与世界交流的方式提出了全新的挑战。

知名IT研究机构Gartner以它对专业IT市场的“魔力象限图”发布作为一种评价方式,在其二维矩阵里,横轴是前瞻的完整性,纵轴是执行力,如果用此分析方法来评价《大数据时代》这本书,它大概位于右下角靠近纵轴中间点的位置。

2012年,笔者看过的3本有关大数据的中文书,它们分别是《证析》、《大数据》和维克托·迈尔·舍恩伯格的《大数据时代》。与其他两本相比,舍恩伯格这本书的特点重在“Impact Analysis”的前瞻分析,在大数据时代的思维变迁方面有启发价值。也说是说,此书对于企业高管和CIO的价值更大,它基本没有太多讨论技术,而偏重于观念转移(Paradigm Shift)。

简单说来,这本书的价值可以用两个“三”、一个“一”来概括:第1个“三”是3个关于大数据的思维变换,重在大数据变革时代的价值与观念变化;第2个“三”是关于大数据影响商业变革的3个要素:即数据、技术与创新思维之间的互动;一个“一”是关于大数据泛化下的治理与隐私。

关于大数据本身的价值已无需赘述,此处重点讨论关于大数据的3个思维变化:1.不是随机样本,而是全体数据;2.不是精确性,而是混杂性,尤其是大数据的简单算法比小数据的复杂算法有效;3.不是因果关系,而是相互关系。

《大数据时代》一书提醒读者,大数据是全数据,至少维度要全,这带来了观察和分析事物的角度变化,尤其相对于传统IT系统数据,大数据强调了数据的外部性和实时性,这两个特性也使得“证析”提到的基于事实(Evidence)的分析成为可能,不过此书忽略了外部数据与企业内部数据结合的分析价值。比如,对于政府来说,分析大范围的公共卫生事件、传染病可以更快地利用大数据(比如微博)发现目前的情况,但具体要调度资源,还是需要结合“小数据”的精确决策。

第2点的核心观念关于大数据的简单算法来自谷歌的洞见,也来自于Hadoop(一个分布式系统基础架构,由Apache基金会开发)这类算法的核心理念。大数据的简单算法是一种统计学的逻辑,这个如同热力学的分析模式,热力学并不关心具体的分子运动,而是关心温度、体积、压强之间的宏观联系,关于这种理念的内在理解,建议读者从吴军的《数学之美》一书中获得,只有真正理解了大数据基于统计学的思维方式,才能理解它的独特优势和局限。这种方式可以解决以往技术无法解决的大范围、实时性和并行处理等问题,并带来新的洞见,它用概率说话,并不是和人就细节较真。这个来自互联网公司的观念是,希望先解决80%的趋势问题,然后慢慢精细化。

第3点,大数据关注“是什么”,而不是“为什么”,经常网购的人会更容易体会。很多电商网站的推荐引擎具备这种能力,它能够在顾客买书的时候,推荐顾客刚好喜欢的其他书籍,顾客可能不知道“为什么”,其实网站也不在乎“为什么”,(“为什么”可以由学术专家慢慢分析)。但是网站根据成千上万甚至上亿人的统计学分析,就可以发现“关联物”,或者说大数据更擅长通过统计分析人类所不能感知的关联,并建议人采取行动。这个革命式的思维非同小可,以前“啤酒+尿布”的数据仓库故事需要数据整理、清洗转换和专家建模挖掘,其采购行为的关联性可能被Hadoop等算法轻易的发现。上述方式由于分析门槛低,已经成为一种常见的工具,并衍生大数据的云服务的商业模式,成为企业可以购买的“分析即服务”(Analytics as a Services),国内阿里系正致力于这种模式的建立。

第2部分关于大数据商业模式方面,最有价值的是关于大数据商业生态的分析,除了大家熟知的数据、技术,作者认为还有第3种基于思维的大数据公司,包括数据中间商等等,这对于国内过于关注技术本身的趋势是个很好的提醒。一个有趣的话题是,作者认为基于统计的数据科学家会逐步取代行业专家,因为大数据发现的新的真实联系,可能会颠覆传统行业专家,这个话题学术界可能很感兴趣。一个耐人寻味的例子是,基于大数据统计分析的自然语言翻译几年前就胜过了基于语义理解的语言学家派别,书中提到的一个从事语言翻译的算法小组甚至开玩笑地说,“每次我们组走了一个语言专家,我们的翻译精确度就提高一些”.

第3部分是关于大数据成为乔治·奥威尔《一九八四》里的“老大哥”,即通过技术手段实现了无处不在的监控以后,隐私和滥用的问题最为让人担心。笔者认为这个话题过于公共,而且已有很多文章在讨论,并不是本书的特质,况且大数据的兴起是一个渐进的过程,各个行业的实用案例尚在兴起,行业内部应专注于行业创新,关于公共的话题的讨论还是留给学者、政府和未来。

西方作者有一类是理念的鼓吹者,最著名是《失控》的作者KK(凯文·凯利),此类被读者推崇为传教士的作者,喜欢推广颠覆式的观念,产生一种前世今生(Before/After)比较的震撼力。本书作者也是如此,如此颠覆,强力的大数据时代似乎正在到来,然而,此类作者也会被人指责为“管杀不管埋”——提出理念,不对具体的可行性负责。回到前文提到的Gartner的“魔力象限图”,渐进的执行力才是大数据这种趋势逐步在各个行业开花的关键。

(责任编辑:吕光)

时间: 2024-10-20 11:21:08

大数据的三个思维变换的相关文章

科技大数据,哲学新思维

大数据,通常用来形容人们创造的大量结构化和http://www.aliyun.com/zixun/aggregation/13739.html">非结构化数据,其特点是4"V",即,数据体量巨大:类型繁多,如网络日志.视频.图片.地理位置信息等等:处理速度快:蕴含着巨大的价值潜力.这种变化不只是科学上的,"大数据浪潮"还引发了思维模式和发展模式的改变――这让哲学家们认识到:必须认识其数理哲学基础. 对数据的认识史就是人类的发展史 人类的生存.发展方式

大数据究竟是不是互联网思维?

大数据在http://www.aliyun.com/zixun/aggregation/8344.html">移动互联网时代显得越来越重要,不仅仅是因为用户的习惯碎片化的趋势明显,更多的是因为在营销多元化情况下用户选择繁多.把握用户属性和用户有效转化是不论传统还是创新企业都同样要面对的问题. 在大家都在探讨互联网思维的时候,到底什么是互联网思维?各家有各家的说法,但是万变不离其宗的是离不开的数据挖掘和分析应用. 关注大数据,关注互联网思维,并不是大家茶余饭后的闲聊话题,大家的目标是提高商业

大数据与统计新思维

译著<大数据时代>( 英国 ViktorMayer-Schǒnberger,Kenneth Cukier 著) 和<驾驭大数据>( 美国 Bill Franks 著) ,以及我国学者涂子沛.郭晓科的<大数据>等几本书引起了广泛的关注,其他各种媒体关于大数据的讨论也层出不穷,大数据已成为流行语.有人认为,大数据是一场新的革命,将横扫一切领域,重构世界.不少国家已将大数据作为国家发展战略,而商业领域更是将其视为下一个投资的宝库.毫无疑问,大数据时代已经来临,它正在悄悄地改变

医疗行业大数据应用三点建议

从目前情况看,实现医院信息基础平台的整合,在技术和产品方面没有任何障碍,最关键的是用户的观念能否转变过来.其实,医院用于购买医疗专业设备的费用高于对IT的投入.医院的领导一定要转变过去那种IT部门是成本中心的观念,医院的发展已经离不开IT.一位医院的CIO告诉记者:"很多人认为银行的IT系统非常重要,其实医院的IT系统更重要性,因为银行的IT系统如果宕机,损失的可能只是金钱,而医院的IT系统如果出现问题,很可能关系到人的生死." 医院信息化的三个发展阶段 在医院信息化1.0时代,IT系

大数据来袭 三招做大媒体“蛋糕”

如果说大数据能够成就一篇出色的报道,你可能多少还会有点惊异.但9月6日下午在京举办的大数据时代内容产业的跨界创新峰会上,这已经不是观点 而是案例.在这场主题为"跨界创新 融合发展"的大会上,参会者不仅有媒体人.互联网从业者,还有高校统计学院院长.传播咨询机构创办人等.他们从各自的实践和研究出发阐释跨界融合的思考与 探索. 一转观念  从生产新闻到生产数据 "2011年,美国佛罗里达州发生一起警察超速驾驶造成的交通事故.记者调查发现,2004年起该州发生了300多起此类事故,经

企业实施大数据的三个问题和五大关键

很多正在实施大数据的企业或机构并不成功,为什么?他们实施大数据都存在共同的问题,最为典型和严重的是三个问题是 刚刚过去的2016年,是大数据从概念到务实落地的一年.在过去的一年内,互联网行业.电信行业.金融行业.房地产行业.汽车行业.娱乐行业.教育行业.零售行业.能源行业.医药行业.政府机关等都在不同程度的接触和实施大数据.很多正在实施大数据的企业或机构并不成功,为什么?他们实施大数据都存在共同的问题,最为典型和严重的是三个问题是: 问题1:业务部门没有清晰的大数据需求和规划 很多企业业务部门不

企业存储大数据的三种环境

大数据的部署实施需要结合具体的应用场景.实际上,http://www.aliyun.com/zixun/aggregation/13861.html">企业大数据的存储处理可以用 "三只小猪盖房子"(分别使用稻草.木头和砖头)的故事来说明,这个故事能更形象地反映数据存储环境下与交付服务(成本)相对应的不同保护级别(完整性和可靠性). 财务数据.对外报告和法规遵从性数据需在"砖房"(BRICKS)环境中存储处理.这些数据需要可靠的硬件基础设施,并与其原

白云区社保中心紧跟“大数据”步伐三步走 加强医保基金管理

自2015年贵阳数博会树立以"大数据"作为贵阳发展的战略目标以来,白云区社保中心紧跟"大数据"步伐,结合自身实际情况,充分利用"大数据"加强对医保基金监管. 第一步:建立中心数据库台账.根据系统内医院上传的数据信息,建立医院基金使用数据电子台账,对辖区所管医院按月度.季度.半年度.年度对基金的使用情况进行数据分析,及时掌握医保基金使用情况.对基金使用增长率过快的医院进行重点监控,并通过明查.暗访.联合检查等多种措施保证基金得到合理使用.同时,建立

工信部:大数据从三方面促进智慧城市建设

国务院新闻办公室定于http://www.aliyun.com/zixun/aggregation/33721.html">2014年4月23日(星期三)上午10时举行新闻发布会,请工业和信息化部相关负责人介绍2014年第一季度工业通信业发展情况,并答记者问. 工业和信息化部总工程师新闻发言人张峰在回答提问时表示,大数据是智慧城市的智慧核心.智慧城市建设带来数据量爆炸式增长的同时,大数据也支撑着智慧城市的建设和发展.大数据是智慧城市各个领域实现智慧化的关键支撑技术,从政府决策与服务,到城市