Hadoop局限性与数据多样性令数据科学家抓狂

  企业用户正逐渐将更多注意力集中在创建大数据分析能力身上,而">数据科学家则因此而承受着更为沉重的压力。

  在Paradigm4(也就是开源计算数据库管理系统SciDB的缔造者)本周发布的一份面向超过一百位数据科学家的调查报告当中,他们发现有71%的受访数据科学家认为随着数据源种类以及数据规模的不断增加、他们的工作难度也随之逐步攀升。

  值得注意的是,只有48%的受访者在调查中表示他们曾经在工作当中使用过Hadoop或者Spark,而且76%的受访者认为Hadoop的执行速度太过缓慢、在建立规划时需要投入大量精力或者存在其它严重局限。

  “数据源种类的不断增加正迫使数据科学家们寻找处理问题的捷径,否则数据量与财政预算之间的矛盾将变得不可调和,”Paradigm4公司CEO Marilyn Matz表示。“目前对于数据规模的关注掩盖了分析工作当中的真正挑战所在。只有解决对不同类型数据加以利用这一重大难题,我们才有可能释放分析手段当中所蕴藏的巨大潜能。”

  即使抛开Hadoop平台周边存在的诸多挑战性因素,其本身也仍然无法令人满意。约有半数受访者在调查中表示(49%),他们发现自己的数据很难与关系型数据库表相适应。59%的受访者指出他们所在的企业已经开始使用复杂的分析机制——包括协方差分析等数学手段、集群化、机器学习、主成分分析与图形操作,而非商务智能报告等“基础分析”手段——对业务数据进行分析。

  另有15%的受访者计划在未来一年中开始使用复杂分析机制,16%的受访者则将复杂分析机制的引入规划设定在未来两年内。只有4%的受访者表示他们所在的企业尚无计划使用复杂分析方案。

  Paradigm4认为这意味着大数据这一“唾手可得的价值果实”已经开始转化为实际收益,而数据科学家们将需要进一步深入研究、从而最大程度提升其附加价值。

  “大数据发展进程中由简单向复杂分析的过渡预示着分析机制将逐步走向规模化道路,而这个过程将超越单一服务器内存容量限制、将分散且易于忽略的价值作为关注重点并需要以适当的混合采样频率作为依托——这一切都将成为分析领域的新兴需求,”Paradigm4在报告中写道。“这些复杂分析方法同时也会给数据科学家带来众多不受监管且无从假设的实际处理方案,并最终让数据自身有能力给出结论。”

  有时候单靠Hadoop还远远不够

  Paradigm4还认为,Hadoop已经被不切实际地夸大成了一套具有普遍性与颠覆性的大数据解决方案。报告指出,在某些特定复杂分析用例当中,Hadoop根本不能算是可行的解决方案。Paradigm4表示,基础分析已经成为一种“高度并行机制”(也被称为‘数据并行机制’),而复杂分析则并非如此。

  所谓高度并行问题可以被拆分成多个独立的子问题且能够并行运作——不同任务之间几乎甚至完全不存在关联性,因此大家不需要一次性访问全部数据内容。这也正是Hadoop MapReduce在处理数据时所遵循的办法。而非高度并行类分析任务,例如众多复杂分析问题,要求一次性使用并共享全部数据内容并在处理过程当中随时进行结果通信。

  22%的受访数据科学家在调查中表示,Hadoop与Spark并不适合自己的分析实例。Paradigm4公司还发现,35%的受访数据科学家曾经尝试过Hadoop或者Spark,但最终放弃了将其引入实际业务环境的打算。

  Paradigm4在报告中提到的111位美国数据科学家来自由创新研究企业Innovation Enterprise自3721.html">2014年3月27日到4月23日进行的调查群体。Paradigm4在下面这份图表当中汇总了全部相关调查结果。

  原文链接:http://www.cio.com/article/2449814/big-data/data-scientists-frustrated-by-data-variety-find-hadoop-limiting.html

时间: 2024-10-09 12:56:20

Hadoop局限性与数据多样性令数据科学家抓狂的相关文章

调查显示76%的数据科学家认为Hadoop太慢

据分析调研公司Paradigm4一项调查显示,76%的数据科学家认为Hadoop太慢了.数据科学家表示,Hadoop作为开源软件框架,在实际应用中还需要更多的精力进行编程,与大数据应用需求相比,其处理速度也还不够快. 据分析调研公司Paradigm4一项调查显示,76%的数据科学家认为Hadoop太慢了.数据科学家表示,Hadoop作为开源软件框架,在实际应用中还需要更多的精力进行编程,与大数据应用需求相比,其处理速度也还不够快. 91%的受访者表示,正在执行有关大数据的复杂分析,其中39%的人

数据科学家调查:受挫数据多样性,吐槽 Hadoop

经过无数权威媒体的反复轰炸,我们大致已经相信,数据科学家是21世纪最神秘最性感最多金的职业,他们是大数据时代数据炸弹的拆弹专家,企业数字化经营的发动机,他们的身价堪比NFL四分卫,而且,他们比昆仑山上的雪豹数量还少. 显然,数据科学家个个都是十八般数据分析武艺样样精通的绝世高手,但他们近来也有烦心事.不久前,开源数据库SciDB开发商Paradigm4进行的一项针对111名北美数据科学家的调查显示,71%的数据科学家认为数据来源的多样性(IT经理网记者此前曾与百度创始七剑客之一,酷我音乐CEO雷

数据科学家大调查:职业受挫数据多样性,吐槽Hadoop

经过无数权威媒体的反复轰炸,我们大致已经相信,数据科学家是21世纪最神秘最性感最多金的职业,他们是大数据时代数据炸弹的拆弹专家,企业数字化经营的发动机,他们的身价堪比NFL四分卫,而且,他们比昆仑山上的雪豹数量还少. 显然,数据科学家个个都是十八般数据分析武艺样样精通的绝世高手,但他们近来也有烦心事.不久前,开源数据库SciDB开发商Paradigm4进行的一项针对111名北美数据科学家的调查显示,71%的数据科学家认为数据来源的多样性(IT经理网记者此前曾与百度创始七剑客之一,酷我音乐CEO雷

数据科学家和大数据技术人员工具包

数据科学家的常用工具与基本思路,数据分析师和数据科学家使用的工具综合概述,包括开源的技术平台相关工具.挖掘分析处理工具.其它常见工具等几百种,几十个大类,部分网址.为数据科学教育和知识分享,提高数据科学人员素质. 数据科学融合了多门学科并且建立在这些学科的理论和技术之上,包括数学.概率模型.统计学.机器学习.数据仓库.可视化等.在实际应用中,数据科学包括数据的收集.清洗.分析.可视化以及数据应用整个迭代过程,最终帮助组织制定正确的发展决策数据科学的从业者称为数据科学家.数据科学家有其独特的基本思

Facebook数据科学家解密数据分析驱动用户增长

本文内容来源于作者在知乎的一场直播,内容关于如何通过数据分析驱动用户增长.由于 Facebook 有严格的保密要求,所以这次直播内容不会透露属于内部消息的数据.产品或者策略.直播里提到的例子如果涉及到 Facebook ,都会是已经公开的信息(一般是 Facebook F8 大会提到过的或者 Engineer blog 上的内容).  先简单介绍一下我自己.我是清华生物系本科和硕士毕业,之后去北卡大学念药物药理学的博士,中间发现自己不适合走生物科研的路,所以在博士开始两年多的时候决定转硕士走人.

【独家】考察数据科学家和分析师的41个统计学问题

介绍   统计学是数据科学和任何数据分析的基础.良好的统计学知识可以帮助数据分析师做出正确的商业决策.一方面,描述性统计帮助我们通过数据的集中趋势和方差了解数据及其属性.另一方面,推断性统计帮助我们从给定的数据样本中推断总体的属性.了解描述性和推断性统计学知识对于立志成为数据科学家或分析师至关重要. 为了帮助您提高统计学知识,我们进行了这次实践测试.测试涉及描述性和推断性统计.测试题提供了答案和解释,以防你遇到卡壳的问题. 如果您错过了测试,请在阅读答案之前尝试解决问题. 总得分 以下是测试得分

跟着Twitter的数据科学家,体验窥探天机的兴奋

"Robert Chang回顾两年来的心路历程,样本量N=1." Intetix Foundation(英明泰思基金会)由从事数据科学.非营利组织和公共政策研究的中国学者发起成立,致力于通过数据科学改善人类社会和自然环境.通过联络.动员中美最顶尖的数据科学家和社会科学家,以及分布在全球的志愿者,我们创造性地践行着我们的使命:为美好生活洞见数据价值. 2015年6月17日是我在Twitter工作两周年的纪念日.回想起来,两年间,数据科学在Twitter的应用方式和范围发生了很大变化: 工

稀缺的数据科学家

2006年Jonathan Goldman到商业社交网站LinkedIn工作,那时的LinkedIn还只是刚创业不久,网站注册人数不到8百万,但是很多成员会邀请自己的朋友和同学加入,因此注册人数迅速增加.但是用户要找到已经在网站注册的用户不太容易,比例达不到管理人员的期望值.很明显,有些社交体验缺失了.如同一位LinkedIn管理者说的,这就好像,你到了会议接待处,结果发现一个人都不认识,你只好站到一边,一个人小酌很可能你早早地离开了. Goldman是斯坦福物理学博士毕业,他非常着迷于越来越多

数据科学家:二十一世纪最性感的职业

2006年Jonathan Goldman到商业社交网站LinkedIn工作,那时的LinkedIn还只是刚创业不久,网站注册人数不到8百万,但是很多成员会邀请自己的朋友和同学加入,因此注册人数迅速增加.但是用户要找到已经在网站注册的用户不太容易,比例达不到管理人员的期望值.很明显,有些社交体验缺失了.如同一位LinkedIn管理者说的,这就好像,你到了会议接待处,结果发现一个人都不 认识,你只好站到一边,一个人小酌很可能你早早地离开了. Goldman是斯坦福物理学博士毕业,他非常着迷于越来越