企业应该如何在大数据基础架构方面做出选择?

如果询问十家公司他们为了运行大数据负载需要使用怎样的基础架构,那么可能会得到十种不同的答案。现在这个领域当中几乎没有可以遵循的原则,甚至没有可以参考的最佳实践。

不管是从资源还是从专业性方面来说,大数据分析已经成为基础架构领域当中真正的难题。顾名思义,大数据分析工具所针对的数据集合,规模将会非常庞大,并且需要大量的计算、存储和网络资源来满足性能需求。但是这些大数据工具通常是由超大规模企业开发的,这些企业并不存在普通企业需要考虑的同等级安全问题和高可用性问题,而主流IT企业还没有深入了解这些工具,再加上大数据在投资回报率方面的不确定性,导致只有非常少的企业愿意在大数据方面进行投入。

此外,即便对于曾经在Hadoop、Spark和类似产品上运行过大数据集群的部分企业来说,也会在大数据基础架构方面遇到技术和业务方面的挑战。

大数据带来大问题

一家大型远程通讯提供商正在构建一种新的数字服务,预计在今年年底正式推出,并且准备使用Hadoop来分析这种服务所产生的内容、使用情况和收入(广告服务)数据。但是由于这种服务是全新的,因此很难分析应该使用哪种大数据基础架构,负责这个项目的技术副总裁表示。

“对于一个还没有推出的项目来说,我们不可能进行任何容量规划,”他说。

确实,现在很多大数据项目仍然处于初级阶段。“大多数大数据项目的性质比我们想象的还要低,” 可扩展存储基础架构提供商Coho Data CTO Andrew Warfield表示。

即便企业还不是十分了解大数据技术,但这并不意味着企业不应该在大数据方面投入精力。“但是运行这种技术可能面临着很大风险,提前认识到这点非常重要,” Warfield说,他认为企业应该提前考虑基础架构方面的因素。

对于这家远程通讯提供商来说,他们将会采用一种渐进的方式,使用来自于BlueData Software的软件在商用硬件环境当中运行大数据集群,这样就能够从现有的存储系统上访问数据了。

无处不在的数据

如果数据来自于云,那么当然可以直接在云中进行分析;如果数据全部位于本地,那么底层的基础架构也应该位于本地。但是如果数据分散在不同位置,那么无疑会使得基础架构更加复杂。

远程通讯提供商的服务将会同时使用来自于云和本地的数据。对于任何大数据解决方案来说,考虑到合规性、节省时间和网络带宽等因素,能够同时支持两种数据来源都是十分重要的。“同步生产环境当中的数据是一件非常困难的事情,”这位副总裁说,“我们希望将所有的实例全都指向一个单一数据源。”

此外,虽然数据科学家想要分析的信息是可用的,但是现在还不能进行使用,因为其位于大数据计算工具无法访问的存储基础架构当中,Warfield说。一种解决方案是存储硬件使用Hadoop Distributed File System或者RESTful API这样的协议公开这些数据。

注意延迟

对于特性类型的大数据分析来说,将数据从存储阵列移动到计算环境所花费的时间将会对性能造成严重影响。但是如果不将数据跨越整个网络移动到计算环境当中,而是将应用程序移动到数据附近以降低延迟,将会怎样呢?

将计算环境移动到数据附近并不是一种全新的概念,但是现在出现了一种前所未有的实现方式:Docker。比如Coho Data和Intel通过合作证明了这种概念的有效性,在一个大型金融服务公司当中,使用Docker格式封装计算节点,之后在上面直接运行Hadoop负载。

在存储阵列上直接运行Docker容器,这样做的意义在于直接对附近的数据进行分析,而不再需要跨网络移动数据,同时利用任何可用的计算资源。“相比于其他存储平台来说,大数据平台的CPU使用率通常会很高,” Warfield说。“更何况如果你将闪存加入其中,那么问题就会变成‘我该如何从这种资源当中获得更多价值?’”

直接在存储阵列当中运行容器化应用程序是一件非常有趣的事情,但是需要提前对负载进行认真评估,以确保其能够很好地适应当前环境,为建筑行业提供文档管理服务的Signature Tech Studios公司副总裁Bubba Hines说。这种服务基于Amazon Web Services,使用来自于Zadara Storage的存储服务。这家公司最近开始评估新的Zadara Container Service,其中容器化应用程序运行在存储阵列上,可以直接访问本地磁盘。根据Hines的想法,现在有几种可能的使用情况:在存储阵列上运行其灾难恢复软件的容器版本来持续监控用户数据和工作方面的变化,更改或者验证主要存储数据。

但是如果使用Zadara Container Service处理全部数据将没有什么意义。Signature Tech Studio的系统正在按照计划执行数据转换,并且已经实现大规模容器化了。但是“我们可能不会将所有Docker容器移动到Zadara容器服务当中,因为从体积和规模方面考虑这样做并没有意义,”Hines说。“我们必须寻找能够真正从降低延迟当中获利的负载。”

原文发布时间为:2015年10月26日

本文来自合作伙伴至顶网,了解相关信息可以关注至顶网。

时间: 2024-12-24 02:34:35

企业应该如何在大数据基础架构方面做出选择?的相关文章

为什么选择这样的大数据平台架构?

当前BAT基本公开了其大数据平台架构,从网上也能查询到一些资料,关于大数据平台的各类技术介绍也不少,但在那个机制.那个环境.那个人才.那个薪酬体系下,对于传统企业,可借鉴的东西也是有限的. 技术最终为业务服务,没必要一定要追求先进性,各个企业应根据自己的实际情况去选择自己的技术路径. 与传统的更多从技术的角度来看待大数据平台架构的方式不同,笔者这次,更多的从业务的视角来谈谈关于大数据架构的理解,即更多的会问为什么要采用这个架构,到底能给业务带来多大价值,实践的最终结果是什么. 它不一定具有通用性

企业将大规模采用大数据技术

全球技术研究和咨询公司Gartner表示,经过几年的实验及眼见早期采用者获得的成功后,2013年是企业大规模采用大数据技术的一年.根据Gartner针对全球IT主管进行的调查,42%的受访者表示已投资于大数据技术,或将于未来一年内进行相关投资. Gartner研究副总裁Doug Laney表示,企业对大数据的认识以及其所能带来的新的业务转变与日俱增.目前多数企业仍处于采用大数据的早期阶段,仅少数已将其运用至企业层面,或是能认识到大数据对其基础架构.企业与产业所产生的全面影响. 市场破坏力使得新兴

赋能传统企业 首家“SAP大数据应用创新中心”落地贵阳

10月21日,SAP与贵阳市人民政府(以下简称"贵阳市政府")宣布签署战略合作备忘录,共建全国首家"SAP大数据应用创新中心",通过搭建地方产业升级与经济转型的创新平台,赋能贵阳乃至贵州的传统企业,深化制造业与互联网的融合发展. 贵阳市委副书记.市长刘文新(左)与SAP大中华区总裁纪秉盟签署战略合作协议 "大数据时代已经到来,但是大洞察时代还没有到来.对于企业来说,现在更重要的事情是考虑数据的价值在哪里."SAP全球高级副总裁.大中华区总裁纪秉盟

禾连健康CDO沈金:谈云时代的大数据平台架构

11+大数据行业应用实践请见https://yq.aliyun.com/activity/156,同时这里还有流计算.机器学习.性能调优等技术实践.此外,通过Maxcompute及其配套产品,低廉的大数据分析仅需几步,详情访问https://www.aliyun.com/product/odps:更多精彩内容参见大数据频道:https://yq.aliyun.com/big-data . 禾连健康通过为医院提供无线WIFI网络解决方案作为切入点,让医护和患者在享受高速上网服务的前提,为医护提供提

云计算时代 企业要如何迎接大数据?

本文讲的是云计算时代 企业要如何迎接大数据,随着云计算的落地,"大数据"已成为业界讨论最广泛的关键词之一,很多企业已经在寻找合适的BI工具来处理不同来源收集到的大数据,但尽管大家对于大数据的意识在提高,但只有少部分的企业如谷歌和Facebook这样的企业才能够真正利用大数据挖掘企业商业价值. 其实随着大数据时代的来临,企业对于大数据的理解不应仅限于对Apache Hadoop这样的基础技术的了解,企业应该要从基础设施角度来了解和保护企业拥有的大数据.因为在未来3到5年,我们将会看到那些

传统企业该如何在大数据时代找到自己的锚点?

在香港,有家日料店.这家店在很短时间内风靡全港,开了多个连锁店.很多市民都知道这家日料店的海鲜非常新鲜实惠,价格只有别家的七折.我也曾经询问过这位大厨朋友,是什么能做到这么好的生意?大厨神秘兮兮地问我你有没有看到每个餐桌上的摄像头?那就是我们的秘密武器."原来,这家海鲜店每天都会通过摄像头,查看食客点餐.到餐的顺序,以及剩菜的种类分量.通过这样的盘点,这家餐厅的老板可以准确把握消费者的喜好,从而对北海道的海鲜预购量也相对精准.也正因为此,这家餐厅的货源流转迅速,成本也随之降低.这是个有趣的案例.

百度大数据首席架构师林仕鼎:新计算时代

中国最具影响.规模最大的大数据领域盛会--2013中国大数据技术大会(Big Data Technology Conference,BDTC)于2013年12月5-6日在北京举行.数十家领军企业,近七十场主题演讲,不仅覆盖Hadoop生态系统与流式计算,实时计算与NoSQL.NewSQL等技术方向,还对互联网.金融.电信.交通.医疗等创新案例,大数据资源的法律法规.大数据商业利用的政策管制等有深入讨论. 百度大数据首席架构师林仕鼎从一个大数据系统架构师的角度,分享了应用驱动.软件定义的数据中心计

安徽经济报专访:企业如何玩转大数据?

中介交易 SEO诊断 淘宝客 云主机 技术大厅 --专访安徽八度网络科技有限公司总裁刘传勇 大数据.云计算等技术综合应用正引领新一轮IT技术变革,企业内部运作效率提升成为此轮变革中的重心.大数据对于企业有何价值?企业个性化需求如何落地?带着这些疑问,记者专访了安徽八度网络科技有限公司总裁刘传勇. (第一版) (第二版) 记者:近期,八度网络宣布实施云际联盟计划,从而引领安徽云主机进入免费时代,为广大中小企业的网站建设节省了成本,在业内引起不小的反响,请您介绍下相关情况. 刘传勇:近年来,网络信息

IBM全新存储技术助力企业拥抱云及大数据

[天极网服务器频道5月28日消息]近日,IBM在IBM Edge2014大会上公布了面向750家跨国企业的初步调研结果,指出只有不到10%的企业已为云计算.大数据分析.移动设备和社交媒体应用的激增做好了充分准备.这次由IBM商业价值研究院开展的名为"IT基础架构至关重要"的调研活动共收到了来自18个国家.19个行业中750名CTO.CIO及其他技术高管的反馈,旨在揭示企业在全新IT时代中面临的基础架构.业务和组织挑战. 本次调查旨在更好地了解影响IT基础架构的主要趋势,以及企业在维护和