拥抱Hadoop领跑大数据 实现价值回报

本文讲的是拥抱Hadoop领跑大数据 实现价值回报,当大数据风暴来临的时候,你是否已经做好准备?2012年对于企业来讲最为企业CIO所关心的话题之一必然要属于大数据。我们看到无论是个人还是企业,随着互联网、3G技术的普及以及企业自身数据的积累,大量的数据被产生,而这些大数据最终在存储、安全以及价值转换将成为企业关注的焦点。

  相关数据调查显示,到2020年,电子数据存储量将在2009年的基础上增加44倍,达到35万亿GB。根据IDC数据显示,截止到2010年,这个数字已经达到了120万PB,或1.2ZB。如果把所有这些数据都存入DVD光盘,光盘高度将等同于从地球到月球的一个来回也就是大约 480,000英里。

  大数据与Hadoop之间的联系

  在让我们应用大数据前,先让我们了解一下什么是大数据,百度百科对于大数据的定义是这样的:从各种各样类型的数据中,快速获得有价值信息的能力,就是大数据技术。明白这一点至关重要,也正是这一点促使该技术具备走向众多企业的潜力。大数据的4个“V”,或者说特点有四个层面:第一,数据体量巨大。从TB级别,跃升到PB级别;第二,数据类型繁多。第三,价值密度低。以视频为例,连续不间断监控过程中,可能有用的数据仅仅有一两秒。第四,处理速度快。1秒定律。最后这一点也是和传统的数据挖掘技术有着本质的不同。业界将其归纳为4个“V”——Volume,Variety,Value,Velocity。


▲数据正在呈爆炸性增长

  提到大数据我们可以想到很多相关的技术或者产品,其中Hadoop技术备受用户关注。据了解,Hadoop是一种用于大数据的应用程序,因为它是建立在MapReduce基础上的,所以引起了极大的关注。(MapReduce是一种用于超级计算的普通方法,之后经过了主要由Google资助的一个项目的优化,因此被简化并变得考究了。) Hadoop是几个紧密关联的Apache项目组成的混合体的主要安装启用程序,其中包括MapReduce环境中的HBase数据库。


▲大数据是指大交易数据、大交互数据和大数据处理的总称

  很多人认为Hadoop和大数据基本上是一个意思,这是错误的。Teradata, MySQL和“智能聚合技术”的某些安装启用都用不到Hadoop,但它们也可以被认为是大数据。为了充分利用Hadoop和类似的先进技术,软件开发商们绞尽脑汁研发出了各种各样的技术。而对于用户来讲,则是希望借用Hadoop以及大数据,实现最大价值。


▲Informatica核心技术部资深产品管理总监 郑玮

  相关行业专家表示,在IT环境中,Hadoop不可能作为一个孤岛存在。为了让Hadoop可以跨越不同平台并成为一种主流技术,用户需要将Hadoop作为他们IT大环境中的一部分来管理,通过Hadoop重复使用他们的开发技巧、资产及数据,并统筹管理全部数据。


▲Hadoop是一个具有可扩展性、容错性、源代码开放性的大数据存储和处理平台

  Informatica核心技术部资深产品管理总监郑玮在接受IT168记者采访时表示,Hadoop能够带来两方面的好处:一是可以帮助企业降低数据的成本;二是提高产品的价值。当前,企业现在存在这样一种情况,拥否有大量的数据,即使是一个小企业很有可能也有大数据的问题。


▲Hadoop应用分布

  支撑大数据 Informatica 9.5释放Hadoop潜能

  面对大数据以及Hadoop,国内外众多的服务都宣布对于其进行支持和服务,数据集成服务商Informatica同样也对Hadoop技术进行了良好的改进,据郑玮介绍,主要体现在以下几个方面:

  第一、从处理角度来看没有太大区别,我们会充分利用Hadoop的功能降低成本、提高计算功能和计算速度。

  第二、数据在Hadoop上需要知道数据的形态,数据的转换和存取是怎样操作?数据发觉将产生一个问题,意味质量问题。因此必须重视数据的质量。首先,要确定数据的质量,就需要进行探索发现。


▲Hadoop带来的价值

  第三、对Informatica来说是非常独特的,它能够对数据进行解析。数据的类别非常多,它的数据类型是问题有半结构和非结构性的数据,何进行分析数据呢?首先要解析,把它们变成可以工作的结构数据来准备数据。

  第四、转换数据。一旦把数据进行定型进行格式化,转换数据需要做什么?任何转换都可以做比如过滤、集成、分类等,任何的转换都可以在Hadoop平台上来做这样的转换。


▲Informatica 9.5释放Hadoop潜能
 

  第五、客户应用Informatica的Hadoop技术,现在使用Informatica技术可以把客户整个的数据放在里面。最终一步,是从从Hadoop上来读取数据。

  据了解,针对于大数据的应用,Informatica9.5能够支撑HAdoop技术,而将于今年年底9.5.1版本功能将更加强大。

  郑玮指出,企业用户使用Informatica9.5能够有以下好处:

  第一、有可重复的过程,重复性是非常重要的。我们在合同上进行编码,问题是今后可以重复过程,这是一个好处。

  第二、Hadoop技术改变非常快,如何防止陷入一种技术无法改变,这是一个问题。一个办法就是与Informatica来合作,无论它的实施是什么,Informatica都会给提供支持,保证可以充分地利用数据的价值,还有实施的选择。


▲Informatica 9.5优势

  第三、成千上万的数据不仅仅是在Hadoop上面,因此我们从客户的反馈,他们希望能充分的利用大数据放在Hadoop系统上,然后可以使用源数据进行影射。

  第四、数据治理方面。不仅仅是重复性,同时还可以很好地进行管理,来监督整个Hadoop的生态系统。不仅仅是Hadoop的生态系统,还有如何适应其它的环境,因此有数据仓库、数据档案。据了解,Informatica 9.5的多项进展,使得Hadoop成为企业级之选。通过交互性、生产力及可管理性,Informatica 9.5提供全新及扩展功能,释放了Hadoop的潜能,使用户能够提高大数据的投资回报。

  通过数据接入拓展了其交互性,包括社交媒体数据,并且可将其通过批量或实时的方式导入Hadoop。

  通过在Informatica中利用图形数据设计数据集成任务及流程,提高了生产力,并且可将设计直接部署在Hadoop中进行自主执行。

  借助通用数据整合平台,提高了所有企业数据的可管理性,包括Hadoop中的数据。


▲用高性能的通用数据访问释放Hadoop性能

  通过访问社交数据以扩展交互性,带来对Hadoop近乎实时的管理

  鉴于社交计算继续急速增长的步伐,许多企业正在转向利用社交数据,从而更加清晰地洞悉用户及市场。Informatica 9.5 带来了扩展的社交数据集成功能,以帮助获取社交数据,并且可以以批量、数据流或者复制的方式将数据按任意延迟速度导入Hadoop中。新功能包括:

  对社交数据更好的连接性:Informatica 9.5可提供对Twitter数据流的支持,以及一个数据流API支持RSS、ATOM或其它网页来源协议。


▲数据集成和数据质量 Hadoop MapReduce处理

  近乎实时的数据复制至Hadoop:Informatica 9.5 提供了Informatica 快速克隆及数据复制HDFS支持功能,以大量快照及近乎实时数据复制的方式将数据导入Hadoop。

作者: 李伟

来源: IT168

原文标题:拥抱Hadoop领跑大数据 实现价值回报

时间: 2024-08-06 20:16:01

拥抱Hadoop领跑大数据 实现价值回报的相关文章

大数据巨头入驻中国 Cloudera领跑大数据标准化

ZDNet至顶网服务器频道 12月15日 新闻消息:近年来,随着云计算.移动互联网.物联网等技术的快速发展,数据正呈爆炸式增长,大数据时代已经来临.面对中国市场对大数据解决方案的强劲需求,国际领先的大数据巨头Cloudera公司于12月10日正式宣布在中国设立分公司,将帮助Cloudera提升其在中国的影响力,为中国的用户提供大数据解决方案. 12日,Cloudera在北京召开了媒体见面会,包括Cloudera公司创始人兼首席执行官Mike Olson(欧胜迈).Cloudera全球副总裁大中国

R语言领跑 大数据岗位霸占IT薪酬榜单

在过去一年中,技术行业的整体收入增幅约为3%,而熟悉大数据相关语言.数据库以及技能的人才则在其中扮演着薪酬领跑者的角色. 根据Dice网站最新公布的2013至2014http://www.aliyun.com/zixun/aggregation/10529.html">薪酬调查报告,2013年美国技术行业平均工资由上年的85619美元提升至87811美元.这家技术求职网站同样指出,其中最显眼的是,目前十大薪酬最高的IT岗位当中有九个都与大数据相关技术密不可分. R语言领跑整份薪酬榜单,这套

华三发布FlexData数据库一体机 ”领跑大数据时代

ZDNet至顶网服务器频道 01月04日 新闻消息:12月26日,杭州华三通信技术有限公司在杭州举办了"融'慧'贯通--FlexData系列一体机"发布会,与上海引跑信息科技有限公司(INTPLE)携手进军高端数据库服务器市场.此款分布式数据库一体机,面向企业提供数据中心硬件设备与分布式数据库的深度融合和一体化交付,代表了当前分布式数据库一体机设备的最高水准,是大数据时代数据中心应用最理想的选择.这是华三在新IT基础架构领域的最新举措,也是华三新IT深价契合战略的再次落地. 云计算.大

用你的“搜商”来领跑大数据时代

"大数据"时代的到来,让一个叫"搜商"的名词焕发了光彩. "搜商"英文缩写为SQ,是一种与智商.情商并列的人类智力因素.在信息爆炸的21世纪,面对海量信息包围的困境,决定人生成败与否的关键因素就是搜商.搜商早已存在,从问路.查地图.翻阅图书资料,到使用搜索引擎,都是人类搜商的体现. 正如大脑尚未开发的部分还有约95%,已经存在并公开的知识,也还大有搜索空间. 为什么同样借助电脑做毕业论文,A得优秀,B被打回重写?为什么同样查一个公司客服电话,C花

公开数据 政府领跑大数据时代

广泛采集数据.综合处理数据,实现公共服务的技术创新.管理创新和模式创新,这是大数据时代的必然选择.

大数据进入价值变现的2.0时代

文章讲的是大数据进入价值变现的2.0时代,移动互联网和传感器出现推动了大数据时代的出现,大量非结构化数据的出现令数据处理面临了难题,在大数据时代初期,有关大数据应用主要集中在收集数据,存储数据.处理数据等方面,解决的是主要是数据效率问题.当数据效率问题被解决之后,大数据价值变现问题将摆到面前,也就是说大数据将进入2.0时代(价值变现时代). 一大数据1.0时代的特征 大数据1.0时代的主要特征是发现大数据,存储和处理大数据.大数据4个V中的前3个V(大量的数据.多变的数据.高速的数据)都被有效的

大数据的价值实现之旅

大数据开启了人类数据管理史的一段崭新旅程.人类想要测量.记录和分析世界的渴望是驱动大数据技术不断向前的动力.但如同此前的电子商务.云计算等创新构想一样,大数据也不得不怀抱变革理想在现实中披荆斩棘. 我们该如何定义我们所身处的信息技术时代?是云计算.社交.移动,还是大数据?相信每位从业者和客户都会有自己的认知与解读."一千个人眼中就有一千个哈姆雷特",很多时候是一个放之四海皆准的道理,更何况我们正在经历一段创新趋势叠加.创新领域融合的独特时期.而对于那些想要体会技术创新真正内涵的人士,有

创业必称“大数据”?是时候重新审视大数据的价值了

"大数据"这个概念大约是从2011年开始火起来的,如果从Apache Hadoop项目的正式启动算起,海量数据的分布式存储.管理和计算技术已有10年的历史.这10年里,创业圈逐渐流行起一种通病,但凡创业必称"大数据",似乎每个创业项目都会多少与之关联.大数据到底是什么?它是一项技术.一个产业还是一种思维方式?当越来越多的人将兴趣转移到AI.VR上时,也许是时候重新审视大数据的价值了. 在IT领域,一项技术的价值得以验证并实现往往需要走完四个阶段:技术原创.开源.产业

Facebook专家:Hadoop不足以处理大数据

文章讲的是Facebook专家:Hadoop不足以处理大数据,随着大数据在各个业务领域的发展和应用,相关的技术和工具也层出不穷,其中Hadoop框架受到更多的关注和应用.Facebook分析主管Ken Rudin最近在纽约举行的一个Strata+Hadoop世界大会发表主题演讲时表示,不要小看关系型数据库技术的价值.他认为,Hadoop编程框架可能是"大数据"运动的代名词,但它并不是企业从大规模存储的非结构化信息中得到价值的唯一工具. 有很多很普及的大数据的观念需要被质疑,首先一点就是