大数据进入企业 应如何继承传统的数据处理方式

  当Hadoop进入企业,必须面对一个问题,那就是怎样解决和应对传统并成熟的IT信息架构。业内部,如何处理原有的结构化数据是企业进入大数据领域所面对的难题。

  当 Hadoop进入企业,必须面对一个问题,那就是怎样解决和应对传统并成熟的IT信息架构。以往MapReduce主要用来解决日志文件分析、互联网点击流、互联网索引、机器学习、金融分析、科学模拟、影像存储、矩阵计算等非结构化数据。但在企业内部,如何处理原有的结构化数据是企业进入大数据领域所面对的难题。企业需要既能处理非结构化数据,又能处理结构化数据的大数据技术。

  在大数据时代,Hadoop主要用来处理非结构化数据,而如何处理传统IOE架构的结构化数据则成为企业面临的一个难题。在此背景下,既能处理结构化数据又能处理非结构化数据的SQL on Hadoop应运而生。

  SQL on Hadoop是2013年最热门的话题,它由Cloudera Impala的发布版推到热议。目前,SQL on Hadoop正处于起步阶段,其技术实践方式很多样。而企业由于已经适应了在小数据上的灵活处理方式,转到Hadoop一下子变得无所适从,所以对SQL on Hadoop的呼声越来越大。SQL on Hadoop既要保证Hadoop性能,又要保证SQL的灵活性。关于SQL on Hadoop,业界有不同的看法,业内专业大数据公司也在积极的研究。

  1.传统方式的DB on TOP

  一些北美厂商采用传统方式的DB on TOP来解决SQL on Hadoop,即组合利用不同的计算框架面向不同的数据操作。其中以EMC Greenplum、Hadapt、Citus Data为代表。Hadapt以PostgreSQL架接在Hadoop上,来完成对结构化数据的查询。它提供了统一的数据处理环境,利用Hadoop的高扩展性和关系数据库的高速性,分开执行Hadoop和关系数据库之间的查询。Citus Data通过把多种数据类型转化成数据库的原生类型,运用分布式处理技术来完成查询。

  图1、Hadapt

  DB on Top 方式是业内同事解决结构化与非结构化数据的最初尝试,最早由Hadapt公司在2010年提出,也就绪了能够跑在Amazon EMR上的社区版。但是,其本质是数据在两种计算框架中分别存放,如图1所示,结构化数据存储于高性能关系型数据引擎(High-Performance Relational Engine for Structured Data),非结构化数据存储于Hadoop分布文件系统(Hadoop Distributed File System for Unstructured Data),对两种类型的数据交互依靠查询的切片执行,元数据的组织控制必然是系统扩展演变中的过度技术。

2.原生态Hive的优化

  在开源社区方面,以Hortonworks的Stinger、Apache Drill为例。Hortonworks的Stinger通过对原生态Hive做改造,优化SQL查询速度,使其达到5-30秒,完成对SQL查询。 Apache Drill通过对原生态的Hive做优化,完成对SQL的查询。

  

  图2、Hortonworks Stinger

  开源社区原生态的改造,目标是建立共同的计算框架和接口,目前各个开源项目虽然还只是孵化阶段,也还是获得了业内的支持,例如Apache的Drill项目,因开放的数据格式和查询语言,就获得了专业的Hadoop商业发行版供应商MapR的支持。

  开源社区的发展和贡献,将成为推动SQL on Hadoop大规模落地行业的主要力量。

3.人机流程交互

  在国内,对于SQL on Hadoop,主要是从SQL的数据处理流程和即席分析两方面来进行。在SQL的数据处理流程方面,很多操作是可以通过对数据处理流程进行预定义,然后对 MapReduce作业进行批处理。例如ETL流程处理。ETL流程处理是对数据进行抽取、清洗、转换、加载的阶段。在此阶段,通过对数据流程进行预定义,在一个人机交互的友好界面上把MapReduce作业预先组装好,进行拖拽等操作形成工作流,来解决传统的SQL。

4.多级索引结构的即席查询

  大数据的即席查询是大数据所面临的一个难题。在PB级别的数据,其查询效率和查询性能都不尽如意。在传统DW环境下,企业多采用OLAP cube。OLAP cube通过对数据进行预处理,将数据根据维度进行最大限度的聚类运算,通过对维度的配置,可以完成对小数据即席分析。但是对于PB级别的大数据环境,如何建立大数据的cube来兼顾前端应用的灵活性和查询效率呢? HBase自带的哈希快速定位功能可以实现即席查询的毫秒级响应和高并发。天云大数据通过在HBase上构建多级索引以及引用MPP方式基于统计分析的分区设计,不仅解决了HBase查询不灵活的特点,还能满足对PB级别大数据的即席查询。

5.操作型SQL on Hadoop

  对于操作型Hadoop,其对SQL on Hadoop 数据查询、响应等已经由存储磁盘级转移到内存上。由于其分布内存一致性要求,使得其发展比较缓慢,目前还不能达到企业应用级别。目前,分布式内存计算已渐趋繁荣,比较有代表的技术先锋如Splice Machine、SQLstream等。目前对于操作型Hadoop,业界正在积极探索中。

  面对企业多年运营所积累的大量结构化数据,SQL on Hadoop无疑成为了分布式计算框架进入企业传统计算市场的敲门砖,但我们更清楚的认识到,Hadoop等主流分布式计算的舞台远不如此,它为企业计算定义了一个更为广阔的零消费市场(White Space)解决SQL之外的计算。

  纷繁复杂的世界不可能简单地由平面展开的表结构来描述,SQL能够胜任查询和数值计算工作。但大量碎片的文字信息、影像图片如何计算?“买入”+“大涨”等于什么?“女性”+“Dior”等于“优雅”还是“性感”?能否用Sum、Group By、Join SQL来做非结构化信息的主题缩略、分类、聚类,我们将在后续文章中探讨这些话题。

时间: 2024-09-20 00:14:31

大数据进入企业 应如何继承传统的数据处理方式的相关文章

大数据进入企业,应如何继承传统的数据处理方式

[摘  要]当Hadoop进入企业,必须面对一个问题,那就是怎样解决和应对传统并成熟的IT信息架构.以往MapReduce主要用来解决日志文件分析.互联网点击流.互联网索引.机器学习.金融分析.科学模拟.影像存储.矩阵计算等非结构化数据.但在企业内部,如何处理原有的结构化数据是企业进入大数据领域所面对的难题.企业需要既能处理非结构化数据,又能处理结构化数据的大数据技术. 在大数据时代,Hadoop主要用来处理非结构化数据,而如何处理传统IOE架构的结构化数据则成为企业面临的一个难题.在此背景下,

大数据为企业带来了竞争优势的4种方式

不久前,"大数据"只是一个时髦的词.如今,"大数据"已成为增长最快的技术之一.根据SNS研究公司的一个新的研究报告,目前全球大数据市场价值为460亿美元,而这个报告预测,到2020年底,全球各行业厂商将在大数据硬件上花费超过720亿美元. 另一个关键的信号是数据中心市场的增长.根据Technavio公司的报告,亚太地区将成为增长最快的数据中心建设市场,其年复合增长率达到17%,到2020年的市场规模将达到200亿美元.这得益于基于云计算的服务产品,消费者数据存储库的

Gartner警示大数据项目不应独立实施

本文讲的是Gartner警示大数据项目不应独立实施,Gartner提醒组织,不要把大数据看作是一个独立的类别;如果忽视了移动化和桌面计算的差别就很有可能存在风险;企业将数据转为现金很有商机. 谈到下周在西班牙举办的BI分析和主数据管理峰会,Gartner分析师Ted Friedman建议组织:"不要将大数据实施独立开来,要将它归为BI的整体战略中." 在新闻发布会上,Gartner声称:"随着IT组织在过去几年中所做的尝试,尤其是Hadoop DBMS产品设备的出现,应用供应

大数据离企业用户到底有多远?

未来是大数据的时代,大数据因此成为一项国家的长远发展战略.近两年的政策利好,使大数据市场再度迎来了新一轮的发展高潮.像"44ZB(泽字节)"这样的惊天数字(业界流传的截至2020年全球大数据规模)因此反复出现在各种大数据会场的电子屏上. 一股焦灼的情绪随之在全产业漫延,还没弄明白怎么搭上"互联网+"的快车呢,大数据又成了另一个新的困扰,一位行业用户曾感叹,"出去不说两句大数据都感觉自己落伍了."而不少医院行业用户直接的反应就是,"小数据

《大数据时代》译者周涛:传统领域是大数据创业蓝海

穿着拖鞋.挽着裤腿的牛仔裤,手拿老款诺基亚直板手机,9月14日,在城南一家白领穿梭的高档商务写字楼,国内大数据行业领军人物--电子科技大学"80后"教授周涛,热情地走进了记者的视线. "大数据时代已经来到我们身边,并没有那么多的云遮雾绕,而是相当接地气."短短一个小时,周涛用身边的例子和最直白的表述,拨开大数据的神秘面纱,描述了一个常人可以触摸的数字化时代? 什么是大数据? "一切都被记录,一切都被数字化." 从硅谷到成都,大数据,这个新鲜的话题

赛迪顾问:大数据时代企业须打好信息资源整合攻坚战

ZDNET至顶网CIO与应用频道 06月23日 北京消息:数据被认为是新时期的基础生活资料与市场要素,重要程度不亚于物质资产和人力资本.近年来,企业产生的数据量呈指数级增长,信息资源爆炸式激增,其中非结构化的数据信息达到85%左右,传统的信息资源管理技术已经无法应对大数据时代的挑战.Hadoop等大数据技术和其他大数据工具和设备的出现以及云计算数据处理与应用模式的广泛运用,为企业处理日益增长的海量非结构化数据提供了高效.可扩展的低成本解决方案,弥补了传统关系型数据库或数据仓库处理非结构化数据方面

大数据时代 企业须打好信息资源攻坚战

文章讲的是大数据时代 企业须打好信息资源攻坚战,数据被认为是新时期的基础生活资料与市场要素,重要程度不亚于物质资产和人力资本.近年来,企业产生的数据量呈指数级增长,信息资源爆炸式激增,其中非结构化的数据信息达到85%左右,传统的信息资源管理技术已经无法应对大数据时代的挑战.大数据技术和其他大数据工具与设备的出现,以及云计算数据处理与应用模式的广泛运用,为企业处理日益增长的海量非结构化数据提供了高效.可扩展的低成本解决方案,弥补了传统关系型数据库或数据仓库处理非结构化数据方面的不足,深化和拓展了企

大数据成企业制胜关键 本土CRM需加紧

物联网.云计算.移动互联网.手机.平板电脑.PC以及遍布全球各种各样的传感器,的数据来源,大数据变成了现今最令人热议的话题.大数据技术让各种各样类型的数据变成能够快速获得有价值信息.CRM作为可以帮助企业获得客户资源的管理平台面对大数据的到来应如何加紧. 大数据转变为先 制胜关键 随着数据源呈现指数级增长,信息的数量及复杂程度快速扩大,从海量数据中提取信息的能力正快速成为战略性的强制要求.2011年4月,Gartner发布<大数据仅仅是海量信息管理的开端>报告.报告称:"对大数据的关

时培昕:工业物联网和工业大数据助力企业实现智能制造|V课堂第83期

2017年架构师最重要的48个小时 | 8折倒计时 工业物联网作为制造业智能化的核心部分被称之为智能制造的神经系统.而工业大数据又是智能化的来源,未来制造企业的运营过程,或者说产品的全生命周期都将由大数据串联起来.那么大数据和工业物联网是如何共同助力企业实现智能智造呢? 第83期[智造+V课堂]分享嘉宾:北京寄云鼎城创始人兼CEO时培昕博士,作为互联网专家,时博士就"工业大数据和工业物联网如何助力企业实现智能制造"的主题带来精彩分享! 分享嘉宾 北京寄云鼎城创始人兼CEO   时培昕