大数据存储平台必须具有弹性

目前,对于“大数据”的讨论很多,公认的看法是将大数据的系列问题归纳为:海量的数据规模(volume)、快速的数据流转和动态的数据体系 (velocity)、多样的数据类型(variety)和巨大的数据价值(value),以及我们的对策。但实际上,大数据首先要考虑的应该是“大” —— 海量的数据规模。

大数据之“大”

“大”是相对而言的概念。例如,对于像SAP HANA那样的 “内存数据库”来说,2TB可能就已经是大容量了;而对于像谷歌这样的搜索引擎,EB的数据量才能称得上是大数据。

“大”也是一个迅速变化的概念。HDS 在 2004 年发布的 USP 存储虚拟化平台具 备管理 32PB 内外部附加存储的能力。当时,大多数人认为,USP 的存储容量大得有 些离谱。但是现在,大多数企业都已经拥有 PB 级的数据量,一些搜索引擎公司的数据 存储量甚至达到了 EB 级。由于许多家庭都 保存了 TB 级的数据量,一些云计算公司正在推广其文件共享或家庭数据备份服务。

有容乃“大”

由此看来,大数据存储的首要需求存储容量可扩展。大数据对存储容量的需求已经超出目前用户现有的存储能力。我们现在正处于 PB 级时代,而EB级时代即将到来。过去,许多企业通常以五年作为 IT系统规划的一个周期。在这五年中,企业的存储容量可能会增加一倍。现在,企业则需要制定存储数据量级(比如从PB级到EB级)的增长计划,只有这样才 能确保业务不受干扰地持续增长。这就要求实现存储虚拟化。存储虚拟化是目前为止提高存储效率最重要、最有效的技术手段。它为现有存储系统提供了自动分层和 精简配置等提高存储效率的工具。拥有了虚拟化存储,用户可以将来自内部和外部存储系统中的结构化和非结构化数据全部整合到一个单一的存储平台上。当所有存 储资产变成一个单一的存储资源池时,自动分层和精简配置功能就可以扩展到整个存储基础设施层面。在这种情况下,用户可以轻松实现容量回收和容量利用率的最 大化,并延长现有存储系统的寿命,显著提高IT系统的灵活性和效率,以满足非结构化数据增长的需求。中型企业可以在不影响性能的情况下将HUS的容量扩展 到近3PB,并可通过动态虚拟控制器实现系统的快速预配置。此外,通过HDS VSP 的虚拟化功能,大型企业可以创建0.25EB容量的存储池。随着非结构化数据的快速增长,未来,文件与内容数据又该如何进行扩展呢?

不断“生长”的大数据

与结构化数据不同,很多非结构化数据需要通过互联网协议来访问,并且存储在文件或内容平台之中。大多数文件与内容平台的存储容量过去只能达到TB 级,现在则需要扩展到PB级,而未来将扩展到EB级。这些非结构化的数据必须以文件或对象的形式来访问。基于Unix 和Linux的传统文件系统通常将文件、目录或与其他文件系统对象有关的信息存储在一个索引节点中。索引节点不是数据本身,而是描述数据所有权、访问模 式、文件大小、时间戳、文件指针和文件类型等信息的元数据。传统文件系统中的索引节点数量有限,导致文件系统可以容纳的文件、目录或对象的数量受到限制。 HNAS 和HCP 使用基于对象的文件系统,使得其容量能够扩展到PB级,可以容纳数十亿个文件或对象。位于VSP 或HUS 之上的HNAS 和HCP 网关不仅可以充分利用模块存储的可扩展性,而且可以享受到通用管理平台HitachiCommand Suite 带来的好处。HNAS 和HCP 为大数据的存储提供了一个优良的架构。大数据存储平台必须能够不受干扰地持续扩展,并具有跨越不同时代技术的能力。数据迁移必须在最小范围内进行,而且要 在后台完成。大数据只要复制一次,就能具有很好的可恢复性。大数据存储平台可以通过版本控制来跟踪数据的变更,而不会因为大数据发生一次变更,就重新备份 一次所有的数据。HDS 的所有产品均可以实现后台的数据移动和分层,并可以增加VSP、HUS 数据池、HNAS 文件系统、HCP 的容量,还能自动调整数据的布局。传统文件系统与块数据存储设备不支持动态扩展。大数据存储平台还必须具有弹性,不允许出现任何可能需要重建大数据的单点 故障。HDS可以实现VSP 和HUS的冗余配置,并能为HNAS 和HCP节点提供相同的弹性。大数据存储平台需要将文件、块数据和内容集成到一个统一的HitachiCommand Suite管理平台之上,以满足大数据处理和应用的需求。

时间: 2024-12-30 10:42:07

大数据存储平台必须具有弹性的相关文章

大数据存储的首要需求:存储容量可扩展

本文讲的是大数据存储的首要需求:存储容量可扩展,目前,对于"大数据"的讨论很多,公认的看法是将大数据的系列问题归纳为:海量的数据规模(volume).快速的数据流转和动态的数据体系(velocity).多样的数据类型(variety)和巨大的数据价值(value),以及我们的对策.但实际上,大数据首先要考虑的应该是"大"-- 海量的数据规模. 大数据之"大" "大"是相对而言的概念.例如,对于像SAP HANA那样的 &quo

华为与英特尔构建全融合大数据存储解决方案

IDC预测,全球数据总量将在2020年达到40ZB.40ZB的数据量是什么概念呢? IDC给出了一个比喻:如果把一粒沙子当做一个字的话,40ZB的数据量相当于地球上所有海滩上沙子数量的57倍;40ZB的数据量相当于667千亿部高清影片,一个人每天24小时连续不断地看,看完这些电影需要5万6千亿年;目前我们对地球年龄的估值是45.5亿年,意味着,如果这个人从地球诞生的时候就开始看电影,现在他只看完了这些电影总数的万分之八(0.0008).而这些数据,每两年还将翻一番,呈指数级增长态势.大数据将以一

高可用的大数据计算平台如何持续发布和演进

2016年11月18-20日SDCC 2016中国软件开发者大会,阿里巴巴大数据计算平台首席架构师林伟给我们带来了"高可用的大数据计算平台如何持续发布和演进"的演讲.本文主要谈及大数据系统如何做系统迭代,以及大规模系统因为其大规模没有可能搭建对等的测试环境,需要进行在线测试方面的内容,更有在线测试需要的必要条件等等. 阿里巴巴大数据计算平台需要每天不间断的跑在上万台机器集群上,上面承担阿里核心分析计算任务,有着很高的可靠性和SLA的要求,但是我们同时需要持续不断提高系统的性能,降低成本

十大云存储平台技巧

自2016年起,我们已经分析了十大重要存储平台,从实施混合云到制定数据迁移策略. 对于云存储来说,渡过了一个漫长而奇怪的一年.曾经认为的存储时尚刚刚出现在各地,同时云迁移策略比以往更加广泛了.对于一些组织来说,是否实现云存储平台已经不再是问题,而是什么时候实施才是重点. 灾难恢复服务(DRaaS)和物联网(IoT)云存储等技术越来越受到关注. 公有云与私有云的辩论肆虐的同时,却促使混合云吸引更多的用户. 从选择供应商到提高性能,混合云仍然是2016年最热门话题之一. 下面,根据流行度,列举了20

Hadoop环境中管理大数据存储八大技巧

在现如今,随着IT互联网信息技术的飞速发展和进步.目前大数据行业也越来越火爆,从而导致国内大数据人才也极度缺乏,大讲台了解这一情况后专门在网上开通了这一门大数据培训课程,下面来介绍一下关于Hadoop环境中管理大数据存储技巧吧. 1.分布式存储 传统化集中式存储存在已有一段时间.但大数据并非真的适合集中式存储架构.Hadoop设计用于将计算更接近数据节点,同时采用了HDFS文件系统的大规模横向扩展功能. 虽然,通常解决Hadoop管理自身数据低效性的方案是将Hadoop数据存储在SAN上.但这也

管理大数据存储的十大技巧

在1990年,每一台应用服务器都倾向拥有直连式系统(DAS).SAN的构建则是为了更大的规模和更高的效率提供共享的池存储.Hadoop已经逆转了这一趋势回归DAS.每一个Hadoop集群都拥有自身的--虽然是横向扩展型--直连式存储,这有助于Hadoop管理数据本地化,但也放弃了共享存储的规模和效率.如果你拥有多个实例或Hadoop发行版,那么你就将得到多个横向扩展的存储集群. 而我们所遇到的最大挑战是平衡数据本地化与规模效率,这是一个鱼与熊掌兼得的话题. 数据本地化是为了确保大数据集存储在计算

盘点管理大数据存储的十大技巧

在1990年,每一台应用服务器都倾向拥有直连式系统(DAS).SAN的构建则是为了更大的规模和更高的效率提供共享的池存储.Hadoop已经逆转了这一趋势回归DAS.每一个Hadoop集群都拥有自身的--虽然是横向扩展型--直连式存储,这有助于Hadoop管理数据本地化,但也放弃了共享存储的规模和效率.如果你拥有多个实例或Hadoop发行版,那么你就将得到多个横向扩展的存储集群. 而我们所遇到的最大挑战是平衡数据本地化与规模效率,这是一个鱼与熊掌兼得的话题. 数据本地化是为了确保大数据集存储在计算

美年大健康:健康大数据开放平台在路上

"美年健康作为中国最大的大健康数据中心和最大的流量入口平台,目前已经与阿里云展开合作,双方共建云计算平台,并开展了健康体检.医学影像等核心大数据分析及合作应用.通过与阿里云的强强联手, 美年健康将利用阿里云尖端的互联网技术,快速推进美年健康400家体检中心的数字化.智能化.双方联合打造适应未来发展所需要的健康大数据开放平台,及中国最大的健康生态圈.通过不断在云端整合体检上下游产业合作伙伴,预计2020年实现1000家体检中心,2021年专业服务1亿中国人的宏伟目标,持续引领中国大健康服务产业的发

互联工厂大数据云平台打造中国版CPS

摘要:10月13日2016杭州云栖大会拉开帷幕,智能工业专场的上海名匠智能系统有限公司董事长陈俊带来了"工业大数据与云制造"的重要演讲.本文从智能制造带来的机遇和挑战开始谈起,进而对互联工厂进行定位,并讲解了互联工厂的特点,接着重点说明了工业大数据下的互联工厂模型及应用场景,最后简要介绍了立体仓库货位优化控制系统.   以下内容根据演讲PPT及现场分享整理: 本文从智能制造带来的机遇和挑战开始谈起,进而对互联工厂进行定位,并讲解了互联工厂的特点,接着重点说明了工业大数据下的互联工厂模型