阿里云发布大数据产品ODPS 6小时处理100PB数据

  阿里云发布ODPS 可分析PB级海量数据

  新浪科技讯 7月8日下午消息,阿里云计算发布大数据产品——ODPS。通过ODPS在线服务,小型公司花几百元即可分析海量数据。ODPS可在6小时内处理100PB数据,相当于1亿部高清电影。此前,全球掌握这种能力的公司仅有Google、亚马逊等少数几家。

  阿里云ODPS团队在一封公开信《人人都可以成为BAT》中表示:工业革命后的200多年里,人类对物理资源的利用登峰造极,对数据资源的利用却仍处于起步阶段。Google、Facebook、阿里巴巴等互联网公司先行一步,触碰到了大数据的魅力。然而,人类拥有的绝大部分数据还无法产生价值。

  采用传统方案处理大规模数据,一般得耗资数千万自建数据中心,请专业技术人员维护运作。一旦数据总量超过100TB,技术挑战会非常大。Hadoop开源运动降低了这一成本,不过自建一个像样的Hadoop集群,仍然需要上百万的起步资金。专业的Hadoop人才则更加稀缺。

  相比而言,使用ODPS的成本和门槛则低得多。ODPS采取按量收费的模式,目前定价0.3元/GB,即开即用,一个月内免费。根据大部分公司的数据量来测算,一般每月只需花费数百元。

  在对外商用之前,ODPS只是阿里巴巴内部秘密使用。阿里小贷最先将ODPS应用到商业领域。如今,超过36万人从阿里小贷借款,最小贷款额为1元,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。阿里小贷每笔贷款成本3毛钱,不到普通银行的1/1000。

  据悉,淘宝、支付宝等阿里巴巴最核心的数据业务,都运行在ODPS平台。比如阿里妈妈广告的核心算法,点击预测模型的训练等。ODPS商用,意味着阿里云将这种大数据处理能力对外开放,此举将大幅降低社会创新成本。

  目前,全球提供类似服务的仅有Google和亚马逊,国内尚无同类产品可供比较。阿里云方面表示,ODPS将比Google BigQuery更强大,不仅支持更丰富的SQL语法,还将提供MapReduce编程模型和机器学习建模能力,可以服务更多应用场景。(木南)

  以下为阿里云ODPS团队公开信《人人都可以成为BAT》全文:

  阿里云计算最重要的一款产品——ODPS,正式开放商用。从今天起,花个几百块钱,人人都能来玩大数据。

  简单来说,ODPS(Open Data Processing Service)是一项Web服务,大家不用花大钱建数据中心,就能分析海量数据。我们测过,100PB的数据任务可在6小时内跑完。这个数据量相当于1亿部高清电影。

  工业革命后的200多年里,人类对物理资源的利用登峰造极。第一次信息革命过去70年了,我们对数据资源的利用却只是刚开了头。Google、Facebook、阿里巴巴等先行一步,摸到了大数据的冰山一角。然而,人类拥有的大部分数据,还无法产生价值。

  如何让数据产生价值?先得拥有大规模处理能力,然后才是挖掘、算法和分析。传统的做法是这样的:租个机房,买一堆昂贵的设备搭建数据仓库,再请一帮技术人员来维护运转。一旦触发bug,或者当数据总量超过100TB时,你的工程师们可能会被这些麻烦搞崩溃。

  Hadoop开源系统很伟大,大大降低了成本。阿里是中国玩Hadoop玩得最好的几家公司之一,Hadoop支撑了淘宝、支付宝早期业务的快速发展。不过,自建一个像样的Hadoop集群,得百万起步资金,专业的Hadoop人才更是稀缺。门槛还是太高。

  有没有更好的方案?从2009年初,写下“飞天”第一行代码时,我们就坚信这一方案存在。我们用了五年时间,写下250万行代码,终于在自主研发的“飞天”平台上成功搭建ODPS。我们把数据海洋里的“水”灌进ODPS,设定好一套参数,拧开水龙头,出来的就是“鲜榨果汁”!

  100年前,福特推出了全球第一条流水生产线。一个个零部件扔进流水线,90分钟后,一辆崭新的汽车摆在面前。不知道福特工程师们当时是怎样的心情。当我们拧开ODPS的水龙头时,感受大抵如此。这个比喻还不完全恰当,福特生产线只为福特服务,一条生产线也只能生产一种车型。而ODPS任何人都可以来用,水龙头里流出来的“果汁”,随着原始数据和算法的改变可以千变万化。

  我们来看看ODPS都可以榨哪些“果汁”吧。

  ODPS之前一直在阿里内部试用。第一个“小白鼠”是阿里小贷。你见过敢贷1块钱给你的银行吗?如今,超过36万人从阿里小贷借款,最小贷款额1块钱,并实现3分钟申请、1秒放款、0人工干预。要做到这一点,阿里小贷每天得处理30PB数据,包括店铺等级、收藏、评价等800亿个信息项,运算100多个数据模型,甚至得测评小企业主对假设情景的掩饰和撒谎程度。另外,阿里小贷每笔贷款成本3毛钱。什么?你问普通银行的贷款成本?先乘个1000再说。

  华大基因,2003年国内抗SARS研究的主力军。去年,我们邀请华大在ODPS上试了下基因测序,耗时不到传统方式的十分之一。2010年,欧洲E.coli污染危机,测序和组装耗时两天以上。如果用ODPS,只要几个小时甚至几十分钟。一旦未来真有生物危机爆发,人类可以赢得宝贵的破译时间。

  这么高精尖的领域你可能觉得太遥远。说说当前最火的世界杯吧。Google拿英国体育数据提供商Opta Sports的数据,在BigQuery上跑了跑,成功预测了本届世界杯8强名单。ODPS是一款跟Google BigQuery类似的产品,如果哪位有数据,也可以来算一算接下来的比赛。

  公共领域的数据挖掘,可以用ODPS吗?当然!结合中国气象局的精准预报数据,高德(20.89, 0.00, 0.00%)地图不久后就能告诉你:“前方道路已严重积水,您的车辆驶入可能会遭水淹,建议绕道行驶。”如今,每盒药品上都有一张电子身份证,从生产、流通、储存、配送、销售到使用,全过程的数据都跑在ODPS上,一旦发现问题药品,监管部门可以立即采取措施。我们期待未来每一桶油、每一道菜的数据都跑在ODPS上,食品安全问题需要通过创新的方式来解决。

  生产电饭煲的工厂,应该跟ODPS没什么关系吧?别说,未来还真可能有关系。手机、电视、手表、汽车、空调……这些工业时代的经典产品,现在都变成了互联网终端。谁说电饭煲、鞋子、衣服不会呢?如果未来的制造工厂都变成互联网公司,数据将成为最基本的生产要素。你不懂算法、不会建模、不会分析,没关系,那些有数据分析能力的公司会帮你做。

  眼下,阿里巴巴各项数据业务都在用ODPS“榨果汁”,比如淘宝在算你最中意哪个淘女郎,天猫在算你什么时候想吃车厘子,菜鸟在算卡车走哪条路可能会被雷劈,支付宝在算你何时会从屌丝变成高富帅。如果大家也想“榨果汁”,欢迎来试。ODPS的水龙头就装在阿里云官网aliyun.com上,一个月内免费。

  The World Is Flat. 从某种意义上而言,人人都可以成为BAT,哪怕你的公司只有几号人。我们希望,在技术这件事情上,大家变得更加平等!

  阿里云ODPS团队

  2014年7月8日

时间: 2024-09-10 14:33:16

阿里云发布大数据产品ODPS 6小时处理100PB数据的相关文章

阿里云发布大数据工具采云间

ZDNet至顶网软件频道消息:阿里云计算发布大数据工具"采云间"--基于ODPS的简易工具解决方案.采云间可大大降低中小型公司大数据分析的门槛. 阿里云发布大数据工具采云间 将支持可视化分析 采云间是一个Web端的在线工具,简称DPC(Data Process Center),内部集成了阿里数据开发者套件和商业智能套件.目前免费公测版本功能,包括数据工厂.任务管理和数据同步:数据工厂主要提供ODPS IDE工具和SQL代码管理功能:任务管理可以实现任务调度和执行监控:数据同步支持本地数

阿里云发布企业级ECS产品线,国内首个上线Skylake CPU+25G实例

8月10日,阿里云发布企业级ECS产品线,在发布会上全新一代基于Skylake+25G网络的实例,得到了极大的关注,同时全新一代G5/C5/R5实例已经在青岛地域率先上线,成为中国第一家上线Skylake+25G网络的云服务商. 在企业最关注的领域,阿里云的最新一代实例带来了惊人的表现,可以将单实例的最大内网带宽发挥到30Gbps,网络收发包能力更是可以高达450万的量级. 这样的能力来自于阿里云基础设施的全面升级,在发布会上,阿里云产品总监,资深专家蒋林泉队这次全新升级做了解读: Intel与

阿里云发布大数据工具采云间 将支持可视化分析

25日,阿里云计算发布大数据工具采云间--基于ODPS的简易工具解决方案.利用采云间,中小型公司不用再购买上百万元的商业智能(BI)软件,大大降低大数据分析的门槛. 采云间是一个Web端的在线工具,简称DPC(Data Process Center),内部集成了阿里数据开发者套件和商业智能套件.目前免费公测版本功能,包括数据工厂.任务管理和数据同步:数据工厂主要提供ODPS IDE工具和SQL代码http://www.aliyun.com/zixun/aggregation/17569.html

阿里云发布ECS企业级产品家族 19款实例族涵盖173个应用场景

为满足企业级客户对计算的高标准需求,8月9日,阿里云正式发布云服务器ECS企业级产品家族,目前已推出面向173种企业应用场景的19款实例. 该系列适合在复杂的企业计算环境下,满足对于高性能.高可靠的计算需求.同时阿里云也新发布了该系列产品中采用25G网络与Skylake处理器的全新一代实例,性能持续领先. 01 推出企业级产品家族 面向高标准计算需求 这是阿里云首次将云服务器产品线细分出企业级产品家族,与入门级产品家族相比,这一新家族实例具备更强的计算性能与可靠性,适合于核心生产业务需求的计算.

116期:阿里云发布30+新产品

本期头条   3月29日,在云栖大会深圳峰会上,阿里云资深总监李津代表阿里云发布了30余款阿里云新产品.如今,高性能计算正在成为智能的基础设施:普惠,将推动智能的发展:而从端到云,阿里云将为企业提供IT的多维领先体验.想知道阿里云新产品重磅发布详情,点击这里. • [图文]云栖大会深圳峰会:阿里云ET医疗大脑与工业大脑,机器学习平台PAI2.0 • 游戏盾正式发布:撬动DDoS攻防的天平 • 阿里云实现首个云上量子加密通讯服务 • 2016云栖奖揭晓,九大获奖者影响智能时代的中国 • [独家直播

阿里云发布新一代数据库产品POLARDB,跑分领先一线友商

今天下午,阿里云升级发布了旗下最新一代的数据库产品POLARDB, 据悉,阿里云数据库产品目前覆盖包括:关系型数据库.混合分析数据库.搜索与时序数据库.NoSQL数据库以及数据库服务于工具等诸多领域,已成为全球数据库产品线最齐全的云计算厂商,今天整体数据库产品再次升级,旨在为企业提供面向未来的能力. 据了解,POLARDB采用第三代分布式共享存储架构,将IO操作减少50%,100%向下兼容MySQL5.6,性能是MySQL的6倍.它把创建只读副本进程从按小时计算缩减到现在几分钟就能完成,支持3分

阿里云发布企业级ECS产品线,释放技术升级红利,最高降价35%

8月9日,阿里云ECS企业级产品线正式对外发布,标志着阿里云ECS产品正式以最新的产品功能.性能.最高的性价比来服务器企业客户的决心. 计算.存储.网络三驾马车的优化叠加,阿里云ECS的基础设施升级到业界最佳水平.Intel与阿里云有深入长远的CPU定制合作史,新产品家族采用的Skylake处理器也为云计算场景做了特别定制,各项性能首屈一指.存储领域进化为计算与存储分离的先进架构,SSD云盘单实例达到18万IOPS,包括Latency以及吞吐都跃进一层.此外,基础网络设施全面升级到第二代Apsa

阿里云一站式大数据平台"数加"产品发布

文章讲的是阿里云一站式大数据平台"数加"产品发布,阿里云在2016云栖大会上海峰会上宣布开放阿里巴巴十年的大数据能力,发布一站式大数据平台"数加",首批亮相20款产品.据介绍,在输出自身大数据能力的同时,"数加"还向有数据开发能力的团队开放.这些团队可入驻"数加",借助数加上的工具为各行各业提供数据服务. 此次,"数加"平台首批集中发布了20款产品,覆盖数据采集.计算引擎.数据加工.数据分析.机器学习.数据

阿里云发布新一代CDN 6.0 主打云与大数据融合

3月18日,阿里云发布极速CDN 6.0版,在业界首次提出Cloud Delivery Network(云分发网络)理念.新版CDN融合云计算和大数据技术,涵盖视频和移动两个解决方案以及大数据分析.HTTPS加速等新功能,为客户提供一站式的云CDN解决方案.   与此同时,阿里云也透露2015年云CDN客户数已突破10万,客户规模是传统CDN厂商客户之和的20倍:营收同比增长800%,增速比传统服务商增速快约20倍.   这是继去年率先让利引发行业震动之后,阿里云再次以新的技术和产品引导行业变革