美国数据分析科学家带你看看大数据的未来

ZD至顶网CIO与应用频道 10月08日 评论消息:从SGI的首席科学家John R. Masey在1998年提出大数据概念,到大数据分析技术广泛应用于社会的各个领域,已经走过了17年的时间。现在再也没有企业怀疑大数据分析的力量,并且都在竞相利用大数据来增强自己企业的业务竞争力。但是,即使17年过去,大数据分析行业仍然处于快速发展的初期,每时每刻都在产生新的变化。

从概念到实用、从结构化数据分析到非结构化数据分析,大数据分析技术在不断地进化。虽然国内仍然在关注舆情分析,但是记者注意到,在美国,大数据分析的研究已经进入到了一个全新的阶段,“预测分析”技术成为最具有代表性的未来技术方向。

那么,“预测分析”技术和传统的大数据分析有什么不同?记者就此采访了美国数据分析科学家、前北卡大学夏洛特分校助理敎授、夏洛特视觉中心主任以及非结构化数据智能分析平台Taste Analytics的CEO,Derek Wang(汪晓宇)博士。

大数据行业爆发,现在的技术不够用了

汪晓宇博士正好经历了整个大数据产业爆发的全过程。他和记者回忆说,在2010年的时候,来他们夏洛特视觉中心进行交流的还仅仅是大公司的数据硏究员,2011年已经变成了公司的主任,而到了2012年,来的几乎全是CIO和CTO们了。他们甚至还为企业开了一门数据分析的进修课程,讲座虽然只有两天,但注册学费几千美金,学员们全都是来自国内各大公司的资深高管。

从这可以看出,在这个数据时代,中美都在用尽一切办法实现数据上领先的概念和追求。而在这技术飞速发展的几年间,数据本身呈现出了不少新的特点,市场也相应地对大数据分析技术提出了新要求。

首先,数据点越来越多,也越来越碎片化。

在汪晓宇博士看来,大数据时代就是人的时代,数据形态越来越丰富和多样。除去社交网站等传统数据点以外,新形态的数据点也已经出现,比如Airbnb和Uber这种O2O服务。如果再看远一点,随着可穿戴设备、物联网等先进设备和个人的信息结合起来,随时随地产生和收集数据更加成为可能。

在这样的情况下,每个人随时随地的“情绪”和“状态”这些都会成为商家必须要重视的数据源。

与此相对应的,非结构化数据分析将越来越重要。而非结构化数据的模块化更加灵敏,不是传统的单一解决方案可以做到的。这导致人们在进行大数据分析时使用的工具将更加细化,利用垂直创新的工具进行非常纵深的研究将成为主流。

其次,大数据分析技术成为了决定社会服务效率的关键。

有报道指出,随着信息技术的发展,包括公共服务、物流等在内的人们衣食住行的服务会纷纷电子化,虚拟世界和物理世界的边界将进一步模糊。这个大的产业背景一旦形成,大数据分析能力就将成为整个产业服务最关键的竞争力。

这样就意味着,大数据分析工具应该越来越实用化。汪晓宇博士介绍说,在面对新的技术和工具时,美国企业高层都会迅速做出决断,考虑怎么把数据分析和现有业务进行快速整合。他举例说,在他们和美国一家大型银行合作时,对方的CIO就可以迅速做出反应,和他们探讨应该怎么把他们开发的创新型非结构化数据分析技术应用到自家银行某一个产品中去。

决定下一代大数据产业的新技术:“预测分析”

在这样的数据特点和市场要求下,中国和美国各大公司和科研中心都在大力投入,研发下一代数据分析技术。但是,在这方面,美国还是有着3-5年时间的领先。

根据汪晓宇博士的分析,国内在科研上的眼光很高,水平层次力度都在,但是商业化不行,研发出来转到应用上和美国有一定差距。中国大部分公司对于大数据分析的概念还停留在“舆情分析”的阶段,但是美国已经跨越“舆情分析”和“情感分析”,进入到了“预测分析”阶段。

由汪晓宇博士一手打造的Taste Analytics团队,就在进行“预测分析”技术的研发。它摆脱了传统的“舆情分析”和“情感分析”的框架,更进一步,把人们在社交网站和其他平台上产生的数据都收集起来,进行实时、全面地分析,帮助企业建立用户的立体形象,了解他们的品味和喜恶,从而提供预测性地判断。

这听来似乎和传统的“推荐系统”、类Clickstream分析有些类似,但是实际上完全不同。

首先,传统的“推荐系统”会需要一个很长的建立过程,也就说,它需要很多强相关的、相似的历史数据,才有可能实现推荐功能。比如它只能根据你买电饭锅的行为,才能向你推荐其他厨具。

但是企业怎么能在一开始就知道,顾客想要买电饭锅呢?这就是“预测分析”的强大之处。它不需要这样的历史数据,而是直接通过人们在社交网络上的留言和在各大平台上留下的信息,来进行预测。也就是说,当你在社交网络上留下类似“好想在家做饭”的状态,系统就有可能已经知道你想买厨具了。

汪晓宇博士举例说,“预测分析”技术发展成熟的话,就会非常接近美国科幻电影《少数派报告》里的情景——它会根据你在网络留下的痕迹,来理解你的性格、行为、情绪,来建立一个随时更新的、立体的形象。无论是HR、企业、客服、公共机构,都可以根据这些信息来提供真正的前瞻性、个性化的服务。

其次,Clickstream无法解决冷启动的问题,而且很难精准到个人、到细节。

Clickstream分析技术的实现,是通过不同的cookie,来追踪人们的点击,它无法解决的是冷启动过程中数据的缺乏。比如你第一次登陆优酷,没有任何观看记录,系统应该怎么进行推荐呢?而且,人们的误点击操作很有可能就被系统追踪下来,进行了错误的分析。

但是这对于“预测分析”技术就不是问题。通过对各大社交平台上的多重语义分析和叠加验证,一个人的具体形象已经建立起来:这个人比较保守,不喜欢暴力,最近正在谈恋爱……那么这时,向他推荐浪漫喜剧就会非常对味。

“我们在做的,就是在集合的范围上进行分析。”汪晓宇博士说,“以前的技术是告诉你们人们在‘说什么’,现在我们已经进化到人们在行动之前‘有什么感觉’。这个核心技术的突破,就能实现对于整个数据分析市场的革新变化。”

再次,“预测分析”比起传统的大数据分析方法,可以更好地实现人机互动。

尽管人工智能非常火热,但是汪晓宇博士仍然指出了这项技术的局限性:它的可控性很差,没有依靠人的能动力。在他看来,大数据分析应该更好地利用人机互动的机制,来发挥最大功用。

汪晓宇博士介绍说,以前的数据分析技术,机器只能做到一半,到后面的时候还需要人来负责数据输入。但是现在他们在研究的“预测分析”技术,可以把大范围的用户数据总结集成在一起,自动给出结果。人和机器的互动,将主要在于洞察内涵、提供反馈,让机器知道人的倾向。这就是新型的人机互动先进所在。

“比如说,某个产品本来定位年轻人,但是机器通过收集数据进行分析,发现它在中年人之间更受欢迎,那么人就可以来调整产品的市场定位,做出加大在中年人群体中加大宣传的决策。这就是非常典型的人机互动。”汪晓宇博士说。

中国为什么没有出现“预测分析”技术?

作为美国最前沿的大数据分析技术,“预测分析”仍然处在研发的早期阶段,各家公司都在发力,想要在这个方向上取得领先地位,技术挑战仍然非常大。

预测分析最大的难度在于精准度。汪晓宇博士说,精准度越高,系统就越能把人的性格全面呈现出来,而且会在不同时间地点下进行分析,做出一个高维的性格理解。要实现这个精准度,光是数据挖掘方面就会有很大挑战,而且在面向不同客户时,比如企业、HR、公共服务等,还要把影响他们的特征分别提取出来,这又把难度上升了一个层次。

目前,汪晓宇博士已经在带领Taste Analytics团队在打造这样的“预测分析”系统,而且,他透露,目前他们向特定的几个企业提供了试用版本;而他们提供的非结构化数据分析服务,也就是“预测分析”的基础,已经被6家福布斯全球500强公司以及多家美国主流企业使用,并通过实践“实时分析”、“数据驱动”(Data-driven)、“人机互动”等最新的数据分析理念,为新的“预测分析”系统提供研究基础和进一步的反馈。

“美国市场上现在领先的数据分析公司,都只精专一点。”汪晓宇博士说,“这也是行业进化到一定程度的结果,因为其实每一个环节都很难,没有一个数据分析公司是可以把所有的都做完;但是反过来,精细化研究才可以激发更多创新。”

反观中国市场,仍然在流行SAP、SAS这类的整体解决方案。虽然这些方案可以覆盖到数据分析的基本方面,但是却失去了对数据的深入挖掘能力,也就错失了数据分析的新机会,进一步来说,就很难诞生类似“预测分析”这样领先的研究。

“中国企业也应当大胆尝试新工具。如果总是寻求旧的解决方案,那么企业将无法真正挖掘出数据的价值。”汪晓宇博士说,“到时候,不仅是预测分析,中美在大数据分析技术和商业应用上的整体差异还将进一步扩大。”

原文发布时间为:2015年10月8日

本文作者:硅星闻

本文来自合作伙伴至顶网,了解相关信息可以关注至顶网。

时间: 2024-09-17 03:45:56

美国数据分析科学家带你看看大数据的未来的相关文章

美国数据科学家带你看看大数据的未来

从SGI的首席科学家John R. Masey在1998年提出大数据概念,到大数据分析技术广泛应用于社会的各个领域,已经走过了17年的时间.现在再也没有企业怀疑大数据分析的力量,并且都在竞相利用大数据来增强自己企业的业务竞争力.但是,即使17年过去,大数据分析行业仍然处于快速发展的初期,每时每刻都在产生新的变化. 从概念到实用.从结构化数据分析到非结构化数据分析,大数据分析技术在不断地进化.虽然国内仍然在关注舆情分析,但是记者注意到,在美国,大数据分析的研究已经进入到了一个全新的阶段,"预测分析

快上车!老司机带你走进“大数据及阿里云数据分析平台”

本次培训讲座是由阿里巴巴创新中心·优客工场(天津于家堡)和天津云顶云科技有限公司联合举办,由阿里云大数据高级认证讲师--宋亚奇博士主讲,旨在通过对大数据及阿里云数加平台的介绍,帮助天津市企业更好的理解大数据,以及更合理有效的利用数据资源促进公司业务发展. | 目标人群 | 1.管理人员以及技术/市场/销售人员2.有兴趣了解大数据的所有人员 | 培训相关 | 时间:2017年5月27日,14:00-17:00地点:天津自贸试验区新华路3678号新金融大厦11层[阿里巴巴创新中心·优客工场(天津于家

Taste Analytics带你畅游大数据未来

文章讲的是Taste Analytics带你畅游大数据未来,近年来"大数据"及"数据分析"的概念火爆异常,然面对大数据分析时,国内外却有着不小的差距,国内企业仍以结构化数据分析为主,而美国的很多企业却早已向非结构化数据迈进. 非结构化数据分析目前属于非常前沿的技术,需求量很大,但是在市场上几乎是一片空白,Derek Wang(汪晓宇博士--美国数据分析科学家.前北卡大学夏洛特分校助理敎授.夏洛特视觉中心主任)与其团队看到这个领域的巨大潜力,并且把握住了机会,悉心研发

往期直播:《驴妈妈,基于混合云的OTA行业数据分析、精准运营和大数据用户推荐》

最新活动报名: 3月16日直播<空格技术架构云上实践与经验>:https://yq.aliyun.com/webinar/join/4 3月18日直播<爆款App小咖秀产品服务端架构设计分享>:https://yq.aliyun.com/webinar/join/5 本期活动已经结束,视频出炉:https://yq.aliyun.com/edu/lesson/play/98 . 第3期在线培训报名开启,下面是本次直播详情. 直播主题:<基于混合云的OTA行业数据分析.精准运营

京东首席科学家:云计算、大数据撬动购买力

在电商业务运营整整十年之际,京东宣布,电商云于6月5日正式上线,同时京东的大数据和云战略也拉开大幕,让我们更清晰地看到云和大数据是如何融入到京东的命脉和核心竞争力中. 向后看,京东积累了十年的技术实力和大量用户数据:向前看,未来十年战略定位三大方向,"技术驱动"的自助式B2C.开放业务和金融.何刚解释说,之所以冠上技术驱动这个词,就是要依赖于云计算和大数据来推动京东在这三块业务上的发展. "资金流.物流和信息流,这是电商的三大命脉,而如今在电商运营背后支撑这些命脉的技术驱动力

大数据预测未来五年最热行业

日前,全球最大的职场社交平台LinkedIn(领英)基于其平台数据分析发现,十年前的热门行业现如今早已热度不再,而数据科学家.新媒体专员等以前几乎不存在的冷门职业却日渐成为时代的新宠.因此,考生及家长在填报志愿时,与其紧盯住当下最热专业不放,倒不如结合自身能力及兴趣进行专业选择. LinkedIn根据大数据对未来五年的行业发展进行了预测,总结出了八大极具发展潜力的最热行业:电商.新媒体营销.大数据服务.云计算服务.VR.UI设计.私人旅行定制和微电影策划.其中,部分行业已经成为当下人们职场热门,

大数据的未来:将帮助人们在更多预测领域做出更好的选择

"这是一场革命,庞大的数据资源使得各个领域开始了量化进程,无论学术界.商界还是政府,所有领域都将开始这种进程."--当谈到"大数据"时,哈佛大学社会学教授加里·金如是说. 今天,当你在百度搜索"大数据"这一关键词时,你会找到超过1亿条相关搜索结果,包括互联网圈.媒体圈.学术圈以及用户圈的讨论充斥着整个网 络.这其实就是加里·金所说的"大数据"的进程,但它还只是表象,如果你想了解大数据的实质与未来,以下几位专家的观点似乎能帮我们

Hadoop没有消亡,它是大数据的未来

文章讲的是Hadoop没有消亡,它是大数据的未来,人认为 Hadoop 正在失败,但硅谷数据管理公司 Hortonworks 的总经理 Vamsi K. Chemitiganti 并不这么看,为了反驳此前一篇文章<为什么 Hadoop 正在消亡?(Why Hadoop is Failing)>的观点,他在自己的博客上写了一篇论述自己看法的文章,他认为达尔文式的开源生态系统正在确保 Hadoop 成为稳固和成熟的技术平台. 「女士,那么刚出生的孩子能干什么?」--迈克尔·法拉第,在 18 世纪被

大数据:未来创新、竞争、生产力的指向标

我们生活的这个世界中数据的容量急剧膨胀,大批量数据分析,即所谓的"大数据"将会是带动未来生产力发展.创新.消费需求增长的指向标.根据麦肯锡全球研究所(MGI)和麦肯锡商业技术办公室的最新调查研究显示,任何一个行业的领军者都已经看到了大数据所带来的前所未有的潜力和重大意义.企业所能获取的具体信息和信息量不断增长,多媒体.社交媒体.物联网都将极大地增加企业未来所能获取的信息量. MGI在医疗.公共.零售.制造业和个人定位等五个领域内详细研究了大数据发展趋势,并得出了如下报告分析.大数据可以