数据分析还在婴儿期?看TalkingData谈大数据生效的关键因素

通过大数据技术实现企业运营效率的提升是我们当前的一个重要目标,但这项工作并不是每个企业都那么容易上手。在1月21日的“10亿说 TalkingData移动互联网产业指数数据报告发布会”上,多名业内专家及TalkingData高层为我们分享了释放大数据价值现存的一些坑,以及我们可以怎么解决。

所谓10亿说,是指TalkingData的平台现在已经覆盖了10.6亿的移动智能设备,包括iOS、Android的系统平台,包括智能手机、平板、智能电视等等不同的设备形态。

专家说:真正的分析还在婴儿期

全国手机媒体委员会、中国手机移动互联产业联盟秘书长吴红晓,中国工程院院士、中国移动互联发展指数专家组首席科学家倪光南,以及北京大学新媒体研究院副院长刘德寰在发布会上分享了他们对大数据的观点,从不同的角度指出了目前大数据应用面临的许多挑战。

吴红晓:

目前很多单一的数据库的量都已经很大,已经超过了几个PB的规模,但是同时数据的规模越大,处理的难度也越来越大。有两方面的挑战:

数据的来源问题。在数据收集方面,因为要对网络和各个数据源机构的信息标上时间和空间的标志,要去伪存真,而且还要与历史上的数据对照,这样才能验证数据的可信度。更重要的是,凭一家的数据很难形成具有足够价值的数据池。有效的数据挖掘工具的问题。数据处理涉及到的参数比较多,它的复杂程度并不仅限于数据样本本身,还在于它的来源的多样性,实体和空间之间的交互性,这些都是很难用传统的统计办法或挖掘办法描述和审读。最终我们的数据挖掘还要保证它的结果的可视化呈现,结果越直观,数据处理的价值也越便于使用。

倪光南:

刚开始提供互联产业的数据,涉及到的操作系统、机型、品牌运营商、APP等六个方面,可能以后会加上地理位置,加上实时性等。10亿人的行为能够做到实时监测,潜力很大,但也带来很复杂的问题,包括信息安全、个人隐私、法规完善等。数据要做到信息的互联互通、共享共用,但出于商业利益考虑,很多单位不愿意把数据拿出来,需要与有关部门进行协调,使大家更愿意把共享信息,既照顾到国家利益,也保障单位的利益。还要有数据质量的提升和分析手段的改进。例如从数据的关联性发现的规律就能创造很多新的价值。

刘德寰:

整个中国云计算和大数据研发过程当中有几个很大的问题:

发布的数据更多,用得越来越少,原因是这些数据有太多的公关性。数据孤岛。云基础设施的重复建设。像沙里淘金,需要在国家战略上,对整个云存储平台进行重新规划,因为只有有用的、有价值可采的矿才是我们要收集的矿。数据分析能力。现在数据挖掘更多的是类似于ERP、CRM等数据的展示,但是真正的分析是非常弱的,应该处于婴儿期状态(例如,现在对于网站,包括域名解析等,方法上还面临很多不足)。而且我们现在跟世界发达国家的水平相比,差距在拉大,并不是在缩小。

TalkingData说:大数据全面解析2014移动互联网

长期以来钻研的分布式的运算架构、海量的数据处理和数据挖掘的算法,TalkingData使用自研的一个移动大数据的统计分析平台,将这10亿部智能终端的数据作为数据蓝本,从多个维度对移动互联网用户的数据进行对比分析,给出整个行业观察的结果。

TalkingData数据平台部总监陶京琪在发布会上详细讲解这份2014年TalkingData移动互联网数据报告。报告围绕“移动互联网行业概况”、“移动互联网用户行为”、“移动应用整体盘点”、“移动互联网用户线下消费习惯”等不同主题,多维度分析了2014年中国移动产业的整体发展状况。(如果您对这份报告感兴趣,可通过访问TalkingData官方网站免费下载)

报告显示,移动互联网已经度过了需求集中于通讯与社交方面的“萌芽期”和以购物与娱乐为代表的“初步发展期”,迈入到“高速发展期”,这一时期,出行、医疗、教育、餐饮等与生活密切相关的细分领域应用纷纷涌现,多元化生活服务为用户带来极大便利,线上与线下联动(O2O)成趋势。典型应用的不断涌现,也让O2O行业迎来用户增长与资本市场融资双重热潮,移动端的消费闭环正逐渐形成。

对话Talking Data:技术、数据源与中立是关键

在发布会之后,TalkingData COO 徐懿、TalkingData产品副总裁闫辉、TalkingData售前总监戴民和TalkingData数据平台部总监陶京琪一同接受了CSDN记者的采访,更深入地解析了TalkingData的大数据实践经验,如何破解前述专家提到的问题,以及TalkingData的技术能为企业和开发者带来什么。

TalkingData认为,大数据最重要的,是运用分析结果为整个企业运营服务。然而,单个企业的数据,不足以反应整个行业的动态,我们更需要的通过对整个行业的数据的分析来获得最优决策的依据——这与舍恩伯格“不是随机数据,而是全体数据”的思想相吻合。也并不是所有全体数据都靠谱,TalkingData还强调,目前只有中立的第三方平台才能保证数据分析结果的参考价值。当然,实现整个行业数据的中立分析,其基础还是要有一个可靠的大数据技术平台,能够容纳收集整个行业的数据量及其多样性,有数据互联互通的统一接口,还要能保证分析的实时性、有效性。

问:如何理解中国大数据应用还处在起步阶段?

答:很多企业没有办法把存储的数据用到平常的销售优化、服务优化上来,因为他们还不具备这样的分析能力。大数据使用里面最关键的一点,就是怎么样把业务变成是大数据驱动的。从这点上来讲,无论是在传统的行业里,即使是在互联网行业里,大数据驱动业务这件事情都还在起步阶段。

以手游为例,很多游戏的运营还是靠具体负责人拍脑袋决做决策,而不是利用收集的大数据发现一些规律性的东西让运营更加顺畅——譬如有效预知和挽救可能会流失的用户,保持游戏的收入。数据量并不一定要多大,但是后面流失的模型是基于很多游戏,包括他自己的游戏,也包括其他的游戏,在很多游戏里面我们算出来一个模型,把这个模型用回到这个游戏里面,对游戏运营做指导。

TalkingData针对于此的做法,首先是做一些行业标准的东西,很容易把大家孤立的数据全部打通,或者汇总在一个DMP数据管理平台里面,对于企业来讲,先帮他建立第一方的数据,让他把数据能够管理起来,对用户做一个画像。第二,他的数据有可能跟第三方的数据进行打通,他可以利用很多第三方的数据。

所以说,大数据的应用范围可能会比我们原来简单的理解我有一大堆数据怎么去处理它,比这个更高级一点,更多的现在会产生在不同的领域跨界的一些数据的应用上面。

问:TalkingData的技术有什么独特的技术?

答:从数据的分析、挖掘角度来说,大家都是用OLAP模型,按照指标维度存起来,然后反复的切割、切片、抽取,这种技术模型大家基本上都是相似的。我们也采用了如Hadoop、Hive、Storm、Spark等开源的技术。但我们在大数据行业,在技术上还是小有贡献的,因为我们把自己的计算引擎和推荐的算法,还有一些挖掘算法,以及我们的存储模型,都有一些开源系统,我们内部有个代号叫派系统,这样的系统也经常跟市场上做技术框架的系统做交流和切磋。比如有一个系统开源的叫麒麟系统,都是做大数据运算的。我们也不能自己说自己谈得上领先,但是总是愿意去分享自己在这块的知识。

问:我们能为企业开发者提供哪些方便?

答:所有的生意都是要解决两个问题:怎么获得客人,以及怎么经营他们。基于此,我们用全行业的大数据平台帮助企业找到客户。第二个方面,我们提供一整套基于大数据的从分析到运营的闭环产品,支持企业根据客户的特点来经营客户,来获得更好的收益。这主要包括:

提供所有的运营报表。针对全行业行为的用户画像,帮助企业找到最好的合作伙伴和潜在客户。提供直接的运营工具,让企业把潜在客户分离出来,并提供针对性的运营策略建议,实现更好的转化。

问:很多大数据平台也都提供了用户画像技术?

答:传统上做用户画像大都有忽悠的嫌疑,比如用户的性别、年龄段、所属省市,参考意义不大。我们的用户画像是更偏向于实际执行的兴趣,针对移动产品,我们从喜欢用哪些App,可以分析出哪些用户的兴趣与我们的定位更加贴合。知道用户喜欢逛哪些商场、买哪些商品,和知道他生活在哪个省市的意义不可同日而语。

问:我们会提供本地部署的方案,还是通过纯SaaS平台收集和分析数据并反馈结果?

答:我们的客户有两类,一类如招商银行这样的大客户,对私密性要求比较高,就要部署一个全维的第一方DMP平台到银行内部,所有的数据只能进不能出,公开的非商业性数据,则可以直接从我们官网获得报告;对于第二类客户,数据可以直接上传到我们的平台上。

以招商银行(掌上生活和手机银行业务额)为例:

我们第一步是帮助他们构建起移动数据的基础设施,帮它在初期做运营的基础数据的采集、清洗、存储以及分析。有了这些基础数据之后,他们就可以产生以前没有的洞察,帮助指导他们优化产品,帮助他们找到合适的渠道。第二步,就是帮他们构建数据管理平台。数据管理平台的定义就是,帮助客户在大数据的背景下,面向营销,帮他构建起整合各个渠道的数据,并且能够支撑到各个业务部门的一套系统和服务。有了这套系统之后,客户就可以基于他自己多渠道的第三方数据的基础上,能够产生完整的用户视图,有些这些视图之后他可以做分群,结合他的营销系统,比如他的微信、短信呼叫中心、投放系统等等,之后我们还能帮助他监测营销效果,形成大数据营销的闭环,提升他整体营销的ROI。第三步,帮助他去打通第一放DMP以及我们的第三方数据。TalkingData是一个大的第三方的数据中心,我们基于自己积累的第三方数据,还有很多用户在银行第一方数据之外的用户,平常在线上的行为数据、线下的行为数据,结合这些数据能够帮助客户产生更深度的洞察,发现客户更多的需求。

问:数据出来可能有的是可信的,有的是不可信的,数据最终呈现的结果会有误差吗?

答:首先从行业视角看,还是从运营分析的视角看,一些大型公司都推出了这样的平台,它也是帮助开发者去做运营分析和运营工具,从单向的去分析这个市场来说,大家出的数据都是帮一个移动端的创业团队去做他的业务分析,这种数据的出入性当然不会特别大。但是从全行业的视角去看这个事情,可能是不太一样的。比如百度要去发一个报告的话,它结合的不光是它从中立市场采集的数据,更多的是来源于百度的搜索、百度的地图抓取的各种各样的数据,所以它对中立数据的采用可能只是它的一小块。作为一个行业性的数据报告来说,它会不会更侧重百度一些呢,有可能它自己不这么认为,但是它的样本本身都是偏自己的。同样,腾讯也是一样的,他们在TOP50应用里面占了很大的份额,他觉得他的用户量已经普及到一个程度,本身他做出来一个他认为中立的报告,结果也是比较偏他的用户群,就会有一定的偏差。比如有一个客户,也用了我们的统计分析的产品,只是分析他个人业务的,也用了百度的,也用了腾讯的,数据量会有多大差别吗,当然不会,因为大家做的是一样的活。

问:我们如何解决数据来源的问题?

答:TalkingData是行业中唯一一个中立的大数据平台,我们本身提供SDK插件这种服务,所以我们掌握了比较准确的一手数据,直接去采集和获取。采集当中,我们很在意开发者和最终用户的感受,所以会跟大家协商更好的用户许可协议,以及在不侵犯隐私的情况下,拿到一些大家会在意的数据,这是第一方面。另外,我们会采用一些数据交换和合作的方式,获取更多元的数据。这些数据一样是需要合规、合法,不侵犯任何合作方利益的情况下,可以去拿得到这样的数据。还有一方面的数据,我们会在线下做很多布局,包括到店的信息,去布Wi-Fi点,采集线下的数据,拿这样的数据可以跟线上数据打通和做很多匹配。总之会形成一个全行业遍布的数据网,让它更全面、更严重。

问:如何规避数据隐私的问题?

答:解决数据隐私是数据服务公司安身立命的基础,数据的收集和使用一定要注意合法性的问题:

明确要求开发者在用户协议中告诉被收集者,TalkingData会基于哪些原因收集哪些数据,保证用户知情权。对于与第三方的数据交互,也要审核对方的数据来源是否合法。在TalkingData内部对采集什么样的数据、处理什么样的数据,以及这些数据在内部的管理流程,都有非常严格的控制。如用户的手机号、身份证号码等,TalkingData认为此类数据是不可逾越的红线。TalkingData已经通过ISO2701的认证,公司存储的数据都很好的被保护。数据报告的处理。TalkingData给的都是行业的数据,比如男性和女性整体的比例,但不会提到某一个人的详细数据信息。

时间: 2024-10-23 08:04:49

数据分析还在婴儿期?看TalkingData谈大数据生效的关键因素的相关文章

放眼业界看得见的未来 十谈大数据时代

本文讲的是放眼业界看得见的未来 十谈大数据时代,半年前开始讨论大数据时代的到来时,大数据还只是个专业小圈子里探讨的话题.到今天大数据这个概念已经在业界内外和大众媒体上沸沸扬扬地广为传播,并不断涌现出这个方向上的努力与创新了.正所谓"历史潮流,浩浩荡荡,顺之者昌,逆之者亡",这个过去只用在政治话题上的说法借过来描述大数据时代的到来与迅猛发展的形势真是再恰当不过. 站在不同角度看大数据,它既可能是大机会,大发展,大创新,也可能是大危机,大破坏,大淘汰. 目前,最活跃的领域是网络终端创新和网

Facebook前主管谈大数据技术趋势和演变

本文讲的是Facebook前主管谈大数据技术趋势和演变,全球系统架构师大会于8月10-12日在深圳万科国际会议中心隆重举行.首先给大家带来分享的是前Facebook数据基础设施团队主管,Qubole创始人,CEO Ashish Thusoo,他主要介绍了大数据架构以及怎么样不断的演进,与其说演进,不如说革命.其中主要包括三个方面的主题: ▲全球系统架构师大会现场报道 第一,大数据的需求.当今世界需要大数据,有哪些驱动因素促使我们不同方式考虑大数据?以不同方式处理数据. 第二,技术给我们带来哪些架

CNCC 人物专访 谭晓生(上)| 360 首席隐私官谈大数据与个人隐私的博弈

     现任奇虎 360 科技有限公司首席隐私官,2013 中国互联网安全大会主席. 2009 年 7 月加盟北京奇虎科技有限公司担任副总裁,负责公司网站技术.技术运维.数据分析与挖掘.云查杀.云存储等业务的技术团队管理. 1992 年毕业于西安交通大学计算机科学与工程系计算机应用专业.2003 年 1 月至今先后任 3721 技术开发总监.雅虎中国技术开发总监.雅虎中国 CTO.阿里巴巴-雅虎中国技术研发部总监.还曾任 MySpace CTO 兼任 COO. 目前还担任 CCF 副秘书长,Y

《Hadoop与大数据挖掘》——第一篇 基 础 篇 第1章 浅谈大数据 1.1 大数据概述

第一篇 基 础 篇 第1章 浅谈大数据 当你早上起床,拿起牙刷刷牙,你是否会想到从拿起牙刷到刷完牙的整个过程中有多少细胞参与其中?这些细胞在参与的过程中会结合周围环境(可能是宏观的天气.温度.气压等,可能是微观的分子.空气中的微生物等),由你的意识控制而产生不同的反映.如果我说结合这些所有的信息,可以预测你接下来的0.000 000 01秒的动作,那么,你肯定说,这我也可以预测呀.比如正常情况下,你脚抬起来走路,那么抬起来后,肯定是要落下去的,这算哪门子预测呢?那如果我说可以预测你接下来一个小时

浅谈大数据现状:误区严重 人才紧缺

文章讲的是浅谈大数据现状:误区严重 人才紧缺,大数据现在很热,企业.个人都在谈论,每个人对大数据有着自己不同的看法和观点,但是笔者通过日常与朋友们聊天,发现很多朋友对大数据仍然具有一些观念上的误区,比如很多人会认为大数据是一个最新的技术,还有一些朋友认为多有数据只服务自己一个人等等,这些问题我们在本期都会与大家讨论. 大数据不是一项最新技术 大数据现在已经融入我们的生活,人们在日常工作办公的时候都会接触到大数据,这些大量数据总会以不同的形式,以及庞大的数量存在和运用,这也导致了很多朋友认为大数据

扒开现象看本质:大数据应用初成气候

想必没有几个人记得"安防大数据"是何时喊出的,但其口号始终在延续,多年在"云端",一度神一般地存在,却又捉不透.摸不着.不过在行业同仁的共同努力下,其终于开始"食人间烟火"了.作为新一代安防的寄托,大数据应用神技究竟练到了第几层?今天我们就来扒一扒. 大数据落地:众之所盼,却含苞晚放 翻阅a&s安全自动化的历史技术文章,不乏大数据.云计算的技术文章,谈得多了,听得多了,似乎大数据距我们咫尺之遥,呼之欲出;但实际上,大数据始终虚无缥缈,吵吵

浅谈大数据:如何成为大数据企业?

文章讲的是浅谈大数据:如何成为大数据企业,1.什么叫大数据? "大数据"是"数据化"趋势下的必然产物!数据化最核心的理念是:"一切都被记录,一切都被数字化".最近2年所产生的数据量等同于2010年以前整个人类文明产生的数据量总和,更重要的是,数据来源极大丰富,形成了多源异构的数据形态,其中非结构化数据所占比重逐年增大.牛津大学互联网研究所Mayer-Schonberger教授指出,"大数据"所代表的是当今社会所独有的一种新型的

【BABY夜谈大数据】神经网络

前言 如果你喜欢<BABY夜谈大数据>这本书,或者想要及时收到更新,可以到豆瓣上订阅和购买哦! https://read.douban.com/column/3346397/ 神经网络旨在模拟人的思考方式,思维学普遍认为,人类大脑的思维分为抽象(逻辑)思维.形象(直观)思维和灵感(顿悟)思维三种基本方式.而神经网络主要就是模拟人类的逻辑思维. 逻辑思维是人们在认识事物的过程中借助于概念.判断.推理等思维形式能动地反映客观现实的理性认识过程,又称抽象思维.它是作为对认识者的思维及其结构以及起作用

NEC参加CCS云计算高峰论坛,浅谈大数据的应用和基础

5月16日,中国云计算领域两大最高端实战.权威专业的云盛会之一的CCS云计算高峰论坛在京召开.NEC(中国)有限公司软件销售部部长李勇在"CCS云计算高峰论坛"上,发表了"浅谈大数据的应用和基础"的主题演讲,介绍了NEC在大数据方面的研究和举措,有听众当场表示受益匪浅,希望与NEC深入交流. 大数据时代的背景 近年来,随着互联网.智能手机及传感器等的普及,信息流量有了爆发性的增长,根据GreenIT协议会统计,2025年,社会的信息量将猛增至2006年的200倍.越