硅谷资深数据科学家教你认清探索性数据分析(EDA)的价值

首发地址:

更多深度文章,请关注:https://yq.aliyun.com/cloud

作者介绍

Chloe Mawer:硅谷资深数据科学家,具有地球物理学和水文学的学习背景,精通利用数据进行预测以及提供有价值的见解;她的学术研究和工程经验使她能够解决新问题,创造实用、有效的解决方案。

领英:http://www.linkedin.com/in/chloemawer/

编者注:Chloe Mawer(SVDS成员)在4月3日的波士顿TDWI 大会上发言,可以从幻灯片上获取更多的信息。 

从外表来看,数据科学通常被认为完全是由高等统计学和机器学习技术组成。然而,另一个重要组成部分往往被低估或遗忘:探索性数据分析(EDA)。EDA指对已有的数据(特别是调查或观察得来的原始数据)在尽量少的先验假定下进行探索,通过作图、制表、方程拟合、计算特征量等手段探索数据的结构和规律的一种数据分析方法。在深入机器学习或统计建模之前,EDA是一个重要的步骤,这是因为它提供了为现有问题开发适当模型并正确解释其结果所需的来龙去脉。
但随着工具的兴起,只需要简单的将数据提供给黑盒就可以轻松实现强大的机器学习算法,因此略过EDA这一步将变得异常诱惑。然而简单地将数据提供给黑盒并不总是一个好主意——这是因为EDA对于所有类型的数据科学问题具有关键价值。
EDA对数据科学家而言是有价值的,这是因为EDA能确保他们生成的结果是有效的、能被正确解析以及适用于所需的业务环境。在确保技术交付成果之外,EDA还通过确认正在提出正确的问题而不是基于假设调查以及通过提供问题的背景来确保数据科学家的输的出潜在的价值可以最大化。

这篇文章将高度概述EDA通常涉及的内容,然后描述EDA对于成功建模和解释其结果至关重要的三个主要方式。无论您是数据科学家还是数据科学的消费者,希望在阅读本文后,您将了解为什么EDA应该是在项目数据科学操作中的关键一部分。
什么是EDA?
尽管EDA已经存在于数据分析,据说1977年约翰·图克(John W. Tukey)写的“探索性数据分析”一书中已经创造了这个词并发展了这个领域。概括来讲,EDA用于理解和总结数据集的内容,通常用于调查特定问题或更高级的建模。EDA通常很大程度上依赖于可视化数据来评估模式并利用一些定量方法来描述数据。
EDA通常涉及以下几种方法的组合:

原始数据集中每个字段的单变量可视化和汇总统计(见图1) 

    图1

  • 用于评估数据集中每个变量与感兴趣目标变量之间的关系的双变量可视化和汇总统计(例如,时间流失,花费)(见图2)

 图2

  • 多元可视化以了解数据中不同字段之间的交互作用(见图3)。 

图3

  • 降维以了解数据中的字段,这些字段占据了观察值之间的最大差异,并允许处理减少的数据量。
  • 通过将数据折叠成几个小数据点让观察值聚类成有区别的小组,可以更容易地识别行为模式(参见图4) 

图4

通过这些方法,数据科学家验证假设并识别有助于理解问题和模型选择的模式,为数据建立直觉以确保高质量分析,并验证数据是按预期的方式生成。
验证假设和模式识别
EDA的主要目的之一是在假设任何事情之前查看数据,这是很重要的。首先,数据科学家可以验证在构建模型时可能已经做出的任何假设,或者是使用某些算法所必需的假设。其次,对数据的自由假设探索可以帮助识别模式以及观察到行为的潜在原因,这可能有助于回答遇到的问题或告知建模的选择。 

通常有两种类型的假设可能影响分析的有效性:技术和商业。正确使用特定的分析模型和算法依赖于具体的技术假设是否正确,例如变量之间没有共线性、数据中的方差与数据值无关以及数据是否以某种方式丢失或损坏。在EDA中,评估各种技术假设以帮助选择对手头数据和任务而言的最佳模型。如果没有这样的评估,可以使用一个模型来违反那些假设使得该模型不再适用于有关数据,并可能导致对组织有负面影响的不良预测和不正确的结论。

第二种假设,商业假设有点更难以捉摸。通过对模型的了解,数据科学家知道每种类型的假设必须对其使用有效并可以系统地检查它们。另一方面,商业假设可以完全无法识别并深深地纠缠于问题及其框架。有一次,我们正在与一位正在试图了解用户与他们的应用程序如何进行互动以及发生什么交互信号可能会流失的用户的客户进行合作,他们深深地嵌入在假设出现问题的框架中,他们的假设是用户群是由有经验的厨师组成,并希望通过复杂的食谱提高他们的烹饪水平。事实上,用户群主要由无经验的用户组成,试图找到快速、易于准备的食物的食谱。当我们发现客户假设是错误后,他们不得不开始理解一整套新的问题以告知之后的应用开发。
在验证这些技术和商业假设的同时,数据科学家将系统地评估每个数据字段的内容及其与其他变量的相互作用,特别是表示企业想要了解或预测的行为的关键度量(例如使用生命周期、支出)。人类是自然模式识别器,通过以不同的方式对数据进行详尽的可视化,并将这些可视化策略性地配置在一起,数据科学家可以利用其模式识别能力来识别行为的潜在原因、识别潜在的有问题或虚假的数据点以及开发可以通知其分析和模式的假设。
建立对数据的直觉
为什么EDA是更先进的建模前采取的必要步骤,还有一个较为具体的原因是数据科学家需要亲自熟练掌握数据,并为培养一种对数据是什么的直觉,这种直觉对于能够快速识别何时出现问题尤为重要。比如在EDA中,绘制使用寿命与年龄曲线并进行比较,可以发现年轻用户倾向于停留某个产品的时间更长,那么结论是当年龄下降时会增加使用周期。如果训练的模型显示不同的行为,就会很快意识到应该调查发生了什么,并确保没有犯任何的错误。没有EDA,数据突出的问题或模型的实施中的错误会被长时间忽视,这可能会导致基于错误信息做出决策。
验证数据是不是像你认为的那样
在Tukey风格的EDA中,分析师通常很清楚他们分析的数据是如何生成的。然而,现在随着组织内部生成大量数据集以及获取的第三方数据,分析师通常远离数据生成的过程。如果数据不是你认为的那样,那么你的结果可能会受到不良影响,更糟的是误解后采取的行动。
这个例子会展示数据生成的方式可能被误解,让我们来具体看看该例子:A公司正在尝试预测哪些用户将订阅新产品以瞄准其产品定位。他们正在努力开发一个模型,但每次尝试都会导致糟糕的预测结果。然后有人认为执行广泛的EDA,他们最初认为这是没有必要的。但结果表明,预测的用户是控制员工订阅的产品的较大企业账户的一部分。这种控制意味着用户可以以各种方式在数据中看起来完全相同,但具有不同的目标结果,这意味着个人层面的数据几乎没有能力告知预测。在这种情形中,EDA不仅在技术问题上暴露了所采取方法的技术问题,而且还表明出现的错误问题。如果用户的行为受到其组织的控制,则无法对用户进行定位。该公司需要瞄准并预测新产品订阅的企业帐户。
我们已经看到数据生成过程中被错误地假设的其他例子:

  • 数据在产品的相同版本或跨平台上生成。
  • 数据根据X时区或相同的跨时区被盖上时间戳。
  • 记录所有活动的数据,但仅在用户登录时记录。
  • 用户标识符保持不变或标识符唯一。

如何去获得这些所有的价值呢?
既然知道了EDA为什么是有价值的,你可能想知道如何去实现EDA。一种方法是参加4月3号举办的TDWI讨论会,会上将探讨EDA的最佳方法,另外还有一些针对各种EDA方法发布的博客。以下博客强调了EDA获得的见解:

文章原标题《The Value of Exploratory Data Analysis》,作者:Chloe Mawer,译者:海棠,审阅:,附件为原文的pdf。

文章为简译,更为详细的内容,请查看原文

时间: 2024-11-08 21:23:31

硅谷资深数据科学家教你认清探索性数据分析(EDA)的价值的相关文章

微软高级数据科学家教你如何做数据科学

学会获取更多的数据 数据科学的数据源是数字和字段的集合.测量.价格.日期.时间.产品.标题等,都是简单的数据集;你也可以用图像.音频.视频等复杂结构的数据集,这时需要你去降维分解成数字和字段的集合. 数据获取是一个复杂的机制,数据工程师各种被揉捏,但本篇文章重点是讲述数据科学,数据获取将会是下一个topic. 学会聪明的提出问题 简单点讲,就是提出的问题要问到点子上.数据科学是通过对数字和字段组成的数据集合进行处理,然后回答问题.你描述的问题越精确,越容易找到令你满意的精确答案.含糊不清的问法:

关于数据科学的那些事

更多深度文章,请关注云计算频道:https://yq.aliyun.com/cloud 请收下这份关于人工智能的根目录--博客整理系列(一) 关于数据科学的那些事--博客整理系列(二) 机器学习必备手册--博客整理系列(三) 扩展眼界的都在这--博客整理系列(四) 深度学习必备手册(上)--博客整理系列(五) 深度学习必备手册(下)--博客整理系列(六) 随着科技的发展,人类社会拥有数据的规模增长很快,每时每刻.从天到地都有大量数据被产生和存储下来.这些数据被积累下来,到底怎么样使用才能创造出我

10个2017的预测:数据科学、机器学习和物联网

近日, Vincent Granville在Data Science Central上撰文对2017的数据科学.机器学习和物联网进行了预测. 以下为译文 又到了分享对2017年的预言的时候了,这里抛砖引玉,也希望各位发表自己的观点. 1. 数据科学和机器学习将变得更为主流,特别在以下领域:能源业.金融业(银行.保险).农业(精耕).运输业.城市规划.医疗保健(定制治疗),甚至是政府方面. 2. 某些数据科学的门外汉想要创建合法的,有关如何分析数据.算法怎样运转的体系,并打算强制公开算法的秘诀.我

《Spark与Hadoop大数据分析》一一1.2 大数据科学以及Hadoop和Spark在其中承担的角色

1.2 大数据科学以及Hadoop和Spark在其中承担的角色 数据科学的工作体现在以下这两个方面:从数据中提取其深层次的规律性创建数据产品要从数据中提取其深层次的规律性,意味着要使用统计算法提炼出有价值的信息.数据产品则是一种软件系统,其核心功能取决于对数据的统计分析和机器学习的应用.Google AdWords或Facebook里的"你可能认识的人"就是数据产品的两个例子.1.2.1 从数据分析到数据科学的根本性转变 从数据分析到数据科学的根本转变的根源,是对更准确的预测和创建更好

《Spark与Hadoop大数据分析》——1.2 大数据科学以及Hadoop和Spark在其中承担的角色

1.2 大数据科学以及Hadoop和Spark在其中承担的角色 数据科学的工作体现在以下这两个方面: 要从数据中提取其深层次的规律性,意味着要使用统计算法提炼出有价值的信息.数据产品则是一种软件系统,其核心功能取决于对数据的统计分析和机器学习的应用.Google AdWords或Facebook里的"你可能认识的人"就是数据产品的两个例子. 1.2.1 从数据分析到数据科学的根本性转变 从数据分析到数据科学的根本转变的根源,是对更准确的预测和创建更好的数据产品需求的不断增长. 让我们来

硅谷投资家:数据科学大于生物科技对健康行业的贡献!

一年半以前,硅谷的风险投资家Vinod Khosla 在一次会议上发言时成了头条.他说,在下一个10年,数据科学和软件对医学的贡献要比所有生物科学知识加起来都要多得多.Washington Post近日发表了一篇Vinod Khosla的访谈,Vinod Khosla仍坚信他的判断.动脉网将这篇报道编译如下. Vinod Khosla的这番话在世界上被广泛传播,数不尽的博客帖子也对此进行了仔细剖析,这个技术团体中的很多人都把他的言论当作一种挑战.但是,一些人对这种"技术能够解决一切问题"

数据科学入门难?老司机为你盘点 24 门精品课程

本文盘点了 24 个高品质的在线数据科学入门教程,原作者 David Venturi,他获有化学工程和经济学的双学位,热衷于数学.数据科学和统计学,同时也是一位编程爱好者.更具传奇色彩的是,他本来就读于一所名校的计算机科学专业,但觉得对数据科学更感兴趣--于是果断退学,从 Coursera.edx.Udemy 等慕课平台开始自学,终迈入专家行列. 他的经历说来也并不特别,世界上又多了一个慕课代言人而已.但雷锋网认为,他的经历具有两点价值:首先,最好的教学资源已经在那儿了--很多还是免费的,取不取

阿里云资深数据专家闵万里:阿里云与中国人工智能的未来息息相关

阿里云与中国人工智能的未来息息相关 面对采访,阿里云资深数据挖掘专家闵万里博士信心满满:"阿里云今天选择的,就是中国人工智能未来产生价值的必经之路,这也决定了阿里云与中国人工智能接下来的发展息息相关." 如果非要问一个问题:"谁才是中国目前人工智能技术积累最强的公司?"你心中或许第一个出现的是常打技术牌的百度,或是刚靠围棋人工智能程序"绝艺"刷了屏的腾讯,相比之下,阿里的基因似乎和人工智能显得"画风不符".可你或许不知道,20

一位资深数据分析师的分享

一位资深数据分析师的分享 发表于 2012-05-08 01:10 来源:中国统计网 一.掌握基础.更新知识.      基本技术怎么强调都不过分.这里的术更多是(计算机.统计知识), 多年做数据分析.数据挖掘的经历来看.以及业界朋友的交流来看,这点大家深有感触的.    数据库查询-SQL 数据分析师在计算机的层面的技能要求较低,主要是会SQL,因为这里解决一个数据提取的问题.有机会可以去逛逛一些专业的数据论坛,学习一些SQL技巧.新的函数,对你工作效率的提高是很有帮助的.  统计知识与数据挖