《大数据分析原理与实践》一一2.2 基本统计量

2.2 基本统计量
**数据中的基本统计方法是基本统计量的计算,尽管简单,但是在一定程度上可以很好地反映出数据的特征和变化趋势。
**2.2.1 全表统计量

根据反映出的数据特征类型可以将基本统计量分为两类:反映数据集中趋势的和反映数据波动大小的。
能够反映数据集中趋势的度量包括均值、中位数和众数。下面给出它们的定义。
均值的定义为:令x1,x2,…,xn为某数值属性X的n个观测值或者观测,该值集合的均值为
(2-1)
有时,对于i=1,…,n,每个值xi可以与一个权值wi相关联。权值反映它们所依附的对应值的意义、重要性或出现的频率。在这种情况下,我们可以计算
(2-2)
这称作加权算术均值或加权平均。
中位数的定义为:有序数据值的中间值,即把数据较高的一半与较低的一半分开的值。假设给定某属性X的N个值按递增排序。如果N是奇数,则中位数是该有序集的中间值;如果N是偶数,则中位数不唯一,它是最中间的两个值和它们之间的任意值。在数值属性的情况下,根据约定,中位数取作最中间两个值的平均值。
众数的定义为:数据集中出现最频繁的值。
三种统计量之间的比较见表2-1。

能够反映数据散布情况的数据波动大小度量包括极差和方差(标准差)。
极差的定义为:设x1,x2,…,xn是某数值属性X上的观测的集合。该集合的极差是最大值与最小值之差。
方差的定义为:数值属性X的n个观测值x1,x2,…,xn的方差是
(2-3)
其中X是均值,由公式(2-1)定义。观测值的标准差σX是方差σX 2的平方根。低方差意味着数据观测趋向于非常靠近均值,而高方差表示数据散布在一个大的值域中。
两种统计量之间的比较见表2-2。

我们举个简单的例子来说明这几个概念。某个射击选手的成绩为9、8、10、7、6(单位:环),所以可求,中位数为8,极差为10-6=4,方差为。
2.2.2 皮尔森相关系数
上一节讨论的是针对单个属性的全表统计量,本节讨论衡量两个属性(在统计学中称为变量)之间关联关系的统计量。这个关联关系可以用相关系数来衡量。对于两个变量X和Y,如果X和Y没有任何关联关系,它们的相关系数为0;当X的值增大(减小)时,Y值相应地增大(减小),则两个变量为正相关,通常令其相关系数在0.00与1.00之间;当X的值增大(减小)时,Y值相应地减小(增大),则两个变量为负相关,通常令其相关系数在-1.00与0.00之间。
相关系数的绝对值越大,相关度越强。相关系数越接近于1或-1,相关度越强;相关系数越接近于0,相关度越弱。
相关系数可以用许多统计值来测量,最常用的是皮尔森相关系数,它是英国统计学家皮尔森于20世纪提出的一种计算直线相关的方法,也称为皮尔森相关或积差相关(或积矩相关),两个变量X和Y之间的皮尔森相关系数定义为两个变量之间的协方差和标准差的商。

上式定义了总体相关系数,常用希腊小写字母ρ(rho)作为代表符号。估算样本的协方差和标准差,可得到样本相关系数(样本皮尔森系数),常用英文小写字母r代表

r亦可由(Xi,Yi)样本点的标准分数均值估计,得到与上式等价的表达式

其中、X及σX分别是样本Xi的标准分数、样本均值和样本标准差。
皮尔森相关系数的变化范围为-1~1。如果系数的值为1,就意味着X和Y可以理想地由直线方程来描述,所有的数据点都很好地落在一条直线上,且Y随着X的增加而增加;相反,系数的值为-1意味着所有的数据点都落在直线上,但Y随着X的增加而减少。此外,系数的值为0意味着两个变量之间没有线性关系。
更一般地说,当且仅当Xi和Yi均落在它们各自的均值的同一侧,这时(Xi-X)(Yi-Y)的值为正。也就是说,如果Xi和Yi同时趋向于大于或同时趋向于小于它们各自的均值,则相关系数为正。如果Xi和Yi趋向于落在它们均值的相反一侧,则相关系数为负。
举一个例子说明。表2-3为绝缘材料的压缩量和压力。
计算压力x和压缩量y之间的相关系数r。

所以,;,。
从而

可以看出,压力和压缩量是高度相关的,而且是很强的正相关关系,不过需要注意的是,高度相关并不一定蕴含因果关系。

时间: 2024-08-19 03:51:06

《大数据分析原理与实践》一一2.2 基本统计量的相关文章

《大数据分析原理与实践》一一1.4 大数据分析的过程、技术与难点

1.4 大数据分析的过程.技术与难点 1.大数据分析的过程 大数据分析的过程大致分为下面6个步骤: (1)业务理解 最初的阶段集中在理解项目目标和从业务的角度理解需求,同时将业务知识转化为数据分析问题的定义和实现目标的初步计划上. (2)数据理解 数据理解阶段从初始的数据收集开始,通过一些活动的处理,目的是熟悉数据,识别数据的质量问题,首次发现数据的内部属性,或是探测引起兴趣的子集去形成隐含信息的假设. (3)数据准备 数据准备阶段包括从未处理数据中构造最终数据集的所有活动.这些数据将是模型工具

《大数据分析原理与实践》一一2.3 推断统计

2.3 推断统计推断统计是研究如何利用样本数据来推断总体特征的统计方法,其目的是利用问题的基本假定及包含在观测数据中的信息,做出尽量精确和可靠的结论.基本特征是其依据的条件中包含带随机性的观测数据.以随机现象为研究对象的概率论是统计推断的理论基础.它包含两个内容:参数估计,即利用样本信息推断总体特征,例如某一群人的视力构成一个总体,通常认为视力是服从正态分布的,但不知道这个总体的均值,随机抽部分人,测得视力的值,用这些数据来估计这群人的平均视力:假设检验,即利用样本信息判断对总体的假设是否成立.

《大数据分析原理与实践》一一1.5 全书概览

1.5 全书概览 本书将较为全面地描述大数据分析的模型.技术.实现与应用.其中第2-7章介绍大数据分析模型,包括关联分析模型.分类分析模型.聚类分析模型.结构分析模型和文本分析模型:第8-11章介绍大数据分析相关的技术,包括大数据预处理.特征选择和降维方法.面向大数据的数据仓库和大数据分析算法.第12-14章介绍三种用于实现大数据分析算法的平台,分别是大数据计算平台.流式计算平台和大图计算平台:第15-16章介绍两类大数据分析的具体应用,分别讲述社会网络和推荐系统. 第2章是大数据分析建模的基础

《大数据分析原理与实践》一一1.3 什么是大数据分析

1.3 什么是大数据分析 1.大数据分析的定义 数据分析指的是用适当的统计分析方法对收集来的大量数据进行分析,提取有用信息和形成结论而对数据加以详细研究和概括总结的过程. 数据分析可以分为三个层次,即描述分析.预测分析和规范分析. 描述分析是探索历史数据并描述发生了什么,这一层次包括发现数据规律的聚类.相关规则挖掘.模式发现和描述数据规律的可视化分析. 预测分析用于预测未来的概率和趋势,例如基于逻辑回归的预测.基于分类器的预测等. 规范分析根据期望的结果.特定场景.资源以及对过去和当前事件的了解

《大数据分析原理与实践》一一2.1 大数据分析模型建立方法

2.1 大数据分析模型建立方法 大数据分析模型可以基于传统数据分析方法中的建模方法建立,也可以采取面向大数据的独特方法来建立.为了区分这两种模型建立方法,我们分别简称其为传统建模方法和大数据建模方法.由于这两种模型建立方法存在一些交集(如业务调研.结果校验等),我们采取统一框架来进行介绍,在介绍时区分两种建模方法的不同之处.传统数据分析建模方法与大数据分析建模方法从大数据这个概念提出开始,就有"大数据分析方法与传统数据分析方法同与异"之辩.有的观点认为,传统分析是"因果分析&

《大数据分析原理与实践》一一3.4 小结

3.4 小结关联分析模型用于描述多个变量之间的关联,这是大数据分析的一种重要模型,本章主要探讨了回归分析.关联规则分析和相关分析这三类关联分析.3.1节介绍了回归分析模型,即描述一个或多个变量与其余变量的依赖关系,包括其基本定义和数学模型,并介绍了回归分析的基本计算方法和模型检验,紧接着介绍了回归模型的拓展,包括多项式回归.GBDT回归和XGBOOST回归,并且简要介绍了"回归大家族",让读者对于整个回归问题有了全面的了解.3.2节讲述了关联规则分析模型,即查找存在于项目集合或对象集合

《大数据分析原理与实践》一一第2章 大数据分析模型

第2章 大数据分析模型 大数据分析模型讨论的问题是从大数据中发现什么.尽管对大数据的分析方法林林总总,但面对一项具体应用,大数据分析非常依赖想象力.例如,对患者进行智能导诊,为患者选择合适的医院.合适的科室和合适的医生.可以通过患者对病症的描述建立模型而选择合适的科室:可以基于对患者位置.医院擅长病症的信息以及患者病症的紧急程度建立模型而确定位置合适的医院:还可以根据医院当前的队列信息建立模型进行推荐,如果队列较长则显示已挂号人数较少.等待时间较短的医生资料,如果队列较短则显示那些挂号费和治疗费

《大数据分析原理与实践》一一

3.3 相关分析 相关关系是一种非确定性的关系,例如,以X和Y分别表示一个人的身高和体重,或分别表示每公顷施肥量与每公顷小麦产量,则X与Y显然有关系,而又没有确切到可由其中的一个去精确地决定另一个的程度,这就是相关关系.在一些问题中,不仅经常需要考察两个变量之间的相关程度,而且还经常需要考察多个变量与多个变量之间即两组变量之间的相关关系.典型相关分析就是研究两组变量之间相关程度的一种多元统计分析方法.典型相关分析是研究两组变量之间相关关系的一种统计分析方法.为了研究两组变量X1,X2,-,Xp和

《大数据分析原理与实践》——1.4 大数据分析的过程、技术与难点

1.4 大数据分析的过程.技术与难点 1.大数据分析的过程 大数据分析的过程大致分为下面6个步骤: (1)业务理解 最初的阶段集中在理解项目目标和从业务的角度理解需求,同时将业务知识转化为数据分析问题的定义和实现目标的初步计划上. (2)数据理解 数据理解阶段从初始的数据收集开始,通过一些活动的处理,目的是熟悉数据,识别数据的质量问题,首次发现数据的内部属性,或是探测引起兴趣的子集去形成隐含信息的假设. (3)数据准备 数据准备阶段包括从未处理数据中构造最终数据集的所有活动.这些数据将是模型工具

《大数据分析原理与实践》——导读

前 言 本书的缘起与成书过程 大数据经过分析能够产生高价值,这无疑已在大数据火爆的今天成为共识,从而使得大数据分析在"大数据+"涉及的领域(如工业.医疗.农业.教育等)有了广泛的应用.大数据分析的相关知识不仅是大数据行业的从业人员应该必备的,也是和大数据相关的各行各业的从业者需要了解的. 然而,人们对大数据分析的解读有多个不同方面.从"分析"的角度解读,大数据分析可以看作统计分析的延伸:从 "数据"的角度解读,大数据分析可以看作数据管理与挖掘的扩