小白学数据分析----->聚类分析理论之K-means理论篇

聚类分析是一类广泛被应用的分析方法,其算法众多,目前像SAS、Splus、SPSS、SPSS Modeler等分析工具均以支持聚类分析,但是如何使用,尤其在网游数据分析方面,作用还是很大的,尤其是我们对于某些客群的分析时,排除人为的分组的干扰,客观和全面的展现客群的特征是一件很重要的事。

网游玩家的消费特征、游戏行为特征(副本、任务、交互)、不同生命周期的玩家特征(新登玩家、留存玩家、流失玩家、回流玩家)等等,应用很广泛,然而我们发现有时候我们的划分是带有主观色彩的。比如明确分组变量、确定分组标准等等。这些特征的提取和指定往往需要很多的行业经验和大量尝试,而我们只希望分组时兼顾更多的因素和客观事实,减少人工标准的干预。

因此,聚类分析的出现就是解决这个问题的,今天把以前的学习笔记内容拿出来晒晒,说说K-Means吧,后续再说说其他的算法,最后集中的说说做的案例。

源文件下载:http://www.dmacn.com/viewthread.php?tid=76&extra=

时间: 2024-10-23 05:53:45

小白学数据分析----->聚类分析理论之K-means理论篇的相关文章

小白学数据分析----->聚类分析理论之TwoSteps理论篇+实践篇

昨天分享了以前学习的聚类分析算法K-Means的部分知识,其实这个主要是了解一下这个算法的原理和适用条件就行了,作为应用而不是作为深入研究,能够很好的将业务和算法模型紧密结合的又有几人呢?所以一些基本知识还是很必要的,这里就是简单把看过的一些知识点列举一下,梳理一下,快速了解和使用. 今天把TwoSteps的知识也梳理一下,顺便做个小的演示,使用SPSS 19,后续在使用SPSS Modeler或者叫做Clementine再演示一次使用方法.首先上图. TwoSteps支持数值型和分类型数据,这

小白学数据分析------>日活跃人数分析

从今天开始,特开辟一个小专栏,题目暂定为小白学数据分析,鄙人不才,在数据分析的道路上走的崎岖坎坷,同时数据分析本身是一个多面和复杂的工作,要懂得理论(统计.概率.数据挖掘.算法.模型)更要懂得业务,懂得行业理论,还要有灵活多变的思维,想想还是很复杂和麻烦的,所讲内容不但是理论,不仅是数据,尽量把这些东西综合起来,立体的来看,鄙人水平有限,很多的内容是尝试和改进,参考了很多的材料,在木有高人指点和牛人帮助的情况下,我只能借助浩瀚的网络知识和自己的悟性,今天决心拿出来给各位主要是帮助大家和我一起进步

小白学数据分析----->付费用户的金字塔模型实践操作

免费游戏中付费用户模型分析 最近看了不少文章,对于付费用户的模型也有了很深刻的理解和认识,早先我做了不少关于大R,中间R,低端R用户的分析,想来还是觉得草草了事,近来有网友提出来,理论探讨的多了些,实践上手的东西少了点,毕竟还是叫做小白学数据分析啊,今天就把以前说过的付费用户的模型具体的实践一下. 感悟和理论 得到的灵感首先要感谢Nicholas Lovell 的这篇文章,是我得到了一些处理和分析这个模型的办法.连接如下: http://www.gamesbrief.com/2011/11/wh

小白学数据分析----->数据指标 累计用户数的使用

小白学数据分析--à数据指标累计用户数的使用 累计用户数是指注册用户数的累计,即可以认为是新用户的累计.在一般的数据统计中,我们基本上都会涉及到这个指标,且这个指标是逐渐累加的,比如: 时间                   注册用户数[新登用户]           累计注册用户数 1日                    100                                                 100 2日                    120   

小白学数据分析之关联分析理论篇

关联分析的学习 在说关联分析之前,先说说自己这段时间的一些感受吧,这段时间相对轻松一些,有一些时间自己自己来学习一些新东西和知识,然而却发现捧着一本数据挖掘理论的书籍在一点一点的研读实在是很漫长,而且看过了没有什么感觉.数据这一行理论很多,算法很多,模型很多,自己现在一直是结合业务来做的数据分析与挖掘,相比电商而言,游戏业做的数据大多很糙,但是仅仅结合业务和运营,更加注重我们客户的质量和维护,当然这不是说电商没做,实际上电商一直在做,然而最近一次经历发现,我们过多的时候去讨论了算法,模型,新理论

小白学数据分析------>把握分析标准与敏感度

写在正文之前,想说几句话,今天是2012年3月16日,是我开博客以来的第9个月,9个月让我成长的非常迅速,这期间我收获了很多东西,认识了很多人,开了群,见了网站,持续的写博,从来没想到我的博客会有这么大的作用,从来没有SEO,从来没推广,从来没有任何宣传,我想到和我做的就是把我自己的成长纪录下来,把网游数据分析的点滴分享出来,当然我希望有人看,但是我毕竟不是高手,只是一个小白,小白只能是学习心得的纪录和整理,帮助自己理顺思路,很希望自己的文章有人看,因为那样就会有高手帮助我指点问题.今天 博客9

小白学数据分析-----> 13个要重点关注的数据指标[社交游戏,翻译自国外blog] part_1

1.流失[Churn] 每个月离开游戏的用户量,有时候也选择用每周来衡量.举个例子,比如一款游戏在月初有100人在游戏,其中70个人在那个月结束后仍旧留在游戏中,那么我们就说流失率为30%,因为那个月中30个人从最初的100人中离开了游戏. 流失率也被用来分析一个玩家离开游戏的可能性.比如,一个游戏100个用户,其中30%的用户离开[30%流失率].那么就意味着离开的可能性为30%,同样换个角度,也意味着,留下来的可能性为70%.所以如果我们要计算那个月结束后有多少玩家仍旧留在游戏中,那么我们就

小白学数据分析----->什么是活跃_I(DAU)

最近和几个人聊天,大家对于活跃都有着自己的看法,此外因为一些标准的问题,不熟悉分析术语的很多人把活跃,留存等很多信息都搞混了.后来发现这是一个很现实的问题.在一些我 看来不是问题的问题都变成了问题了,因此在此特地说说活跃的事,帮助更多从事游戏数据分析的小白们成长. 究竟什么是活跃?在日常与外界合作过程中,我们经常日活跃.周活跃.月活跃等等信息,貌似听起来比较简单,但是真正如果自己实施操作统计数据时却发现自己又不懂这些定义,因此作为一些分析师.甚至开发人员就会发现很难去操作.以下我将描述三个活跃的

小白学数据分析------>相关分析之距离分析在道具购买量的应用探索

  前几天,写过一篇关于相关分析的的文章,很多人都看到了并有很多人在咨询关于这篇文章的一些内容,相关分析是一类很有用的分析方法,如之前所提到的,相关分析由三部分组成,前几日的文章是讲了其中第一部分,第二部分是偏相关分析,第三部分就是复相关分析,说白了其实就是相关分析变量的多少来确定这三部分的.今天这里不谈偏相关分析,以为网友给我截图,问我下面的成交量相关系数的是怎么算出来的,其实这个就是复相关的典型应用,多变量的相关分析.插一句,该图来自于腾讯大讲堂15-市场研究及数据分析理念及方法概要介绍.大