《写给程序员的数据挖掘实践指南》——1.1欢迎来到21世纪

1.1欢迎来到21世纪

进入21世纪,有限的选择已经成为历史。如果想购买音乐,iTunes提供了1100万首歌曲供你选择。这可是1100万!截止到2011年10月,iTunes已经出售了160亿首歌曲。如果需要更多的选择,那么可以访问Spotify6,它上面有超过1500万首的歌曲可供选择。

想买书?亚马逊上有超过200万的书名可供选择。

想看视频?可以有如下多种选择。

想买一台笔记本电脑?当在亚马逊网站的搜索框中输入laptop时,会返回3811条结果。

而如果输入rice cooker(电饭锅),则可以得到超过1000条结果。

在不久的将来,我们的选择还会更多:数十亿首在线音乐、大量视频节目以及可以通过3D打印定制的产品,等等。

寻找相关对象
面对这么多选择,问题在于寻找相关对象。在iTunes的所有1100万首歌曲中,我非常喜欢的可能有不少,但是问题在于如何找到这部分歌曲。今晚我想从Netflix上观看一部流媒体视频,那么到底应该看哪一部?我想使用P2P下载一部视频,但是到底应该下载哪一部?并且,上述问题正变得更加糟糕:每分钟都有数T字节的媒体加入到网络中,每分钟Usenet上就有100个新文件,每分钟都有24小时时长的视频上传到YouTube,每小时都有180种新书出版发行。实际上,每天真实世界中都有越来越多的物品可供购买。在所有可选对象组成的“海洋”中,寻找相关对象变得越来越困难。

如果你是媒体制作人,比如马来西亚的季小薇(Zee Avi),那么风险并不在于有人非法下载你的音乐,而在于你自己默默无闻。

但如何寻找对象?
在前面提到的多年以前的小镇上, 我们通过朋友来寻找相关对象。通过朋友,我们知道那款布料的纹样非常符合我们的要求,那本新小说能在书店找到,还有能够在唱片店找到那款 新的33 1/3 LP唱片(黑胶唱片)等。即使今天我们还依赖朋友来寻找相关对象。

我们也通过专家来寻找相关内容。多年前Consumer Reports7可以对出售的所有20种型号的洗衣机或者所有10种型号的电饭锅进行评估,从而对顾客进行推荐。现在,在亚马逊网站上有数百种型号的电饭锅,不太可能单个专家就能对所有这些电饭锅进行评级。多年前,Roger Ebert8几乎能够评论所有的影片。但是现在全世界一年会制作大约25000部影片。此外,我们还可以从多个片源来访问影片。不论是Roger Ebert还是任意单个专家,都无法评论我们能观看的所有影片。

我们也使用对象本身的信息来寻找它们。例如,在长达30年的时间里我使用了一台Sears洗衣机,现在我想换另一台Sears洗衣机。我喜欢披头士乐队的某张唱片,那么很可能会购买他们的另一个唱片,这是因为我有很大的可能也会喜欢这个唱片。

上述通过朋友、专家或者对象本身的信息寻找相关对象的方法到今天仍在使用。不过,我们需要一些计算上的辅助才能满足21世纪的要求,因为我们现在有数十亿的选择可能。

本书将会探讨聚合人们的喜好、购买历史及其他数据的方法,也将利用社会网络(朋友)的威力,挖掘出相关的对象。例如,我喜欢Phoenix这个乐队。系统可能知道Phoenix乐队的属性包括使用电声摇滚乐器、有朋克效果、巧妙使用声乐等。于是,它可能向我推荐一个属性相似的乐队,比如The Strokes乐队。

时间: 2024-09-26 10:11:57

《写给程序员的数据挖掘实践指南》——1.1欢迎来到21世纪的相关文章

《写给程序员的数据挖掘实践指南》——第5章 分类的进一步探讨—算法评估及kNN

第5章 分类的进一步探讨-算法评估及kNN 写给程序员的数据挖掘实践指南 回到上一章中关于运动员的例子.在那个例子中我们构建了一个分类器,输入为运动员的身高.体重,输出为其从事的体育项目-体操.田径或篮球. 因此,左图的Marissa Coleman身高6英尺1英寸,体重160磅.我们的分类器能够将她正确判断为篮球运动员: >>> cl = Classifier('athletesTrainingSet.txt') >>> cl.classify([73, 160])

《写给程序员的数据挖掘实践指南》——1.4本书体例

1.4本书体例 本书秉承践行学习法.我建议大家用书中提供的Python代码来进行习题练习和实验,而不是被动地阅读本书.多多实验.深入代码并在多个不同数据集上尝试本书中的方法是真正理解技术的关键. 我努力做到如下两个方面之间的平衡:一方面,我详细介绍实用的数据挖掘Python代码以便读者可以使用并对其进行修改:另一方面,读者也能了解背后的数据挖掘技术.为防止读者阅读理论.数学及Python代码时大脑的思维停滞,我加入插图和图片来刺激大脑的另一部分. Google研究院院长彼得·诺维德(Peter

《写给程序员的数据挖掘实践指南》导读

前言 写给程序员的数据挖掘实践指南 在你面前是一个学习基本的数据挖掘技术的工具.绝大多数数据挖掘教材关注数据挖掘的基础理论知识,因此众所周知给读者带来理解上的困难.当然,不要误解我的意思,那些书中的知识相当重要.但是,如果你是一名想学习一点数据挖掘知识的程序员,你可能会对入门者实用手册感兴趣.而这正是本书的宗旨所在. 本书内容采用"做中学"的思路来组织.我希望读者不是被动地阅读本书,而是通过课后习题和本书提供的Python代码进行实践.我也希望读者积极参与到数据挖掘技术的编程当中.本书

《写给程序员的数据挖掘实践指南》——第1章 数据挖掘简介及本书使用方法

第1章 数据挖掘简介及本书使用方法写给程序员的数据挖掘实践指南假想150年前一个美国小镇的生活情形:大家都互相认识:百货店某天进了一批布料,店员注意到这批布料中某个特定毛边的样式很可能会引起Clancey夫人的高度兴趣,因为他知道Clancey夫人喜欢亮花纹样:于是他在心里记着等Clancey夫人下次光顾时将该布料拿给她看看:Chow Winkler告诉酒吧老板Wilson先生,他考虑将多余的雷明顿(Renmington)1来福枪出售:Wilson先生将这则消息告诉Bud Barclay,因为他

《写给程序员的数据挖掘实践指南》——1.3TB级挖掘是现实不是科幻

1.3TB级挖掘是现实不是科幻 20世纪末,100万词的数据集被认为很大.20世纪90年代我在读研究生时(是的,我有那么老)在Greek New Testament做了一年程序员.大约20万单词的分析就大到不能放在主机内存里而不得不把结果缓存在磁带上,因此必须要安装磁带机. Barbara Friberg依据该结果写成Analytical Greek New Testament一书并公开出版(可以从亚马逊网站上订购).我是当时在明尼苏达大学完成该项目的3名程序员之一. 现在在数T信息上进行数据挖

《写给程序员的数据挖掘实践指南》——5.3混淆矩阵

5.3混淆矩阵 到目前为止,通过计算下列精确率百分比,我们对分类器进行评估: 有时,我们可能希望得到分类器算法的更详细的性能.能够详细揭示性能的一种可视化方法是引入一个称为混淆矩阵(confusion matrix)的表格.混淆矩阵的行代表测试样本的真实类别,而列代表分类器所预测出的类别. 它之所以名为混淆矩阵,是因为很容易通过这个矩阵看清楚算法产生混淆的地方.下面以女运动员分类为例来展示这个矩阵.假设我们有一个由100名女子体操运动员.100名WNBA篮球运动员及100名女子马拉松运动员的属性

《写给程序员的数据挖掘实践指南》——5.1训练集和测试集

5.1训练集和测试集 前一章的最后部分中,我们使用了3个不同的数据集:女子运动员数据集.Iris数据集以及汽车MPG数据集.我们把每个数据集分成两个子集,一个用于构建分类器,该数据集称为训练集(training set).另一个数据集用于评估分类器,该数据集称为测试集(test set).训练集和测试集是数据挖掘中的常用术语. 数据挖掘领域的人永远不会在用于训练系统的数据上进行测试!下面以近邻算法为例来解释为什么不能使用训练数据来测试.如果上述例子中的篮球运动员Marissa Coleman在训

《写给程序员的数据挖掘实践指南》——5.4一个编程的例子

5.4一个编程的例子 回到上一章当中提到的来自卡内基梅隆大学的汽车MPG数据集,该数据集的格式如下: 下面试图基于气缸的数目.排水量(立方英寸).功率.重量和加速时间预测汽车的MPG.我将所有392个实例放到mpgData.txt文件中,然后编写了如下的短Python程序,该程序利用分层采样方法将数据分到10个桶中(数据集及Python代码都可以从网站guidetodatamining.com下载). import random def buckets(filename, bucketName,

《写给程序员的数据挖掘实践指南》——5.6近邻算法的改进

5.6近邻算法的改进 一个普通的分类器的例子是Rote分类器,它只记忆所有的训练集,仅当实例与训练样本精确匹配时才对实例进行分类.如果只在训练集上进行评估,那么Rote分类器的精确率一直是100%.在实际中,由于有些待分类的实例不在训练集中出现,因此Rote分类器并不是一个好的选择.我们可以将前面介绍的近邻分类器看成是Rote分类器的一个扩展.与Rote分类器寻找精确匹配不同的是,近邻方法寻找近似的匹配.Pang Ning Tan.Michael Steinbach和Vipin Kumar在他们

《写给程序员的数据挖掘实践指南》——5.7一个新数据集及挑战

5.7一个新数据集及挑战 现在到考察一个新数据集的时候了,该数据集是美国国立糖尿病.消化和肾脏疾病研究所(United States National Institute of Diabetes and Digestive and Kidney Diseases,简称NIDDK)所开发的皮马印第安人糖尿病数据集(Pima Indians Diabetes Data Set). 令人吃惊的是,有超过30%的皮马人患有糖尿病.与此形成对照的是,美国糖尿病的患病率为8.3%,中国为4.2%. 数据集中