好书学习
进度:Preface部分
Year:2016
随着大量无标签数据的激增,无监督学习算法–可以自动发现这些数据中有趣和有用的模式–在研究人员和从业人员中得到了普及。这些算法已经发现了许多应用,包括模式识别、市场篮子分析、网络挖掘、社会网络分析、信息检索、推荐系统、市场研究、入侵检测和欺诈检测。在过去的半个世纪里,由于难以开发出理论上合理的、可用于客观评价的方法,因此许多无监督学习算法被提出。
本卷的目标是总结无监督学习的技术现状。目标读者包括使用无监督学习算法来分析数据的研究人员和从业人员。
本卷以两章的异常检测开篇。在 “AnomalyDetection for Data with Spatial Attributes”中,P. Deepak回顾了数据挖掘和统计学界开发的空间数据的异常检测技术。作者提出了此类技术的分类,描述了最具代表性的技术,并讨论了聚类和图像分割在异常检测中的应用。
在 Anomaly Ranking in a High Dimensional Space: The Unsupervised Tree Rank Algorithm” 中Clémençon等人描述了一种基于质量-体积准则最小化的计算效率高的异常排名算法。该算法不涉及任何抽样,因此,它特别适用于观测数量大的和高维的数据。
聚类无疑是最著名的无监督学习的子领域。在 "Genetic Algorithmsfor Subset Selection in Model-Based Clustering "中,Scrucca描述了一种遗传算法,该算法将贝叶斯信息准则(BIC)最大化