码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • 【阿旭机器学习实战】【17】KMeans聚类算法中如何选择合适的聚类个数K


    目录

    • KMeans聚类算法中如何选择合适的聚类个数?
    • 问题描述
      • 1. 随机生成二维数据点
      • 2. 定义不同聚类中心个数对点进行分类
      • 3. 画图选取最合适的K值

    KMeans聚类算法中如何选择合适的聚类个数?

    问题描述

    我们随机生成一些二维点的数据,然后通过不同的K值对其进行分类评估。

    具体步骤:

    1. 随机生成一些二维点
    2. 选取不同的K值进行模型训练,并计算轮廓系数
    3. 画出K值与轮廓关系的折线图,看取哪一个K值合适

    1. 随机生成二维数据点

    import numpy as np
    
    • 1
    x1 = np.random.randint(1,10,size=14)
    x2 = np.random.randint(1,10,size=14)
    
    • 1
    • 2
    x = np.c_[x1,x2]
    x
    
    • 1
    • 2
    array([[6, 5],
           [3, 6],
           [4, 4],
           [2, 9],
           [1, 8],
           [1, 5],
           [1, 7],
           [7, 4],
           [3, 7],
           [2, 2],
           [2, 8],
           [6, 5],
           [3, 2],
           [6, 4]])
    
    • 1
    • 2
    • 3
    • 4
    • 5
    • 6
    • 7
    • 8
    • 9
    • 10
    • 11
    • 12
    • 13
    • 14
    # 画出这些点的散点图
    plt.scatter(x1,x2)
    
    • 1
    • 2

    在这里插入图片描述

    2. 定义不同聚类中心个数对点进行分类

    # 定义出若干种聚类的个数
    clusters = [2,3,4,5,8]
    
    • 1
    • 2
    plt.figure(figsize=(8*2,3*3))
    
    # 定义一个列表用于存储轮廓系数
    sil_scores = []
    # 定义一个变量,用于记录当前是第几个图
    sub_center = 1
    
    axes = plt.subplot(231)
    axes.scatter(x1,x2)
    axes.set_title("Instances")
    
    for cluster in clusters:
        km = KMeans(n_clusters=cluster).fit(x)
        # 打印每种聚类划分的标签
        print(km.labels_)
        
        # 求每一次划分的轮廓系数
        sil_score = metrics.silhouette_score(x,km.labels_)
        sil_scores.append(sil_score)
        
        # 画图
        sub_center += 1
        axes = plt.subplot(2,3,sub_center)
        axes.scatter(x1,x2,c=km.labels_)
        # 把当前的K值和轮廓系数作为标题
        axes.set_title("K=%s,Sil_score=%s"%(cluster,sil_score))
    
    • 1
    • 2
    • 3
    • 4
    • 5
    • 6
    • 7
    • 8
    • 9
    • 10
    • 11
    • 12
    • 13
    • 14
    • 15
    • 16
    • 17
    • 18
    • 19
    • 20
    • 21
    • 22
    • 23
    • 24
    • 25
    • 26
    [0 1 0 1 1 1 1 0 1 0 1 0 0 0]
    [0 1 0 1 1 1 1 0 1 2 1 0 2 0]
    [2 3 1 0 0 3 0 2 3 1 0 2 1 2]
    [2 1 0 3 3 4 3 2 1 0 3 2 0 2]
    [2 3 6 7 1 4 1 5 3 0 7 2 0 5]
    
    • 1
    • 2
    • 3
    • 4
    • 5

    [外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-UvjvXNek-1667459348007)(output_51_1.png)]

    3. 画图选取最合适的K值

    # 画一个折线图,体现聚类个数和轮廓系数之间的关系
    plt.plot(clusters,sil_scores)
    
    • 1
    • 2
    []
    
    • 1

    在这里插入图片描述

    通过上面折线图我们可以看到,当K=3时,轮廓系数最大,分类效果最好。

    如果内容对你有帮助,感谢记得点赞+关注哦!

    欢迎关注我的公众号:阿旭算法与机器学习,共同学习交流。
    更多干货内容持续更新中…

  • 相关阅读:
    【JAVA EE】详解单点登录
    【JVM系列】- 类加载子系统与加载过程
    电脑C盘爆红怎么办?(小白篇)
    java学习part05
    Matlab:多变量数据
    jsp 前端传值,后端接受不到
    SpringBoot 1 SpringBoot 简介 1.1 SpringBoot 快速入门
    我的创作纪念日--不知不觉一周年了呐
    Vulnhub | DC: 7 |【实战】
    Checking out and building Chromium on Linux
  • 原文地址:https://blog.csdn.net/qq_42589613/article/details/127670839
  • 最新文章
  • 沪漂五周年了:我越来越迷茫了
    Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文
    MySQL-Seconds_behind_master的精度误差
    [MAF预定义ChatClient中间件-03]CachingChatClient——利用缓存省钱省时间
    AI的至暗历史:从万众期待到被政府撤资,AI的两次死亡徘徊
    Agent OS :五种驯服不确定性的范式
    PortSwigger SQL注入LAB11
    数据库即时编译JIT
    [Begin]AI Learn Data Day 0
    深度学习进阶(二十七)现代 LLM 的核心架构设计其二:SwiGLU
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号