[Python数据挖掘] sklearn-KMeans聚类

sklearn课堂之K-means算法的使用总结 1. 常用查询 1.1 Kmeans常用参数列表 常用参数 含义 n_clusters 要划分的簇数,可不填,默认8 init 默认‘kmeans++’ n_init 使用不同的质心随机初始化的种子来运行kmeans算法的次数,默认10 max_iter 最大迭代次数么,默认300 tol 两次迭代之间inertia的变化量,如果两次迭代之间inertia下降的值小于tol设定的值,迭代就会停止 precompute_distances ‘auto’,True,Fals 阅读详情

[问题背景]

假定有这样的数据集,txt格式,ANSI编码:

YZN,133,108,76
ZHY,96,145,101
WYZ,132,107,60
DHY,100,102,120
CYH,139,99,93
LHY,73,149,81
ZHY,85,148,93
TQP,39,138,85
ZZL,145,112,71
HJC,101,116,118
XZY,99,98,117

每行第一列是学生姓名,第二列是语文成绩,第三列是数学成绩,第四列是英语成绩。

目标是利用KMeans对学生进行聚类,例如聚成3类。

[问题分析]

数据预处理:

def loadData(filePath):
    fr = open(filePath, 'r+')
    lines = fr.readlines()
    retName = []
    retData = []
    for line in lines:
        items = line.strip().split(',')
        retName.append(items[0])
        retData.append([float(items[i]) for i in range(1,len(items))])
    return retName, retData

 编写loadData()函数,作用是传入grade.txt,传出两个列表:

Name = ['YZN', 'ZHY', 'WYZ', 'DHY', 'CYH', 'LHY', 'ZHY', 'TQP', 'ZZL', 'HJC', 'XZY']
Data = [[133.0, 108.0, 76.0], [96.0, 145.0, 101.0], [132.0, 107.0, 60.0], [10
Python数据挖掘课程】七.PCA降维操作及subplot子图绘制 这篇文章主要介绍四个知识点,也是我那节课讲课的内容。 1.PCA降维操作; 2.PythonSklearn的PCA扩展包; 3.Matplotlib的subplot函数绘制子图; 4.通过Kmeans对糖尿病数据集进行聚类,并绘制子图。 前文推荐,希望这篇文章对你有所帮助,尤其是我的学生和学习数据挖掘、机器学习、大数据的博友。 阅读详情

相关推荐

微信服务号配置总是提示“参数错误”?我就是这样一步步查出问题的

前两天,我遇到了一个很诡异的问题:在微信服务号后台配置服务器地址时,总是提示“参数错误,请重新填写”。

代码简单说 Vue、JAVA、PHP、Node.js 熟练运用,接口、架构、性能全搞定。 1233

机器学习实战:Python基于K均值K-means进行聚类(九)

K均值(K-means)是一种基于距离度量的聚类算法,其主要思想是将数据集划分为k个不同的簇,每个簇代表一个相似度较高的数据组。该算法通过迭代优化来最小化所有数据点与其所属簇的欧氏距离之和,从而找到最佳的簇划分。需要区分一下,K-means和KNN是两种不同的机器学习算法,K-means和KNN都是基于距离度量的算法,但前者用于聚类问题,而后者用于分类问题K-means是一种聚类算法,它旨在将数据集分成k个不同的簇,每个簇代表一个相似度较高的数据组。

Senoh的博客 5086

AI智能体丨使用Coze生成自媒体短视频分镜生成器(附保姆级教程)

【短视频分镜脚本生成器】是一款由Coze平台开发出来的智能体,可快速解析某音/某书视频或本地文件,自动生成专业分镜脚本。用户只需输入视频链接或上传文件,系统即会分析镜头节奏、叙事逻辑和画面内容,输出包含画面、模板和话术参考的标准化脚本(支持3分钟内视频)。该工具还能生成HTML网页和可下载图片,提供可视化呈现。工作流程包括视频解析、帧提取、AI画面理解、脚本生成和网页制作,大幅提升短视频创作效率。

李同学Lino的博客 1476

使用sk-learn库实现k-means算法对iris数据分类

使用sk-learn库实现k-means算法对iris数据分类

m0_60284144的博客 4733

使用Kmeans算法完成聚类任务

通过实际Demo例子介绍如何采用K-Means算法完成聚类任务

qiaotl的博客 2704

聚类分析-K-Means

K-Means算法也称为K-均值聚类算法,是一种广泛使用的聚类算法,也是其他聚类算法的基础 假定输入样本为S=X1,X2,…,Xm,则算法步骤为: 1, 选择初始的k个类别中心,例如k=2 2, 对于每个样本Xi,将其标记为距离类别中心最近的类别 3, 将每个类别中心更新为隶属该类别的所有样本的均值 4,重复第2步和第3步,直到类别中心的变化达到终止条件 终止条件一般有迭代次数,族中心变化率,最小...

weixin_43630413的博客 452

python sklearn教程_Python数据挖掘框架sklearn教程—KMeans聚类

聚类是一种重要的无监督学习算法,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集(subset),这样让在同一个子集中的成员对象都有相似的一些属性,常见的包括在坐标系中更加短的空间距离等。聚类算法有很多巧妙地用途,例如可以用聚类来发现噪音数据、用聚类来分离图像的前景和背景。本文介绍如何sklearn的K...

weixin_39984661的博客 395

(11)机器学习_Kmeans聚类算法

1、K_means介绍 K_means和K邻近算法类似,是一种基于距离的算法,是一种无监督学习,训练好的模型能够根据预测数据的特征与与训练集之间的‘距离’,对预测集进行分类。目前这是我浅显的了解,可能有更多的用处等待我去挖掘。 classsklearn.cluster.KMeans(nclusters=8,∗,init=′k−means++′,ninit=10,maxiter=300,tol=0.0001,precomputedistances=′deprecated′,verbose=0,randomst

xdg15294969271的博客 421

python写一段数据挖掘分析的代码

答:以下是一段使用Python进行数据挖掘分析的示例代码:import pandas as pd # 读取数据 df = pd.read_csv('data.csv') # 数据探索 print(df.head()) # 查看前5行数据 print(df.describe()) # 查看数值型数据的统计特性 # 数据预处理 df.fillna(0, inplace=True) # 缺失值填充 #...

weixin_42611177的博客 515

python简单实现KMeans

import numpy as np import matplotlib.pyplot as plt from sklearn.cluster import KMeans x=[[98,90], [87,95], [45,54], [67,77], [23,12], [34,45], [78,77], [90,89], [67,69], [3...

Smile 6139

大数据-215 数据挖掘 机器学习理论 - KMeans Python 实现 算法验证 sklearn cluster.cluster_centers_ inertia_...

点一下关注吧!!!非常感谢!!持续更新!!!目前已经更新到了:Hadoop(已更完)HDFS(已更完)MapReduce(已更完)Hive(已更完)Flume(已更完)Sqoop(已更完)Zookeeper(已更完)HBase(已更完)Redis (已更完)Kafka(已更完)Spark(已更完)Flink(已更完)Cli...

qq_35485206的博客 905

机器学习笔记

两个样本间的距离越小,说明它们之间越相似,越有可能聚成一个类群。相反,两个样本间的距离比较大,说明它们相差越大,越有可能隶属于不同的类群。通过聚类算法,即使在没有任何先验知识的情况下,基于样本的数据特征,把相似或相近的样本划分为一群,把差异较大或相远的样本划分到另一群,从而形成不同的“簇”Kmeans在进行类别划分过程中及最终结果,始终追求“簇内差异小, 簇间差异大”,一、K—means聚类分析:基于点与点之间的距离的相似度来计算最佳类别归属。n_cluster:k,告诉模型我们要分几类,默认8,必填;

m0_52484011的博客 143

大数据-215 sklearn KMeans 关键属性与评估:cluster_centers_、inertia_、轮廓系数选 K 实战

scikit-learn(sklearnKMeans(2026)解释三个最常用对象:cluster_centers_(聚类中心)、inertia_(簇内平方和/Within-Cluster Sum of Squares)以及聚类评估指标 silhouette_score / silhouette_samples(轮廓系数,范围 [-1, 1])。inertia_随簇数 K 增大通常单调下降,适合做“肘部法则”参考,但不具备可比上界且强依赖特征尺度与维度;因此在选 K 时,更工程化的做法是:对 K 进行网格

谢谢你的喜欢 我们一起无限进步 6233

Kmeans聚类算法实战

文章目录根据计科18大类学生的成绩数据(选取两个特征:1、平均成绩GPA; 2、面向对象程序设计成绩),将计科18大类学生分成 3~4个类型。将其可视化显示出来。然后,根据18级物联网分流名单,计算物联1801、物联1802两个班的学生的学生类型占比,输出物联18两个班的学生类型分布饼图。一、需要对所有学生的表进行kmeans聚类1、Excel文件2、代码如下所示(对于Excel文件最后几行无用的数据可以删除。我这里没有删除,我是在读取数据时没有读取最后几行)二、通过第二个表(分流名单)来确定学生类型1、分

missbearC的博客 3547

数据挖掘课程作业代码实现

一、课后习题2.4 1、求均值、中位数和标准差 age = [23, 23, 27, 27, 39, 41, 47, 49, 50, 52, 54, 54, 56, 57, 58, 58, 60, 61] fat = [9.5, 26.5, 7.8, 17.8, 31.4, 25.9, 27.4, 27.2, 31.2, 34.6, 42.5, 28.8, 33.4, 30.2, 34.1, 3...

qq_40438165的博客 3160

K-means聚类分析学生成绩 Python实现

声明:本人小白,文章作为自己的学习参考资料,供大家学习交流 本文refer to 作者:csuldw 链接:https://github.com/csuldw/MachineLearning/tree/master/Kmeans 来源:Github 感谢此文章原创者 如有侵犯您的知识产权和版权问题,请通知本人,本人会即时做出处理并删除文章 Email:louhergetup@gmail.co...

LouHerGetUp的博客 1万+

KMeans算法实现成绩的预测(并对一些数据进行可视化)

KMains算法的原理: 通过K-Main算法实现对成绩的预测,K-means算法是最为经典的基于划分的聚类方法,是十大经典数据挖掘算法之一。K-means算法的基本思想是:以空间中k个点为中心进行聚类,对最靠近他们的对象归类。通过迭代的方法,逐次更新各聚类中心的值,直至得到最好的聚类结果。 假设要把样本集分为k个类别,算法描述如下:   (1)适当选择k个类的初始中心,最初一般为随机选取;   (2)在每次迭代中,对任意一个样本,分别求其到k个中心的欧式距离,将该样本归到距离最短的中心所在的类;   (3

qq_44913716的博客 5698

数据挖掘代码实例学习——Pandas、sklearn数据预处理(包含pandas库以及所需依赖包安装教程)

无论是在数据挖掘还是机器学习当中,数据的好坏很大程度决定了最后训练出来的模型的预测和泛化能力的好坏。为了训练出质量更高的模型,通常我们都需要在训练之前对我们的数据集进行预处理。在文本领域主要使用pandas、numpy对数据进行预处理,在图像领域则使用opencv、numpy来处理,图像的预处理可以详见我之前的博客,今天我们将使用pandas来对文本数据进行预处理。数据预处理是机器学习和数据挖掘中非常重要的一个步骤,对原始数据进行相应的处理,可以为后续挖掘建模提供良好的数据基础。...

长弓同学的python学习笔记 5317

将学生列表写入文件python

""" 功能:将学生列表写入文件 作者: 日期: """ student1 = ('2021001','李晓红','女','20','2021软件4班','软件技术','人工智能与大数据学院','1594545780',) student2 = ('2021002', '王晓刚', '男', '18', '2021级软件4班', '软件技术', '人工智能与大数据学院','3890904567') student3 = ('2021003', '唐雨涵', '女', '19', '2021级软件4班',

dmzshyl1123的博客 1470

H3C-iNode-PC-7.3-E0630 inode最新全平台客户端 支持Windows和Mac和linux等

H3C_iNode_PC_7.3_E0630 inode最新全平台客户端 inode client H3C官网最新iNode PC 7.3 (E0630) 版本软件

上一篇: [Python数据处理] 怎样用Python预处理txt文档提取数据
下一篇: [C++] 必背模板(更新中)
swordtraveller
博客等级 码龄8年 122粉丝 77原创
评论 4
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值