机器学习1.5 kmeans-最优参数模型的Dataframe+提取误差平方和tol最小一行的信息+折线图

2023-08-28 04:29:01

文章目录

- - 基操：准备数据，准备模型，查看属性
  - 最优参数模型（画出迭代的Dataframe）
  - 在Dataframe里面找到最优的tol（误差平方和），以及该行的其他参数（innertia，n_clusters,max_iter）
  - 画出折线图
  - 全文代码
  - 手写笔记
  - 复习代码精简版

基操：准备数据，准备模型，查看属性

在这里插入图片描述

import pandas as pd 
from sklearn.cluster import KMeans 1、准备数据集data=pd.read_csv(r'basketball.csv') #data=pd.read_csv('basketball.csv')也可以
data.head()data.shape2、Kmeans聚类KMeans?#KMeans？可以看到默认参数# 1.准备模型
km = KMeans(n_clusters=8, max_iter=300, tol=0.0001)#默认值不写也可以# 2.训练模型
km.fit(data)3、查看属性# 1.质心
km.cluster_centers_# 2.属于哪个簇
km.labels_# 3.误差平方和
km.inertia_

最优参数模型（画出迭代的Dataframe）

在这里插入图片描述

import pandas as pd 
from sklearn.cluster import KMeans 1、准备数据集data=pd.read_csv(r'basketball.csv') #data=pd.read_csv('basketball.csv')也可以
data.head()data.shape2、Kmeans聚类KMeans?#KMeans？可以看到默认参数df=pd.DataFrame(columns=["i","j","tol","差平方和"])df.loc[0,:]=(1,2,3,4)dfcluster = [2, 3, 4]
km_iter = [300, 350, ..]
tol?for i in cluster:for j in km_iter:for m in tol:km = KMeans(n_clusters=i, max_iter=j, tol=m)km.fit(data)km.inertia_# 1.准备模型
km = KMeans(n_clusters=8, max_iter=300, tol=0.0001)#默认值不写也可以# 2.训练模型
km.fit(data)3、查看属性# 1.质心
km.cluster_centers_# 2.属于哪个簇
km.labels_# 3.误差平方和
km.inertia_#### 最优模型km = KMeans(n_clusters=8, max_iter=300, tol=0.0001)tol_lst=[m*0.1*1e-4 for m in range(2,10,1)]
tol_lst#cluster = list(range(2,10,1))
#cluster#list(range(300,601,50))result=[]
for n_clusters in range(2,10,1): #k的个数取2 3 4 5 6 7 8 9 for max_iter in range(300,601,50): #最大迭代步骤取300 350 400 。。。600for tol in range(2,10): #误差取2到9，下面乘以10^-5tol=tol*1e-5km=KMeans(n_clusters=n_clusters,max_iter=max_iter,tol=tol*1e-5) km.fit(data)d={'n_clusters':n_clusters,'max_iter':max_iter,'tol':tol,'inertia':km.inertia_}result.append(d)resultpd.DataFrame(result)#转换成Dataframe更直观

在Dataframe里面找到最优的tol（误差平方和），以及该行的其他参数（innertia，n_clusters,max_iter）

在这里插入图片描述

1，找到Dataframe里inertia这一列中的最小值：argmin（）

result_df('inertia').argmin()

在这里插入图片描述
返回395，也就是说第395行（索引标号）的inertia最小

2,用.iloc[ , ]根据索引标号找出所需的那一行(,前面是行索引，后面是列索引，不要列用：表示)

result_df.iloc[result_df('inertia').argmin(),:]

在这里插入图片描述
3，一行数据就是一个series,可以使用type()查看数据类型

r = result_df.iloc[result_df('inertia').argmin(),:]
type(r)

在这里插入图片描述
4,返回值的代码

n_clusters = r['n_clusters']
n_clusters

在这里插入图片描述

画出折线图

1，保存n_clusters、误差平方和，先建立两个列表

x = []#放k值n_cluster
y = []#放误差平方和inertia

2,循环打印出k=[2,20), 用for XXX in range( , ):
（注：5000条数据以下一般不超过10个簇，5000以上不超过20个）

for n_clusters in range(2,20):print(n_clusters)

在这里插入图片描述
3,准备模型（公式）
km=KMeans(三个参数n_clusters，max_iter，tol)
km.fit(数据集)

km=KMeans(n_clusters=n_clusters,max_iter=max_iter,tol=tol)
km.fit(data)

4，保存生成的数据，inertia（簇内误差平方和）和k个数（n_clusters）
用.appen()

x.append(n_clusters)
y.append(km.inertia_)#inertia是属性，要写成km.inertia_

在这里插入图片描述

5,运行报错，调整字符类型 float–>int
在这里插入图片描述
max_inter是float类型，而kmeans要求是int，所以在前面强制转换max_inter

max_iter = int(r['max_iter'])
max_iter

在这里插入图片描述
成功运行，打印出x,y

6,需要作图，在第一行添加from matplotlib import pyplot as plt

创建一张画布

plt.figure(figsize(20,8),dpi=100)

创建x,y轴、标签以及题目

plt.plot(x,y)
plt.xlabel('k')
plt.ylabel('inertia')
plt.title('k-inertia relation')

效果
在这里插入图片描述
在图上标注点和数据 :用zip（，）把x,y值组合成坐标（x,y）
调整坐标文本显示位置:round(b,2)是保留两位小数，ha和va控制水平垂直

for a,b in zip(x,y):
plt.text(a,b,round(b,2),ha='center',va='bottom')

在这里插入图片描述

全文代码

在这里插入图片描述

import pandas as pd
from sklearn.cluster import KMeans
from matplotlib import pyplot as plt1、准备数据集data = pd.read_csv(r'basketball.csv')
data.head()data.shape2、Kmeans聚类# 1.准备模型
km = KMeans(n_clusters=8, max_iter=300, tol=0.0001)# 2.训练模型
km.fit(data)3、查看属性# 1.质心
km.cluster_centers_# 2.属于哪个簇
km.labels_data# 3.误差平方和
km.inertia_4、最优模型result = []
for n_clusters in range(2,10):for max_iter in  range(300,601,50):for tol in range(2,10):tol=tol*1e-5km = KMeans(n_clusters=n_clusters, max_iter=max_iter, tol=tol)km.fit(data)d = {'n_clusters':n_clusters, 'max_iter':max_iter, 'tol':tol, 'inertia': km.inertia_}result.append(d)resultresult_df = pd.DataFrame(result)result_df找到误差平方和最小，对应的模型参数r = result_df.iloc[result_df['inertia'].argmin(), :]
type(r)#iloc[]是利用索引切片只留下想要的行和列 参考：https://www.py.cn/faq/python/18973.html
#argmin（）是找到当前行或列的最小值 此时最小为0.160880下标为447，就转换为r = result_df.iloc[[447], :]rn_clusters = r['n_clusters']
n_clustersmax_iter = int(r['max_iter'])
max_itertol = r['tol']
tol选择合适的K值data.head()data.shapex = []
y = []
for n_clusters in range(2,20):print(n_clusters)km = KMeans(n_clusters=n_clusters, max_iter=max_iter, tol=tol)km.fit(data)# 保存n_clusters、误差平方和x.append(n_clusters)y.append(km.inertia_)xy用n_clusters（k）作为横坐标，误差平方和作为中坐标---折线图（最优k）plt.figure(figsize=(20, 8), dpi=100)
plt.plot(x, y)
plt.xlabel('K')
plt.ylabel('inertia')
plt.title('k-inertia relation')
# 将数字标注到折线图中
for a, b in zip(x, y):plt.text(a, b, round(b, 2), ha='center', va='bottom')

手写笔记

在这里插入图片描述

复习代码精简版

在这里插入图片描述

本文来自互联网用户投稿，文章观点仅代表作者本人，不代表本站立场，不承担相关法律责任。如若转载，请注明出处。 如若内容造成侵权/违法违规/事实不符，请点击【内容举报】进行投诉反馈！

标签：技术

上一篇 > 学习笔记之——基于matlab的数字通信系统（4）
下一篇 > 【惯性导航与组合定位技术相关岗位问题总结】

Duilib中list控件支持ctrl和shif多行选中的实现

[ICML2015]Batch Normalization:Accelerating Deep Network Training by Reducing Internal Covariate Shif

win10系统微软输入法于eclipse ctrl+shif+f冲突间接处理办法

Codeforces Round #259 (Div. 2) B. Little Pony and Sort by Shif

读LDD3，内存映射与DMA--PAGE_SHIF…

VMware虚拟机安装XP【要先分区，再设置BOOT 启动CD，shif+上移】

更换iBus五笔的左与右Shif

sublime ctrl+shif+f 没用解决办法

idea 对 ctrl + z 的撤销是 ctrl + shif + z

计算机最早的设计师应用于,计算机应用基础选择题doc.doc

win10自带截图神器：Win+Shift+S

Python基础之文件目录操作

python简述目录_Python基础之文件目录操作(示例代码)

tp5 如何做数据采集

任务2-7(服务器字体+阿里巴巴矢量库)

html标签（1)：h1~h6,p,br,pre,hr

TI 电量计介绍与芯片选型指南

几款TI电源芯片简介

TI DSP芯片C2000系列读取FLASH数据

德州仪器(Ti)平台嵌入式开发基础

TI三相电机智能栅极驱动芯片特点分类

省选模拟（12.08） T3 圈圈圈圈圈圈圈圈

Hadoop生态圈技术栈（上）

大数据开发基础入门与项目实战（三）Hadoop核心及生态圈技术栈之6.Impala交互式查询

小猿圈之Linux下Mysql 操作命令

大数据Hadoop生态圈常用面试题

大数据开发基础入门与项目实战（三）Hadoop核心及生态圈技术栈之4.Hive DDL、DQL和数据操作

备战Noip2018模拟赛11（B组）T3 Monogatari 物语

【智能优化算法-圆圈搜索算法】基于圆圈搜索算法Circle Search Algorithm求解单目标优化问题附matlab代码

NYOJ 78 圈水池

递归问题跑道汽车绕圈问题 Python实现

Hadoop生态圈（三）：MapReduce

机器学习1.5 kmeans-最优参数模型的Dataframe+提取误差平方和tol最小一行的信息+折线图

文章目录

基操：准备数据，准备模型，查看属性

最优参数模型（画出迭代的Dataframe）

在Dataframe里面找到最优的tol（误差平方和），以及该行的其他参数（innertia，n_clusters,max_iter）

画出折线图

全文代码

手写笔记

复习代码精简版

相关文章