机器学习 实验四

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
import numpy as np
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split, cross_val_score, KFold
from sklearn.tree import DecisionTreeClassifier
from sklearn.metrics import accuracy_score, precision_score, recall_score, f1_score
 
# 步骤(1):加载数据集并划分训练集和测试集
print("步骤(1):加载 iris 数据集,并使用留出法留出 1/3 的样本作为测试集")
iris = load_iris()
X, y = iris.data, iris.target
# 使用 stratify 参数保证训练集和测试集的类别分布一致
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=1/3, stratify=y, random_state=42)
print("数据集划分完成")
 
# 步骤(2):初始化带有预剪枝参数的决策树分类器
print("\n步骤(2):使用训练集训练 C4.5 算法,设置预剪枝参数")
clf = DecisionTreeClassifier(criterion='entropy', # 使用信息增益率进行特征选择
                             max_depth=None,      # 不限制最大深度,需通过交叉验证调整
                             min_samples_split=2, # 内部节点再划分所需最小样本数
                             min_samples_leaf=1,  # 叶子节点所需最小样本数
                             random_state=42)
 
# 步骤(3):使用五折交叉验证评估模型性能
print("\n步骤(3):使用五折交叉验证对模型性能进行评估")
kf = KFold(n_splits=5, shuffle=True, random_state=42)
cv_scores = cross_val_score(clf, X_train, y_train, cv=kf, scoring='accuracy')
print(f"交叉验证得分: {cv_scores}")
print(f"平均交叉验证得分: {np.mean(cv_scores)}")
 
# 训练模型
print("正在训练模型...")
clf.fit(X_train, y_train)
print("模型训练完成")
 
# 步骤(4):使用测试集测试模型性能
print("\n步骤(4):使用测试集测试模型性能,并分析结果")
y_pred = clf.predict(X_test)
 
# 性能评估
accuracy = accuracy_score(y_test, y_pred)
precision = precision_score(y_test, y_pred, average='weighted')
recall = recall_score(y_test, y_pred, average='weighted')
f1 = f1_score(y_test, y_pred, average='weighted')
 
print(f"准确度: {accuracy}")
print(f"精度: {precision}")
print(f"召回率: {recall}")
print(f"F1 值: {f1}")
 
# 注意事项:对于后剪枝,scikit-learn 的决策树并不直接支持。
# 我们可以通过网格搜索或随机搜索来寻找最优的 'max_depth' 或其他参数,
# 这样可以间接地实现后剪枝的效果。

  

posted @   财神给你送元宝  阅读(5)  评论(0编辑  收藏  举报
相关博文:
阅读排行:
· Manus重磅发布:全球首款通用AI代理技术深度解析与实战指南
· 被坑几百块钱后,我竟然真的恢复了删除的微信聊天记录!
· 没有Manus邀请码?试试免邀请码的MGX或者开源的OpenManus吧
· 园子的第一款AI主题卫衣上架——"HELLO! HOW CAN I ASSIST YOU TODAY
· 【自荐】一款简洁、开源的在线白板工具 Drawnix
点击右上角即可分享
微信分享提示