sklearn调包侠之逻辑回归-阿里云开发者社区

sklearn调包侠之逻辑回归

2018-07-05 3103

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介： 本系列教程为《机器学习实战》的读书笔记。首先，讲讲写本系列教程的原因：第一，《机器学习实战》的代码由Python2编写，有些代码在Python3上运行已会报错，本教程基于Python3进行代码的修订；第二：之前看了一些机器学习的书籍，没有进行记录，很快就忘记掉了，通过编写教程也是一种复习的过程；第三，机器学习相对于爬虫和数据分析而言，学习难度更大，希望通过本系列文字教程，让读者在学习机器学习的路上少走弯路。

本系列教程为《机器学习实战》的读书笔记。首先，讲讲写本系列教程的原因：

第一，《机器学习实战》的代码由Python2编写，有些代码在Python3上运行已会报错，本教程基于Python3进行代码的修订.

第二：之前看了一些机器学习的书籍，没有进行记录，很快就忘记掉了，通过编写教程也是一种复习的过程.

第三，机器学习相对于爬虫和数据分析而言，学习难度更大，希望通过本系列文字教程，让读者在学习机器学习的路上少走弯路。

算法原理

传送门：机器学习实战之Logistic回归（https://www.jianshu.com/p/96566542b07a）

正则化

这里补充下正则化的知识。当一个模型太复杂时，就容易过拟合，解决的办法是减少输入特征的个数，或者获取更多的训练样本。正则化也是用来解决模型过拟合的一种方法。常用的有L1和L2范数做为正则化项。

L1范数 L1范数作为正则化项，会让模型参数θ稀疏话，就是让模型参数向量里为0的元素尽量多。L1就是在成本函数后加入:

L2范数而L2范数作为正则化项，则是让模型参数尽量小，但不会为0，即尽量让每个特征对预测值都有一些小的贡献。L2就是在成本函数后加入:

实战——乳腺癌检测

数据导入

本次实战依旧是使用sklearn中的数据集，如图所示。

from sklearn.datasets import load_breast_cancer
cancer = load_breast_cancer()
print(cancer.DESCR)

切分数据集

X = cancer.data
y = cancer.target

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state

模型训练与评估

逻辑回归算法使用sklearn.linear_model 模块中的LogisticRegression方法。常用的参数如下：

penalty：设置正则化项，其取值为'l1'或'l2'，默认为'l2'。

C：正则化强度，C越大，权重越小。

from sklearn.linear_model import LogisticRegression

model = LogisticRegression()
model.fit(X_train, y_train)
model.score(X_test, y_test)

# result
# 0.94736842105263153

我们换为L1范数：

model2 = LogisticRegression(penalty='l1')
   model2.fit(X_train, y_train)
   model2.score(X_test, y_test)

   # result
   # 0.95614035087719296

这里查看模型的参数，发现确实有很多特征的参数为0。

原文发布时间为：2018-07-04
本文作者：罗罗攀
本文来自云栖社区合作伙伴“Python爱好者社区”，了解相关信息可以关注“Python爱好者社区”

sklearn调包侠之逻辑回归

Python爱好者

热门文章

最新文章

相关课程

相关电子书