线性回归和逻辑回归笔记 一、线性回归算法用于连续值预测1. 算法基础概述核心作用构建特征与连续目标值的线性加权关系完成回归预测房价、销量、温度等连续变量。核心假设输入特征与输出目标满足线性相关。预测模型公式\(yx_{1} w_{1}x_{2} w_{2}...x_{n} w_{n}b\) \(w_1...w_n\)特征权重b偏置项\(x_1...x_n\)输入特征y预测输出。4.损失函数均方误差 MSE衡量预测值与真实值整体误差目标最小化该损失\(loss \frac{1}{N} \sum_{i1}^{N}\left(y_{i}-\hat{y}_{i}\right)^{2}\) N样本总数\(y_i\)真实标签\(\hat{y}_i\)模型预测值。2. 两种参数求解方法1普通最小二乘法解析解无迭代直接矩阵运算一次性求出最优权重数据量过大时矩阵求逆计算慢\(W ( X ^ { T } X ) ^ { - 1 } X ^ { T } y\) X特征矩阵y真实标签向量W最终权重 偏置参数。2梯度下降法迭代优化工业主流通过多次迭代沿损失梯度反方向更新权重适配大数据、深度学习场景\(w.data - lr * w.grad\) lr学习率\(w.grad\)损失对权重的梯度每次迭代小幅更新参数降低损失。3. 线性回归实战完整流程标准步骤加载回归数据集如波士顿房价划分训练集、测试集特征标准化消除量纲影响最小二乘 / 梯度下降训练线性模型使用 MSE、MAE、RMSE 评估回归效果二、逻辑回归算法二分类模型输出概率1. 算法基础概述定位名称带 “回归”实际是二分类算法输出样本属于正类的概率 \(P(y1 | x)\)。核心逻辑在线性回归输出基础上套 Sigmoid 激活函数把值域\((-\infty,\infty)\)压缩到\([0,1]\)区间代表概率。分步公式 第一步线性组合同线性回归\(zxwb\) 第二步Sigmoid 映射为概率\(\sigma(z)\frac{1}{1e^{-z}}\)2. 损失函数二元交叉熵损失专门适配分类概率预测解决 MSE 在分类场景梯度消失问题\(loss -\frac{1}{N} \sum_{i1}^{N}\left[y_{i} log \hat{y}_{i}\left(1-y_{i}\right) log \left(1-\hat{y}_{i}\right)\right]\) \(y_i\)真实标签只能取 0/1\(\hat{y}_i\)模型输出 0~1 之间概率。3. 参数优化与模型评估参数更新统一使用梯度下降更新公式和线性回归一致\(w.data - lr * w.grad\)2.分类四大评估指标Accuracy 准确率整体预测正确样本占比Precision 精准率预测为正的样本中真实正样本比例Recall 召回率全部真实正样本中被预测出来的比例F1-Score精准率与召回率调和平均平衡二者4. 逻辑回归实战标准完整流程加载二分类数据集乳腺癌数据集划分训练 / 测试集特征标准化距离类、线性分类模型必备训练逻辑回归模型预测概率设定 0.5 阈值区分 0/1 类别计算准确率、精准率、召回率、F1 评估效果三、工程 统计学知识点模块 1方差计算核心注意事项除数不能为 0标准差计算时加极小值防止除零报错sigma 1e-9总体方差 vs 样本方差核心区分类型分母用途工具默认行为总体方差N数据包含全部研究对象仅描述当前数据NumPynp.var()默认ddof0有偏估计样本方差(N-1)用抽样样本估算整体总体方差无偏校正PyTorchtensor.var()默认ddof1无偏估计底层逻辑机器学习属于统计实验依靠样本数据特征推断整体数据分布样本均值是无偏估计样本方差必须除以\(N-1\)消除自由度偏差。Python 代码示例import numpy as np # 总体方差除以N data np.array([1,2,3,4,5]) var_pop np.var(data, ddof0) # 样本无偏方差除以N-1 var_sample np.var(data, ddof1) # 防止标准差为0 std np.std(data) 1e-9模块 2模型持久化序列化 / 反序列化概念定义序列化内存中训练完成的模型对象 → 二进制字节流保存到本地硬盘文件反序列化硬盘模型文件读取 → 内存可直接预测的模型对象Python 工具对比pickle底层原生库使用繁琐大模型效率一般joblibsklearn 配套上层工具对数值矩阵模型优化更好推荐机器学习模型保存joblib 代码示例import joblib from sklearn.linear_model import LinearRegression # 训练模型 model LinearRegression() model.fit(X_train, y_train) # 序列化保存 joblib.dump(model, linear_model.pkl) # 反序列化加载 loaded_model joblib.load(linear_model.pkl)模块 3概率映射激活函数区分Sigmoid 函数适配二分类输出单个 0~1 概率对应逻辑回归Softmax 函数适配多分类输出多个概率总和为 1用于多分类任务模块 4激活函数基础Sigmoid 是最基础的激活函数核心作用将线性输出转换为概率值域是逻辑回归、早期神经网络的基础组件。四、线性回归 vs 逻辑回归核心对比总结任务场景线性回归回归任务预测连续数值逻辑回归二分类任务输出类别概率输出值域线性回归\((-\infty,\infty)\) 任意实数逻辑回归\([0,1]\) 概率值Sigmoid 压缩损失函数线性回归均方误差 MSE逻辑回归二元交叉熵损失评估指标线性回归MAE、MSE、RMSE逻辑回归准确率、精准率、召回率、F1-Score共同点都采用线性加权模型参数都用梯度下降优化训练前均需要特征标准化。