机器学习基础
931 字约 3 分钟
domain/aiai/foundations
2026-07-24
1. 核心结论
- 机器学习是让计算机从数据中自动学习规律,而非通过显式编程完成任务
- 三大学习范式:监督学习(有标签)、无监督学习(无标签)、强化学习(奖励信号)
- 模型性能取决于数据质量、特征工程、算法选择和超参数调优
- 过拟合和欠拟合是机器学习中最核心的问题,需要通过正则化、交叉验证等手段解决
- 机器学习是深度学习的基础,理解 ML 原理有助于更好地使用 AI 模型
2. 基础概念
特征(Feature):输入数据的属性或变量,模型基于特征进行预测。
标签(Label):监督学习中需要预测的目标值。
训练集/验证集/测试集:用于模型训练、调参和最终评估的数据划分。
损失函数(Loss Function):衡量模型预测值与真实值之间差距的函数。
梯度下降(Gradient Descent):通过计算损失函数的梯度来更新模型参数的优化算法。
过拟合(Overfitting):模型在训练集上表现好但在测试集上表现差,泛化能力弱。
欠拟合(Underfitting):模型过于简单,无法捕捉数据中的规律。
3. 工作原理
机器学习的基本流程:
- 问题定义:明确是分类、回归、聚类还是其他任务
- 数据准备:收集、清洗、标注数据,进行特征工程
- 模型选择:根据任务类型选择合适的算法
- 模型训练:使用训练数据优化模型参数
- 模型评估:在验证集/测试集上评估性能指标
- 模型部署:将模型应用于生产环境
- 持续监控:监控模型性能,定期重新训练
常用算法:
- 线性回归/逻辑回归:简单高效,适合基线模型
- 决策树/随机森林:可解释性强,处理非线性关系
- 支持向量机(SVM):高维空间表现优秀
- K近邻(KNN):简单直观,适合小规模数据
- 神经网络:强大表达能力,深度学习的基础
4. 实战场景
- 推荐系统:用户行为预测、商品推荐
- 风控系统:欺诈检测、信用评分
- 医疗诊断:疾病预测、影像分析
- 工业质检:缺陷检测、异常识别
- 营销预测:客户流失预测、转化率预估
- 自然语言处理:文本分类、情感分析
5. 常见误区
- 数据泄露:训练时使用了测试集信息,导致评估结果虚高
- 忽视数据分布:训练数据和生产数据分布不一致
- 过度追求复杂模型:简单模型往往足够,复杂模型增加维护成本
- 不处理类别不平衡:导致模型偏向多数类
- 忽略特征工程:好的特征比复杂的算法更重要
6. 进阶方向
- 集成学习(Boosting、Bagging、Stacking)
- 贝叶斯机器学习
- 在线学习与增量学习
- 自动机器学习(AutoML)
- 可解释机器学习(SHAP、LIME)
- 联邦学习与隐私保护
7. 推荐资料
- Scikit-learn Documentation - https://scikit-learn.org/stable/
- Machine Learning Crash Course (Google) - https://developers.google.com/machine-learning/crash-course
- Elements of Statistical Learning - https://hastie.su.domains/ElemStatLearn/
- Hands-On Machine Learning with Scikit-Learn - https://github.com/ageron/handson-ml3
- Fast.ai Practical Deep Learning - https://course.fast.ai/