机器学习---概念整理
Log2 3=1.585
Log2 5=2.322
Log2 6=2.585
Log2 7=2.807
Log2 9=3.170
Log2 10=3.322
1.奥卡姆剃力原理:
如无必要,勿增实体(核心内容)
主张在解释现象时应选择假设最少的理论,强调用最简洁的方式把握事物本质。
2.半监督学习
监督学习:
机器在已标记训练样本学习,这意味着输入数据与期望的输出数据配对。机器随后学习如何为新的输入数据预测输出。监督学习通常用于分类、回归和目标检测等任务。
无监督学习:
机器在一组未标记的数据上进行训练,这意味着输入数据没有与期望输出配对。机器随后学习发现输入数据集中潜藏的结构或者规律。无监督学习常用于聚类、降维和异常检测等任务。
半监督学习:
半监督学习 = “少量标注 + 海量未标注”一起学。
是监督学习(全有标签)与无监督学习(全无标签)相结合,用无标签数据的“分布形状”来帮你把决策边界放在更对的位置的一种学习方法。
半监督学习的基本原则是通过大量无标记数据辅助少量已标记数据进行学习,从而提高学习效果。
聚类假设是什么,流行假设是什么

现存方法,优缺点

解决什么问题?
- 标注贵/难:医学影像、遥感、语音转写……请专家标很花钱。
- 数据多但没标:硬盘里一大堆原始图/文本/音频。
- 只靠小样本监督,容易过拟合、边界乱画。
3.决策树
原理
采用自顶向下的递归方法,以信息熵为度量构造一棵熵值下降最快的树,到叶子结点处的熵值为零,此时每个叶结点中的实例都属于同一类。决策树是一种树状结构的分类或回归模型,一 个决策树通过一系列特征划分将数据分为不同子集,最终输出一个预测结果
现存方法优缺点:
在机器学习方面的基本流程
(1)训练 ,从数据中获取知识进行学习
-利用训练集建立(并精化)一棵决策树 ,构建决策树模型。
(2)测试 ,利用生成的模型对输入数据进行分类
对测试样本, 从根结点依次测试记录的属性值, 直至到达某个叶结点,找到该样本所在的类别。
在构建决策树过程的基本流程
(1)选取一个属性作为决策树的根结点,然后就这个属性所有的取值创建树的分支。
(2)用这棵树来对训练数据集进行分类:
如果一个叶结点的所有实例都属于同一类 ,则以该类为标记标识此叶结点。
如果所有的叶结点都有类标记,则算法终止。
(3)否则,选取一个从该结点到根路径中没有出现过的属性作为标记标识该结点,然后就这个属性的所有取值继续创建树的分支;重复算法步骤2。
优缺点:
优点
直观易懂:树形结构可视化强,可直接解释分类逻辑。
无需预处理:不用标准化数据,能直接处理类别型和数值型属性。
高效快速:训练和预测的计算复杂度较低,适合中小规模数据。
缺点
易过拟合:树太深太复杂时,会过度贴合训练数据,泛化能力差。
不稳定:数据微小变动(如新增样本),可能导致树结构大幅变化。
有偏性:优先选择取值多的属性,对不平衡数据等不友好。
给样本计算信息增益(在比站上找样本)

第七节PPT第15张-第34张,算条件熵





信息增益


原理

用熵(数据的混乱程度)衡量:信息增益 = 划分前总熵 - 划分后各子集熵的加权和。

为什么是现成方法?
ID3 算法是决策树领域的开创性方法,理论成熟、逻辑直观,经过数十年验证,是后续决策树算法的基础
现存方法有哪些 ID3 决策树算法(最早的)
优缺点
优点:计算简单,能快速筛选出提升数据纯度的属性。适配低维度、属性取值分布均衡的数据,训练效率高。
缺点:严重偏向取值多的属性, 导致信息增益虚高,可能选择无实际分类意义的属性。易受噪声和小样本影响,间接加剧过拟合风险。
信息增益的缺陷是什么,改进点在哪里

信息增益率C4.5
原则:让样本以不同概率划分到不同的子结点去
原理
对信息增益的优化:信息增益率 = 信息增益 / 属性自身的熵。
为什么是现成方法?
C4.5 算法适用场景更广,是决策树算法的重要里程碑
现存方法有哪些
C4.5 算法:是学术和工业界经典的决策树算法,专门解决 ID3 的属性偏置问题。
优缺点
优点:纠正了信息增益的偏置,通过固有值 H (a) 归一化,更公平地选择属性,适合多属性分类场景。适配高维度、属性取值不均的数据
缺点:计算比信息增益复杂,可能偏向取值少的属性,极端场景下灵活性不足。
信息增益,信息增益率的他们之间对比,优缺点,改进点
| 对比维度 | 信息增益 | 信息增益率 |
| 核心用途 | ID3 算法属性选择 | C4.5 算法属性选择 |
| 核心偏好 | 取值多的属性 | 缓解偏好,更均衡 |
| 计算复杂度 | 低(仅需熵与条件熵) | 中(额外计算固有值) |
| 适配数据 | 低维度、属性取值均衡 | 高维度、属性取值不均 |
| 核心缺陷 | 易选无意义高取值属性 | 可能偏好低取值属性 |
核心改进点:引入 “固有值 H (a)” 做归一化,修正信息增益对高取值属性的偏好。
例:若属性 a 有 10 个取值,属性 b 有 2 个取值,即使 a 的信息增益略高,但其 H (a) 更大,可能导致信息增益率低于 b,避免误选 a。
基尼指数CART
原理
直接衡量数据的 “不纯度”:基尼指数越小,数据越纯(样本越集中于同一类别)。
为什么是现成方法?
CART 算法支持二叉树划分,计算效率高。且能同时处理分类和回归任务,是工业界的首选决策树算法。
现存方法有哪些
CART 决策树算法(分类与回归树),是目前工业界应用最广的决策树算法
优缺点
优点:计算速度比熵快,适合大规模数据,对二叉树划分友好,稳定性强。
缺点:对数据分布的敏感度低于熵,对不平衡数据的区分度稍弱。
剪枝:
原理
决策树的 “瘦身” 操作:剪掉对模型泛化能力无帮助的分支,避免过拟合
为什么是现成方法?
决策树天生容易过拟合,剪枝是解决该问题的核心手段
| 预剪枝 | 后剪枝 | |
| 现存方法有哪些 | 决策树生成过程中,预剪枝通过设定停止条件来提前终止树的生长,避免产生冗余分支。常见的停止条件包括限制树的最大深度、规定叶节点所需的最少样本数等。 | 先利用训练集充分拟合生成决策树,然后自底向上对非叶结点进行分析,若将该结点对应子树替换为叶结点能提升模型泛化性能,则将该子树替换为叶结点 |
| 优点 | 1.降低过拟合风险,2.计算效率高 显著减少决策树的训练时间和测试时间的开销 | 1.更好的泛化能力:测试所有分支,比预剪枝保留了更多分支,降低欠拟合。2.灵活性高,效果好 |
| 缺点 | 可能会导致欠拟合:过早停止可能会错失一些重要的分支,导致模型未能充分学习数据的复杂模式 | 计算机成本高:需要在完整的决策树上进行剪枝操作,决策树的训练时间开销要高于其他。 |
4.支持向量机SVM
基于最大化分类间隔的监督学习的模型,广泛用于分类任务
怎么解决问题
找一条 “最宽的分类边界”,稳健区分不同类别
线性可分数据:直接找能分开两类的 “最优直线 / 平面”,要求离这条边界最近的样本到边界的距离最大
线性不可分数据:允许少量样本 “压线”,平衡 “尽量分对” 和 “马路尽量宽”,避免模型过度贴合训练数据

为什么引入核函数
核函数是 SVM 解决非线性分类问题的核心手段,基于核技巧,本质是 通过隐式隐射,将用低维空间中不可分的数据转换到高维空间中的工具,使其在高维空间中线性可分。
现实难题:很多数据不是直线能分开的,低维空间难找分类边界。
高维思路:把低维数据 “映射到高维”,比如把二维环形数据拉到三维,就能用一个平面分开。但直接去高维计算,计算量会爆炸。
核函数的作用:不用真的把数据拉到高维,在低维就能算出高维的分类效果,既解决了非线性分类,又省了大量计算量。
核函数的优缺点
优点
规避维数灾难,大幅降低计算复杂度;
无需知晓具体映射函数ϕ(x),简化实操;
适配非线性分类问题,显著提升模型表达能力。
缺点
参数选择依赖经验,无统一标准;
对噪声敏感,易因异常值影响分类精度;
样本量大时,核矩阵计算开销随样本数平方增长;
不同核函数适配场景有限。
核密度估计KDE:
是一种非参数方法,用于估计数据的概率密度函数。
干什么用的
基于核函数,以一定的带宽参数,通过对每个数据点附近的核函数进行加权平均来估计数据点的概率密度,即根据有限的数据样本对总体进行推断
优缺点
优:适合各种形状的概率密度函数,假设少,更好反映实际情况
缺:高维效果下降和对带宽敏感
应用场景
广泛应用于数据可视化、异常检测和聚类分析
支持向量机的应用场景
- 高维数据分类(如文本分类,无需降维即可处理几万维数据);
- 非线性分类(如异或问题、环形分布数据等线性不可分场景);
- 小样本场景(样本量少仍能保持较好泛化能力);
- 函数拟合(可推广到回归任务,拟合数据规律)。
线性可分支持向量机(计算)SVM
算间隔
基本原理
在特征空间中找到一个最大间隔超平面的监督学习模型,使超平面两侧空白区域最大化,从而实现最优分类
W,b什么含义,
w:超平面的法向量,决定超平面在特征空间中的方向(法向量朝向哪一类样本,由标签定义决定);
b:超平面的位移,决定超平面在特征空间中的位置(平行移动)。
怎么调整,
W 和 b 仅由支持向量(离超平面最近的样本点)决定,调整目标是保持 “支持向量到超平面的距离相等且最大”

怎么优化这个平面
本质是最大化间隔,转化为凸二次规划问题,保证唯一解
间隔 = 两类支持向量到超平面的距离之和
5 集成学习
什么是Boosting算法 串行化方法
模型按顺序训练,每个新模型专门纠正前一个的错误,最后加权融合提升性能。

什么是Bagging算法 并行化方法
利用自助法采样可构造T个含m个训练样本的采样集,基于每个采样集训练出一个基学习器并进行结合, 最后投票/平均结果降低误差。


| Boosting | Bagging | |
| 优点 | 准确率高,擅长挖掘复杂数据规律。降低偏差 | 抗过拟合,训练快(并行),调参简单。 |
| 缺点 | 对噪声敏感,训练慢(串行),调参复杂。 | 准确率上限低于 Boosting,对复杂数据拟合能力弱 |
| 通过什么方法提高性能 | 聚焦前序模型的错误样本 对表现好的模型赋予更高权重 用正则化避免过拟合 | 随机抽样生成多样化训练集 多模型融合抵消单个模型误差 随机选择特征增加模型多样性 |
| 与集成学习器关系 | 串行(后依赖前) 通过 “迭代补漏” 实现弱学习器的强集成。 | 并行(独立训练) 通过 “独立投票” 实现强学习器的稳健集成。 |
| 目标 | 降低偏差 多为弱分类器(准确率略高于随机猜测) | 降低方差 多为强分类器(如未剪枝决策树) |
| 数据采样 | 根据权重调整 | 随机有放回抽样 |
| 组合方法 | 加权求和 性能越好权重越高。 | 平均/投票 分类任务用投票法,回归任务用平均法 |
Adaboost算法 是重赋权法
通过迭代训练弱分类器并加权集成,来构建一个强分类器

优缺点:
优点:
理论基础扎实,泛化能力强:不容易过拟合,实现简单:算法逻辑清晰,适应性强:可与多种弱学习器结合,无需调参:主要参数可自动确定。可解释性好
缺点
对噪声敏感,性能依赖弱学习器 ,训练时间长,内存消耗大,难以并行化
随机森林算法RF 是重采样法
以决策树为基学习器,训练过程引入随机属性选择

优缺点:
优点
算法简单、容易实现、计算开销小,性能强大

Basting与随机森林算法的区别,为什么更好

6.聚类
什么是聚类
无监督学习,无需标签,对未知类别的样本集根据样本之间的相似程度分类,自动分组。
k-均值聚类原理:
基于原型的、划分式 聚类方法。
K均值聚类算法通过将数据点划分为K个簇,使得同一簇内的点相似度尽可能高,而不同簇之间的相似度尽可能低。
K-均值算法的聚类准则:聚类中心的选择,应使准则函数 J 极小。
算法的核心是最小化样本点到最近聚类中心的距离。
k值是什么
人工指定的聚类类别数。聚类中心的个数(每个点指派到最近的质心)
作用
决定分类粗细,k 越大分越细;直接影响聚类结果是否合理。
优缺点:
优点:
算法简单易懂,收敛速度快,适用于大规模数据集,实现方便。
缺点:
需要预先指定K值,对初始值敏感,可能导致局部最优,且对噪声和异常值敏感。
解决的问题(应用场合)
数据挖掘、数据分析、异常检测、模式识别、金融风控、智能营销等领域
肘部法则-k_means
是一种用于确定在k均值聚类算法中使用的质心数(k)的技术,通过绘制不同K值下模型的误差(损失函数)与K值的关系曲线,找到曲线上的”肘部”点(簇内误差平方和SSE 下降幅度突然大幅减小),即最佳的K值。
优缺点
优点:简单易用,直观可视化,选合适的k值就可提高模型性能
缺点:不够自动化,计算开销大,主观性依赖于观察者经验和感觉
怎么衡量聚类好坏
核心是聚类准则,评估聚类结果是否满足 “簇内样本相似、簇间样本差异” 的优化目标
衡量方法
阈值准则:依据距离阈值判断:设定一个距离标准,若样本间距离小于阈值则归为一类,大于则分在不同类
函数准则:用准则函数度量聚类质量:计算 “每个样本到其所在簇中心的距离平方和”,该值越小,说明簇内样本越紧凑,聚类效果越好
需要定义准则函数(常用的准则函数是误差平方和准则)
什么指标
一种常用的指标是误差(距离)平方和。
可结合距离类的相似性测度(如样本间距离)辅助判断。
密度聚类算法DBSCAN
具有噪声的基于密度的聚类方法,通过识别数据空间中的高密度区域来进行聚类。
点的密度取决于指定的半径
基于密度的聚类通常用于类别不规则、类别间相互缠绕或数据存在噪音及错误的情况
核心对象:
核心点、边界点、噪声点。基于 “指定半径(ε)” 和 “最小点数(MinPts)” 的密度规则划分
核心点
定义:在半径ε内,至少包含MinPts个点(包括自己)
特征:密度足够高,可以作为簇的”种子”
判断条件:|N_ε(p)| ≥ MinPts
边界点
定义:不是核心点,但在某个核心点的邻域内
特征:位于簇的边缘,密度较低
判断条件:|N_ε(p)| < MinPts 且在某核心点的ε邻域内
噪声点
定义:既不是核心点,也不是边界点
特征:孤立点或离群点
判断条件:不满足核心点和边界点条件
“高密度区域关联” 的三大核心密度关系
密度直达,密度可达,密度相连
密度直达
点p从点q密度直达 ⟺
1. p ∈ N_ε(q) (p在q的邻域内)
2. q是核心点
密度可达
点p从点q密度可达 ⟺
存在点序列 p₁, p₂, ..., pₙ,使得:
p₁ = q, pₙ = p
pᵢ₊₁从pᵢ密度直达 (i=1,...,n-1)
可视化示例:
q → p₁ → p₂ → p₃ → p
(核心) (核心) (核心) (核心) (可能是边界点)
密度相连
点p和点q密度相连 ⟺
存在核心点o,使得p和q都从o密度可达
可视化示例:
o (核心点)
/ \
/ \
p q
p和q都从o密度可达,因此p和q密度相连
聚类的分类
| 1.良好分隔的聚类 | 任意一个点与类内距离比该点与类外的距离更近 |
| 2.基于中心的聚类 | 类内点与该类中心点距离小于该点与类外点距离 |
| 3.相互贴近的聚类 | 类内任意1点与一或多点在类内比在类外近 |
| 4.基于密度的聚类 | 一类别是一高密度点区域,区分高低密度 |
| 5.基于性质或概念的聚类 | 一些共同的属性或表示一个特殊的概念 |
| 6.基于目标函数的聚类 | 最小化或最大化 |
层次聚类法(分裂式、凝聚式)
有依赖关系的聚类,后一聚类依赖前一聚类结果,一组聚类就形成一个树状结构
凝聚式(自底向上)
初始将每个样本视为独立簇,通过最小类间距逐步合并直至终止条件
分裂式(自顶向下)
从全体样本整体出发,通过最远样本分割迭代生成子簇
7.数据降维
PCA是什么 主成分分析
通过对原始特征进行线性组合,构建一组新的不相关特征(即主成分)。本质上是通过正交变换将数据映射到新的坐标系中,从而实现降维,同时尽可能保留原始数据中的信息。
使得降维后样本的方差尽可能大,使得降维后数据的均方误差尽可能小
PCA的求解步骤:
数据中心化:对原始数据进行标准化处理,使得每个特征的均值为0,方差为1。
协方差矩阵计算:计算数据的协方差矩阵,反应相关性。
特征值与特征向量求解:分解特征值,求解协方差矩阵的特征值与特征向量。
选择主成分:根据特征值的大小,选择前K个最大特征向量对应的特征向量作为新低维空间的坐标轴
数据投影:将数据投影到这些坐标轴的空间中,得到较为后的数据。

PCA与LDA的优缺点区别
| 优缺点 | PCA | LDA |
| 特点 | 通过正交变换实现降维,保留最大方差方向的信息 | 通过最大化类间距离与最小化类内方差实现降维 |
| 应用场景 | 高维数据降维,存在相关性 | 分类任务中的特征提取,人脸识别 |
| 优点 | 无监督(无需样本标签),适用范围广, 易于实现; 降维效果显著:保留重要信息 计算效率高:适用于大规模数据的降维任务。 | 有监督(利用类别标签),降维后不同类别区分度高; 分类效果好:优化 “类间距离大、类内方差小”,更适配分类需求。 解释性强:有物理意义 |
| 缺点 | 对于非线性数据效果较差。 对方差较小维度易信息丢失 对噪声敏感,可能导致降维不佳。 | 计算复杂度高 有类别数限制(至少保留一个维度来区分不同的类别。) |

8.dropout是什么
正则化技术,训练时随机 “关闭” 部分神经元,测试时恢复所有神经元并调整权重。
干什么用的 防止模型过拟合,同时增强模型泛化能力
优缺点:
优点:实现简单,无需复杂计算;有效减少神经元间的依赖;提升模型泛化能力。
缺点:

用来解决什么问题
解决深度学习模型过拟合问题,尤其适用于网络较深、参数过多的场景(如深度神经网络、CNN),避免模型过度贴合训练数据的噪声。
9贝叶斯分类器
通过计算后验概率进行分类,基于贝叶斯定理和条件概率理论
计算贝叶斯公式(b站)



怎么求先验概率,后验概率,类别








贝叶斯分类器对比表
| 朴素贝叶斯NB | 半朴素贝叶SNB | 贝叶斯网BN | |
| 命名原因 | 给定类别后特征独立 假设不符合现实 | 折中,在NB基础上允许少量依赖 | 用有向无环图(DAG)任意依赖 |
| 原理 | 计算每个类别的 “先验概率 × 特征条件概率乘积”,取分数最高的类别 | 加入少量依赖特征的条件概率,乘积后选最优类别。 | 图结构分解联合概率,结合CPT 推断后验概率,选最优类别 |
| 优缺点 | 结构最简单:仅类别指向所有特征, 训练 / 推断复杂度低,数据需求小,高维稀疏数据友好。 | 结构中等:类别 + 少量特征间依赖。 训练 / 推断复杂度中等,比朴素贝叶斯更准,且避免了复杂计算。 | 结构最灵活:可刻画任意依赖。 表达力最强,但训练 / 推断复杂度高,需更多数据。 |


10.怎么划分训练集和测试集
训练集和测试集的划分方法包括:
留出法:将数据集直接划分为互斥的训练集和测试集,通常按比例7:3或8:2(训练集占比大)进行划分。
K折交叉验证法:将数据集划分为k个大小相似的互斥子集, k-1个子集作为训练集,剩下的一个作为测试集,可进行k次——多次实验求平均值。
自助法:通过有放回地随机抽样的方法生成训练集和测试集,适用于样本量较小的情况。
分层抽样:在留出法基础上,保持训练 / 测试集的类别与原数据一致,防偏差
时间顺序划分:在时间序列数据中,按照时间顺序划分数据集,确保训练集包含早期数据,测试集包含后期数据。
11 概率图模型
马尔可夫网与贝叶斯网的优缺点
| 贝叶斯网BN | 马尔可夫网MRF | ||
| 原理 | 用有向无环图表示变量间依赖关系 | 使用无向图表示变量间的相关关系 | |
| 图结构 | 有向无环图(DAG),有因果指向 | 无向图,无因果约束,仅表示相关关系 | |
| 概率分解 | 基于条件概率(父节点→子节点) | 基于极大团势函数 | |
| 独立性假设 | 局部有向依赖(子节点仅依赖父节点) | 全局无向分离(分离集给定则变量独立) | |
| 参数形式 | 条件概率表(CPT),易解释 | 势函数(如指数函数),无直接概率意义 | |
| 关键问题 | 需保证无环,避免循环依赖 | 规范化因子 | |
| 优点 | 结构直观灵活,可体现变量间因果关系。 适合建模有明确依赖顺序的场景,支持因果推理。 表达力强,可解释 | 无向结构灵活,可处理循环依赖、对称关联,无需因果假设。 灵活刻画变量间的复杂相关性,适合高维度。 | |
| 缺点 | 严格要求无环,无法处理循环依赖关系。 高维变量场景下,条件概率表参数规模爆炸。 需要更多数据,但训练推断复杂度高 | 无因果解释,参数(势函数)可解释性差。 需遍历所有变量组合,计算复杂度高。学习和推断效率低于贝叶斯网。 | |
| 应用场景 | 计算机视觉:图像分割、目标检测。 自然语言处理:词性标注、命名实体识别 推荐系统:用户 - 物品偏好关联建模 | 因果推理场景:医疗诊断、故障检测。 序列建模场景:语音识别自然语言生成。 无监督学习场景:LDA 话题模型。 | |
什么是EM算法(最大期望算法)
提供一种近似计算含有隐变量概率模的型极大似然估计的方法,常用估计参数隐变量方法。是一种迭代式方法,能收敛到局部最优解。
优缺点:
优点:
它能保证可能性的增加,并且在E步和M步通常比较简单的情况下非常有效
缺点:
运行速度慢,只能保证收敛到局部最优,计算开销大
解决什么问题
各种含有隐变量的概率参数模型的最大似然估计或极大后验概率估计的优化问题
在存在隐变量的情况下,对概率模型参数进行估计
应用场景
在聚类、计算机视觉、混合模型拟合等领域。适用于处理那些模型参数难以直接估计的情况,如HMM
什么是隐马尔可夫模型HMM
将状态序列称为隐含状态
是一种统计分析模型,用来描述一个含有隐含未知参数的马尔可夫过程。其难点是从可观察的参数中确定该过程的隐含参数。然后利用这些参数来作进一步的分析
优缺点
优点
处理序列数据,适用于许多实际应用场景。
具有数学理论基础,有严格的数学推导和算法支持。
可以通过参数学习来自动学习模型,无需手动设计。
缺点
假设输出只依赖于当前状态,无法处理长期依赖关系。
对初始状态概率和状态转移概率的选择敏感,需要充分的训练数据和调参。
解决什么问题
主要用于时序数据建模。在生物信息科学、故障诊断,语音识别、自然语言处理等领域有广泛应用
12神经网络
通过输入层,隐藏层和输出层连接,模拟生物神经元的激发过程
如何模拟人脑工作:
输入数据经过每层的加权求和和非线性激活函数,最终输出预测结果
卷积神经网络
CNN是一种基于卷积操作构建的神经网络,特别适合处理图像等二维数据。
操作(CNN核心组成部分):卷积,激活与池化等操作逐层提取数据的高层特征
优缺点:
优势:
避免了梯度爆炸和梯度消失问题
简化计算过程,降低过拟合
特增提取能力增强
缺点:
计算复杂度大
全局信息提取困难
池化层易信息损失
内部黑盒特性,难理解
比如什么是卷积:权值共享+局部感受野
卷积层从输入图像或视频中提取特征
什么是池化, 信息压缩与特征增强
池化层对卷积层的输出进行下采样
卷积神经网络(CNN)中的核心操作,通过滑动固定窗口,对卷积层输出的特征图做局部聚合运算,在保留关键特征的同时压缩特征图尺寸。
分为哪几种,
最大池化:取窗口内特征值的最大值,能保留局部最关键的特征(边缘、纹理)。
平均池化:取窗口内特征值的平均值作为输出,结果更平滑,但易丢失部分细节。
作用是什么。
- 减少参数数量与计算量,降低过拟合风险;
- 提升模型对特征的尺度变化、平移的 “不变性”(图像中轻微移位仍能识别);
- 提炼关键特征,为后续层传递更精炼的信息。
什么是没有免费午餐定理NFL定理
对所有可能函数的相互补偿,最优化算法的性能是等价的。
没有一个学习算法可以在任何领域总是产生最准确的学习器。不管采用何种学习算法,至少存在一个目标函数,能够使得随机猜测算法是更好的算法
没有一种算法(包括神经网络)在所有机器学习问题上都最优,某算法在一类问题上的优势,必然以另一类问题上的劣势为代价
13大模型下的挑战
(1)机器学习的各种方法,还有一些定理(没有免费午餐定理,奥卡姆剃刀原理,偏差方差等)对现在出现的大模型领域有什么启发,内涵,新挑战
没有单一算法能通吃所有问题(NFL定理),如果有两个模型性能一致,应该选择更简单的模型(奥卡姆剃刀),并正视方差与偏差对性能的影响;大模型通过这些定理,实现了跨领域通用性与能力密度的指数提升,但也带来了训练稳定性、隐私泄露等新型挑战。
启发与内涵
NFL定理提醒:脱离具体问题谈“xx算法最好”没有意义,小模型在特定领域内往往表现更好,不存在万能模型。在大模型选型与设计时,必须结合具体任务特性选择合适的模型。不能盲目追求单一的强大模型,而是要根据不同的应用场景选择最合适的小模型。
奥卡姆剃刀与集成学习的张力:同等性能下应选更简单的模型以减少过拟合风险。但集成学习(如随机森林等)通过组合多个弱模型提升性能,看似与奥卡姆剃刀矛盾,但其出发点是单个弱模型性能不足,因此,在大模型的设计中,如何平衡模型规模与效率成为一个新的挑战。
偏差-方差权衡:大模型的出现打破了传统的偏差-方差权衡关系。当模型参数规模超临界值后,模型能够展现出零样本学习等新兴能力,使偏差和方差的关系非线性。这种变化带来了新的研究方向,即如何进一步优化大模型的性能,同时控制其复杂度和潜在的风险。
新挑战
训练稳定性:
大模型训练过程不稳定,需要确保模型在大规模数据集上的稳定收敛。
隐私泄露:
模型可能吸收敏感信息导致隐私泄露,需保护用户隐私。
计算资源消耗:
训练和部署大模型需要大量计算资源,如何降低成本成为关键。
模型压缩与加速:
提高模型推理速度并降低模型大小是重要技术难题。
可解释性与透明度:
提高模型可解释性,增强用户信任是未来重点。
综上所述,大模型的发展既带来了前所未有的机遇,也伴随着一系列新的挑战。通过对现有理论的深入理解,并结合技术创新,我们可以更好地应对这些挑战,推动人工智能技术的进步。
14计算学习理论
是干什么的
把“机器学习能不能学、要多少数据、花不花得起算力、学了能不能在新数据上不翻车”这四件事,说清楚、算清楚。
一些概念
样例集:分类器:泛化误差,经验误差,重要性质

什么是概念,目标概念,概念类

什么是假设空间:

15 强化学习
支持向量回归(SVR)
控制间隔带的宽度
-贪心,Softmax原理,优缺点,干什么用的


16 偏差与方差
| 在机器学习中 | 偏差 | 方差 |
| 干什么用的 | 衡量模型预测值与真实值的偏离程度,反映模型的拟合能力 | 衡量模型在不同训练集上预测结果的波动程度,反映模型的稳定性 |
| 他俩的定义原理 | 原理:模型对数据拟合不足(欠拟合)会导致高偏差 | 原理:模型对训练数据噪声过度拟合(过拟合)会导致高方差 |
| 如何平衡两者 | 提升模型复杂度(如增加网络层数、扩展特征)、优化模型结构 | 降低模型复杂度(如正则化、剪枝)、增加数据量、使用集成学习(如 Bagging) |
| 对模型作用 | 高偏差→模型欠拟合(训练 / 测试误差均高),无法捕捉数据规律 | 高方差→模型过拟合(训练误差低、测试误差高),泛化能力差 |
| 解决什么问题 | 解决 “模型欠拟合” 问题,让模型能够充分学习数据的真实规律,减少预测与真实值的系统性偏离 | 解决 “模型过拟合” 问题,让模型在新数据 / 不同训练集上的预测更稳定,提升泛化能力,避免被训练数据的噪声干扰 |
17线性模型
分为回归与分类
线性回归:
定义为

- 目的:构建线性模型以其尽可能准确地输出实值标记
线性分类
用于离散输出
它通过将输入数据映射到不同的类别来进行学习,通常使用逻辑回归等算法来实现。
两者的本质区别在于损失函数的形式和输出的性质,回归是对真实值的逼近,而分类则是对类别的确定。
18支持向量回归模型(SVR)
是一种适用于中小规模非线性回归问题的机器学习方法
原理定义
基于支持向量机(SVM)的思想,旨在通过寻找最优超平面来预测连续型变量。在特征空间中找到一个超平面,使得样本点尽可能地位于该超平面附近,并且在容忍范围内允许一定的误差。从而平衡模型复杂度与泛化能力。
优缺点
优点:
非线性能力强,可以处理复杂的非线性回归问题。
模型泛化能力强,具有较好的预测能力。
可以处理高维数据,避免了维度灾难问题。
缺点:
对大规模数据集计算复杂度高,训练时间较长。
参数调节敏感,样本噪声较大下导致模型性能的显著下降。
可解释性弱
应用场景
金融预测:股票、汇率、信用评分
工程建模:负载预测、故障诊断
生物医学:疾病预测、基因表达分析
文件:
更多推荐






所有评论(0)