人工智能数据分布

8月第一天


问题:什么是数据分布?


前言

问自己:

源自一个心血来潮质问自己的探索:数据分布是什么?怎么确定你的数据是哪种分布类型?人工智能研究的数据,大多数是哪种类型的分布?为什么?


建军节:

在这里插入图片描述

一、数据分布?

描述数据取值的概率规律,由分布函数或概率密度函数定义。

想象你有一大袋子各种颜色的糖豆。数据分布就是描述:

哪种颜色的糖豆最多?(主要聚集在哪里?峰值在哪?)

糖豆颜色是均匀分布的,还是某些颜色特别多,某些特别少?(对称性、偏斜度)

极端颜色(比如非常罕见的荧光色)出现的可能性有多大?(尾巴的厚度)

颜色范围是从浅粉到深红都有一点,还是主要集中在几个颜色上?(离散还是连续?集中还是分散?)
简单说,数据分布就是告诉你,你的数据(糖豆颜色)喜欢怎么取值,以及取不同值的可能性有多大。

二、 怎么确定数据是哪种类型的分布?

没有绝对单一的方法,通常是多种手段结合

  1. 可视化观察 (最直观):

    • 直方图 (Histogram) + 密度图 (Density Plot): 这是第一步!把数据画出来。看它的形状:

      • 像对称的钟? -> 高斯分布 (正态分布)。
      • 拖着长长的右尾巴? -> 右偏分布 (如对数正态分布、指数分布、幂律分布)。
      • 拖着长长的左尾巴? -> 左偏分布。
      • 像矩形一样平? -> 均匀分布。
      • 集中在几个离散的点上? -> 离散分布 (如二项分布、泊松分布)。
    • Q-Q图 (Quantile-Quantile Plot): 把你的数据分位数和理论分布(如正态分布)的分位数画在散点图上。如果点大致落在一条对角线上,说明你的数据很可能符合那个理论分布。这是检验正态性的常用工具。

    • 箱线图 (Box Plot): 看中位数、四分位数、异常值。能快速了解对称性、偏度、尾部厚度和异常值情况。

  2. 计算统计特征 (量化指标):

    • 均值 (Mean): 数据的平均值。
    • 中位数 (Median): 数据排序后中间的值。均值 vs 中位数能判断偏斜:
      • 均值 ≈ 中位数 -> 可能对称(如正态)。
      • 均值 ≈ 中位数 -> 可能对称(如正态)。
      • 均值 > 中位数 -> 右偏(长尾在右)。
      • 均值 < 中位数 -> 左偏(长尾在左)。
    • 标准差 (Standard Deviation) / 方差 (Variance): 衡量数据围绕均值的离散程度。非常大可能意味着长尾或重尾。
    • 偏度 (Skewness): 量化分布的不对称性。0表示对称,>0表示右偏,<0表示左偏。
    • 峰度 (Kurtosis): 量化分布的“峰态”和尾部厚度。3(有时以0为基准)表示正态峰度,>3(或>0)表示尖峰厚尾,❤️(或<0)表示平峰薄尾。
  3. 统计假设检验 (更严谨):

    • 目的: 用数学方法检验“数据是否显著偏离某个理论分布”的假设。
    • 常见检验:夏皮罗-威尔克检验 (Shapiro-Wilk Test) / Kolmogorov-Smirnov 检验 (K-S Test): 常用于检验正态性。如果 p值 > 0.05 (通常的显著性水平),则不能拒绝数据来自正态分布的原假设(但也不等于证明是正态!)。
    • 安德森-达令检验 (Anderson-Darling Test): 对尾部更敏感的检验,也常用于正态性检验。
    • 其他分布也有对应的检验(如卡方检验检验离散分布)。
  4. 领域知识与背景:数据是什么?怎么产生的?物理规律、社会规律、业务流程常常暗示了分布类型:

    • 测量误差 -> 高斯分布 (中心极限定理)。
    • 设备寿命、等待时间 -> 指数分布。
    • 稀有事件发生次数(单位时间内)-> 泊松分布。
    • 财富分配、城市规模、网络连接数 -> 幂律分布/长尾分布。
    • 完全随机抽样 -> 均匀分布。

总结确定流程: 先画图看形状 -> 计算均值、中位数、偏度、峰度等指标 -> 结合数据来源背景猜测可能的分布 -> 用统计检验验证猜测 -> 最终确定或选择最合适的近似分布。

2.人工智能研究的数据,大多数遵循什么类型的分布?为什么?

  • 主导分布:高斯分布 (正态分布)

  • 为什么?核心原因:中心极限定理 (Central Limit Theorem, CLT)

通俗版中心极限定理:
想象一个现象是由很多很多微小的、相互独立的随机因素叠加影响的结果(不管这些因素本身是什么分布)。那么,这个现象最终表现出来的结果(数据),其分布会非常接近高斯分布
(正态分布)。

AI数据为什么符合这个条件?

数据来源复杂: AI模型处理的数据(图像像素、音频波形、文本中的词频、传感器读数、用户行为特征等)极少是由单一因素决定的。它们通常是大量微小、独立(或弱相关) 因素的叠加组合。

图像像素: 由物体反射光 + 环境光 + 传感器噪声 + 量化误差 + … 组成。

自然语言中的词频: 受作者习惯 + 主题 + 语境 + 文化背景 + … 影响。

用户点击行为: 受兴趣 + 时间 + 位置 + 界面设计 + 网络状况 + … 影响。

模型输入/特征的构造: 很多特征本身就是对原始数据的计算或统计(如平均值、总和、主成分),这些计算过程本身也倾向于产生高斯分布的结果(再次体现CLT)。

算法友好性: 高斯分布具有极其优良的数学性质(仅由均值和方差决定、最大熵、大量成熟的理论和算法如最小二乘法、卡尔曼滤波、高斯过程等都基于它)。这使得建模、计算、推导都相对简单高效。即使数据不完全正态,也常常可以通过变换(如对数变换)或假设其近似正态来利用这些强大的工具。

噪声建模: 数据中的噪声(测量噪声、环境噪声)通常被建模为高斯噪声,因为它是对许多未知微小干扰的合理近似。

其他重要的非高斯分布:

  1. 幂律分布/长尾分布:

    • 场景: 社交网络(少数大V拥有海量粉丝)、推荐系统(热门商品点击量巨大,大量冷门商品点击极少)、自然语言(高频词极少,低频词海量)、财富分配。

    • 原因: “富者愈富”的马太效应、网络效应、偏好依附机制。AI在处理这类数据时需要特别注意(如冷启动问题、处理不平衡数据)。

  2. 类别分布 (Categorical Distribution):

    • 场景: 图像分类标签、用户选择的商品类别、文本中的单词类型。数据点是离散的类别。
  3. 泊松分布 (Poisson Distribution):

    • 场景: 单位时间内到达网站的请求数、呼叫中心的来电数、放射性衰变事件计数。

    • 原因: 描述固定时间/空间间隔内随机事件发生次数。

  4. 指数分布 (Exponential Distribution):

    • 场景: 设备的故障间隔时间、用户的访问间隔时间、放射性衰变粒子的寿命。

    • 原因: 描述随机事件之间的等待时间,常与泊松分布相关联(泊松描述次数,指数描述间隔)。

总结

好像明白了一丢丢:
虽然高斯分布在AI中无处不在且地位核心(尤其在基础建模和噪声处理),但AI研究者必须清醒地认识到非高斯分布(尤其是幂律分布和类别分布)的普遍存在,并选择或设计合适的模型(如处理类别数据的Softmax、处理计数数据的泊松回归、处理长尾数据的特定采样或损失函数)来应对。

关键点梳理

  • 数据分布描述数据取值规律。

  • 确定分布靠看图(直方图、Q-Q图)、算指标(均值、中位数、偏度、峰度)、做检验(K-S、S-W)、结合背景知识。

  • AI数据最常用高斯分布(中心极限定理:大量微小独立因素叠加),但幂律分布(长尾效应)和类别分布(离散标签)也极其重要。

  • 独立意味着一个变量不影响另一个变量的概率。分布独立意味着联合分布等于边缘分布的乘积。

  • 不独立(相依/相关) 意味着变量间存在关联,知道一个能提供另一个的信息。协方差/相关系数为0是独立的必要条件而非充分条件。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐