📑 查看全课大纲(第 1 / 20 节)
- 1.多元统计分析概述与多元正态分布
- 2.多元数据矩阵与向量化运算
- 3.统计数据探索与高维数据清洗
- 4.样品与变量相似性度量(距离与相似系数)
- 5.系统聚类与K均值聚类算法原理
- 6.聚类分析代码实战与谱系图绘制
- 7.距离判别法理论推导与应用
- 8.贝叶斯判别与Fisher线性判别
- 9.判别分析代码实战与误判率评估
- 10.主成分分析推导、几何意义与统计性质
- 11.主成分回归与共线性消除
- 12.主成分分析代码实战与降维可视化
- 13.因子分析正交模型与因子载荷求解
- 14.因子正交旋转(方差最大化)与因子得分计算
- 15.因子分析代码实战与行业综合评价
- 16.列联表分析与卡方独立性检验
- 17.对应分析理论推导与过渡图原理
- 18.对应分析代码实战与双标图解读
- 19.典型相关变量数学推导与显著性检验
- 20.典型相关系数阵计算与代码实战
多元统计分析概述与多元正态分布
约 48 分钟
多元统计分析概述
小象实战讲义 · 多元统计分析
欢迎来到《多元统计分析》的第一讲。本节我们将开启多元统计世界的大门,系统了解这门学科为何存在、它是什么、包含哪些核心方法,以及在实际中能解决哪些复杂问题。学完本节,你将建立起对多元统计的整体认知框架,理解其与一元统计的本质区别,并明确本课程的学习路径与实战工具。
💡 核心导读
- 多元数据的普遍性:现实世界中的研究对象(如企业、学生、城市)通常需要多个指标才能全面刻画,多元统计正是为此而生。
- 从一元到多元的跃迁:多元统计不是多个一元分析的简单叠加,而是研究多个随机变量之间相互依赖关系与内在统计规律的学科。
- 方法体系概览:核心方法包括降维(主成分、因子、对应分析)、分类与判别(聚类、判别分析)、变量关系研究(回归、典型相关)以及预测决策。
- 强大的应用性:多数方法有明确的分布或协方差结构假设(如正态性、等协方差、协方差阵正定等),假设不满足时需谨慎选择方法;这些方法在自然科学、社会科学、商业等众多领域有广泛应用。
- 现代化实战工具:本课程将使用 Python 及其强大的科学计算生态(scikit-learn, SciPy, statsmodels 等)进行所有方法的实战演示与验证。
一、为何需要多元统计分析?
统计学是一门基于数据的方法论学科。多元统计学的存在,根本原因在于多元数据在现实世界中的广泛存在。
例如:
- 评估一个国家的国际竞争力,需要从企业管理、经济实力、国际化、政府作用、金融环境、基础设施、科技水平、国民素质等多个维度(每个维度又包含若干指标)进行综合考察。
- 科学认识一个企业,需要了解其规模、产量、产值、利润、员工数、所属地区等多方面信息。
- 考察一名中学生的学习情况,需要测量其在政治、语文、外语、数学、物理等多个科目的成绩。
这些数据都不是单一的,而是由多个变量(指标)共同构成的多元数据。面对复杂的多元数据,我们的目标是分析和认识其内在规律,把握系统本质,将隐没在海量数据中的重要信息提取出来,并清晰地展示其系统结构。利用统计学和数学方法对多维复杂数据集合进行科学分析的理论与方法,就是多元统计分析的基本研究内容。
二、多元统计分析是什么?
用一句话概括:多元统计分析是运用数理统计的方法来研究多变量问题的理论和方法,它是一元统计学的推广。
为了深入理解这一定义,我们通过一个具体案例来对比一元与多元分析的差异。
案例:学生成绩分析
假设我们记录了10名学生在政治、语文、外语、数学、物理五门科目上的成绩(如下表所示)。
| 序号 | 政治 | 语文 | 外语 | 数学 | 物理 |
|---|---|---|---|---|---|
| 1 | 99 | 94 | 93 | 100 | 100 |
| 2 | 99 | 88 | 96 | 99 | 97 |
| 3 | 100 | 98 | 81 | 96 | 100 |
| 4 | 93 | 88 | 88 | 99 | 96 |
| 5 | 100 | 91 | 72 | 96 | 78 |
| 6 | 90 | 78 | 82 | 75 | 97 |
| 7 | 75 | 73 | 88 | 97 | 89 |
| 8 | 93 | 84 | 83 | 68 | 88 |
| 9 | 87 | 73 | 60 | 76 | 84 |
| 10 | 95 | 82 | 90 | 62 | 39 |
一元统计分析的局限:如果采用一元统计方法,每次只分析一门课程的成绩(例如,只分析数学成绩的均值、方差),我们会忽视课程之间可能存在的相关性。例如,数学好的学生物理成绩往往也不错,这种内在联系在一元分析中被割裂了。这导致信息利用不充分,分析结果难以客观全面地反映学生的整体学习情况。
多元统计分析的优势:运用多元统计方法,可以同时对多门课程的成绩进行分析,充分利用变量间的信息。
- 综合指标:可以用各科成绩的总和作为综合指标,来比较学生学习成绩的整体好坏。
- 分类:可以根据各科成绩的相近程度对学生进行分类(如总成绩好/差,或文科成绩好/理科成绩好)。
- 关系研究:可以研究各科成绩之间的关系(如物理与数学成绩的正相关关系,文科成绩与理科成绩可能存在的负相关关系)。
核心结论:一元统计分析研究一个随机变量的统计规律;而多元统计分析研究多个随机变量之间的相互依赖关系以及内在的统计规律。多元分析并非将变量孤立看待,而是综合考量所有变量,挖掘其背后更丰富、更深层次的信息。
下面,我们通过一个简单的 Python 示例,快速感受一下如何生成并描述一个多元数据集(模拟多元正态分布数据),并计算其基本的多元统计量。
"""
实战演示:多元正态分布数据的生成与描述性统计
我们将生成一个三维(p=3)的多元正态分布样本,并计算其样本均值、协方差矩阵、相关系数、特征值以及马氏距离。
"""
import numpy as np
import scipy.stats as stats
from scipy.spatial.distance import mahalanobis
# 固定随机种子,确保结果可复现
np.random.seed(42)
# 定义多元正态分布的参数:均值向量 mu 和协方差矩阵 Sigma
n = 100 # 样本量
p = 3 # 变量维数
mu_true = np.array([2.0, 5.0, -1.0]) # 真实均值向量
cov_true = np.array([ # 真实协方差矩阵(对称正定)
[2.0, 0.8, -0.5],
[0.8, 1.5, 0.3],
[-0.5, 0.3, 1.0]
])
# 生成 n 个来自该多元正态分布的随机样本
X = np.random.multivariate_normal(mu_true, cov_true, size=n)
# 计算样本统计量
sample_mean = np.mean(X, axis=0) # 样本均值向量
sample_cov = np.cov(X, rowvar=False) # 样本协方差矩阵 (p x p)
sample_corr = np.corrcoef(X, rowvar=False) # 样本相关系数矩阵
# 计算样本协方差矩阵的逆,用于马氏距离计算
inv_cov = np.linalg.inv(sample_cov)
# 计算前5个样本点到样本中心(均值)的马氏距离
maha_dists = [mahalanobis(X[i], sample_mean, inv_cov) for i in range(5)]
# 计算样本协方差矩阵的特征值,以验证其正定性
eigenvals = np.linalg.eigvalsh(sample_cov)
is_positive_definite = bool(np.all(eigenvals > 0))
# 打印计算结果
print("样本均值向量: ", np.round(sample_mean, 4).tolist())
print("样本方差 (对角线): ", np.round(np.diag(sample_cov), 4).tolist())
print("样本相关系数 (X1 与 X2): ", round(sample_corr[0, 1], 4))
print("样本协方差矩阵特征值: ", np.round(eigenvals, 4).tolist())
print("样本协方差矩阵是否正定: ", is_positive_definite)
print("前5个样本点的马氏距离: ", [round(d, 4) for d in maha_dists])运行结果:
样本均值向量: [1.8363, 5.0347, -0.7861]
样本方差 (对角线): [1.5479, 1.0601, 1.0892]
样本相关系数 (X1 与 X2): 0.3187
样本协方差矩阵特征值: [0.4789, 1.412, 1.8064]
样本协方差矩阵是否正定: True
前5个样本点的马氏距离: [0.7726, 1.7368, 2.0962, 0.7606, 2.5622]结果解读:
- 样本均值向量接近我们设定的真实均值
[2.0, 5.0, -1.0]。 - 样本协方差矩阵的对角线元素(方差)与设定值接近。
- 变量
X1与X2的样本相关系数为0.3187,反映了它们之间的正相关关系。 - 样本协方差矩阵的所有特征值均为正,表明其是正定矩阵,这是进行许多多元统计分析(如计算马氏距离)的前提。
- 马氏距离考虑了变量间的相关性,是度量多元数据点与数据中心相对位置的更佳指标。
三、多元统计分析包含哪些方法?
多元统计分析拥有一个丰富的方法工具箱,主要处理以下几类核心问题:
1. 简化数据结构(降维问题)
当变量过多、数据维度很高时,会出现“维数灾难”,增加计算复杂度和模型过拟合风险。降维的目标是通过变量变换,将相互依赖的变量变为互不相关,或将高维数据投影到低维空间,在信息损失最小的前提下简化问题。
- 核心方法:主成分分析 (PCA)、因子分析、对应分析 (CA)。
- 案例:
- 主成分分析:美国统计学家斯通 (1947) 利用美国1929-1938年的数据,得到17个国民经济变量。通过PCA,他仅用3个互不相关的新变量(可解释为总收入、总收入变化率、经济发展趋势)就保留了原数据97.4%的信息。
- 因子分析:学生的高考各科成绩可能受阅读能力、抽象能力、记忆能力和努力程度等少数几个潜在公共因子影响。因子分析就是从可观测的多元数据中提取这些公共因子。
- 对应分析:分析1992年美国大选数据,将选民的最高学历与支持的总统候选人信息投射到同一张低维图上,可以直观发现“高学历选民更倾向于支持克林顿”等关联模式。
2. 分类与判别(归类问题)
根据研究对象的相似程度,对其进行分类或判断其所属类别。
- 核心方法:聚类分析、判别分析。
- 案例:
- 聚类分析:根据GDP、人口、人均收入、教育水平等多个经济指标,将中国的城市分类为一线、二线、三线城市。
- 判别分析:银行根据客户的年龄、收入、职业、信用历史等多元信息,建立模型判断新客户未来违约的风险,以决定是否发放信用卡。
- 市场细分:依据消费者的需求、购买行为和习惯等特征差异,将整个市场划分为若干个具有类似需求的消费者群体。
3. 变量间的相互联系
研究变量之间的依赖或相关关系。
- 核心方法:多元回归分析、典型相关分析 (CCA)。
- 案例:
- 多元回归分析:分析产品销量如何依赖于广告投入、价格水平、促销力度等多个自变量,建立定量预测模型。
- 典型相关分析:研究证券市场走势(股票指数、市值等变量组)与宏观经济状况(GDP增长率、物价指数、失业率等变量组)这两组变量之间的整体相关关系。
4. 预测与决策
基于历史数据建立的统计模型或最优准则,对未来进行预测或做出判断。
- 核心方法:多元回归、判别分析、聚类分析等均可用于预测与决策。
- 案例:利用上市公司历史的财务数据(多元变量),构建模型来预测其未来是否会发生财务危机。
四、多元统计分析能干什么?—— 广泛的应用领域
多元统计的生命力在于其强大的应用性。但凡存在多元数据的地方,几乎都可以用到多元统计分析。
- 教育学:通过多门课程成绩评估学生能力、对学生进行分类。
- 医学:综合病人的多项症状(体温、血压、化验指标等)进行疾病诊断。
- 气象学:基于前一日的气温、气压、湿度等多变量预测次日降雨量。
- 环境科学:根据多个监测点的多种污染物浓度数据,对区域污染程度进行分类。
- 经济学:依据人均收入、消费水平等多指标判断国家的经济发展类型。
- 商业与金融:市场细分、客户信用评级、风险管理。
- 其他:服装尺码定型、体育科研、心理学、生物学等诸多领域。
五、实战工具:Python 现代化数据科学栈
本课程强调实战,将使用 Python 及其强大的科学计算库来实现所有多元统计方法,替代原课程中的 R 语言,以适应当前数据科学的主流技术栈。
我们将主要依赖以下库:
- 数值计算与数组操作:
numpy - 科学计算与统计检验:
scipy.stats,scipy.spatial.distance - 机器学习与降维:
scikit-learn(包含 PCA, LDA, 聚类, 回归等) - 计量经济与统计模型:
statsmodels - 专门因子分析工具:
factor_analyzer - 可视化:
matplotlib,seaborn
📝 动手练一练
练习1:概念辨析 一元统计分析与多元统计分析最根本的区别是什么? A. 分析的变量数量不同 B. 使用的数学工具不同 C. 研究变量间的相互依赖关系与内在规律 D. 应用领域不同
练习2:方法匹配 请将以下问题与最可能用到的多元统计方法连线:
- 根据客户的消费记录将客户分成不同群体。
- 从30个财务指标中提取出3个核心因子来评价公司健康状况。
- 判断一封邮件属于“垃圾邮件”还是“正常邮件”。
- 研究广告投入、价格、季节因素对产品销量的综合影响。
方法:A. 聚类分析 B. 因子分析 C. 判别分析 D. 多元回归分析
参考答案: 练习1:C。数量不同是表象,核心区别在于多元统计专注于研究多个变量之间的相互依赖关系和联合分布规律。 练习2:1-A, 2-B, 3-C, 4-D。
本章小结
本节作为课程导论,我们建立了对多元统计分析的全局认识:
- 为什么学:因为多元数据无处不在,需要专门的方法来挖掘其内在结构和规律。
- 是什么:是研究多个随机变量相互依赖关系及内在统计规律的科学,是一元统计的推广。
- 有什么:核心方法体系涵盖降维(PCA、因子分析)、分类判别(聚类、判别分析)、变量关系(回归、典型相关)和预测决策。
- 能干什么:应用极其广泛,遍及教育、医学、经济、商业、气象等几乎所有涉及多指标测量的领域。
- 怎么学:本课程将结合理论推导与 Python 实战,使用现代化的数据科学工具库(scikit-learn, SciPy, statsmodels等)进行实操。
行动清单
- 理解案例:回顾“学生成绩分析”案例,深刻体会一元分析与多元分析视角的差异。
- 建立框架:尝试用自己的话复述多元统计解决的四大类问题及其对应方法。
- 环境准备:确保你的 Python 环境已安装好
numpy,scipy,pandas,scikit-learn,statsmodels和matplotlib等库,为后续实战做好准备。
— 小象教研组
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加顾问免费领取;想学什么,直接告诉顾问
微信扫码添加顾问