📑 查看全课大纲(第 5 / 101 节)
- 1.数据分析基本概念
- 2.学习数据分析的一般路线
- 3.数据分析的流程
- 4.数据类型
- 5.环境部署(1)
- 6.环境部署(2)
- 7.课程介绍
- 8.TXT文件操作
- 9.JSON文件操作
- 10.CSV文件操作
- 11.Excel文件操作
- 12.数据库及SQL常用语法
- 13.数据库基本操作
- 14.数据库多表连接
- 15.实战:欧洲职业足球数据库分析
- 16.爬虫简介
- 17.URL管理模块
- 18.网页下载模块
- 19.网页解析模块(1)
- 20.网页解析模块(2)
- 21.Scrapy简介
- 22.Scrapy使用步骤(1)
- 23.Scrapy使用步骤(2)
- 24.Scrapy使用步骤(3)
- 25.Scrapy使用步骤(4)
- 26.实战:获取国内城市空气质量指数数据
- 27.NumPy和SciPy介绍
- 28.多维数组
- 29.多维数组操作
- 30.NumPy的常用方法
- 31.向量化介绍
- 32.向量化及通用函数
- 33.实战:2016美国大选分析
- 34.数据结构-Series
- 35.数据结构-DataFrame
- 36.数据结构-Index
- 37.Series的索引操作
- 38.DataFrame的索引操作
- 39.索引操作总结
- 40.运算与对齐
- 41.函数应用操作(1) -- map
- 42.函数应用操作 (2) -- apply applymap
- 43.文件读写操作
- 44.排序操作
- 45.数据清洗--处理缺失数据
- 46.数据清洗--处理重复数据
- 47.数据清洗--替换数据
- 48.常用统计方法(1) -- describe quantile
- 49.常用统计方法(2) -- sum mean median count
- 50.常用统计方法(3) -- max min idxmax idxmin
- 51.常用统计方法(4) -- mad var std cumsum
- 52.实战:全球食品数据分析
- 53.层级索引
- 54.分组与聚合介绍
- 55.分组操作(1) -- GroupBy对象及常用聚合操作
- 56.分组操作(2) -- 自定义分组及聚合操作
- 57.透视表介绍
- 58.透视表操作
- 59.数据规整(1) -- 数据合并concat
- 60.数据规整(2) -- 数据连接merge
- 61.数据重构(3) -- 数据重构stack unstack
- 62.实战:互联网电影资料库分析
- 63.探索性数据分析EDA介绍
- 64.EDA的目的
- 65.EDA常用工具
- 66.Matplotlib绘图基本介绍
- 67.Matplotlib画布
- 68.散点图和柱状图的绘制
- 69.直方图的绘制
- 70.矩阵绘图
- 71.子图的使用
- 72.Matplotlib颜色、标记、线型
- 73.Matplotlib坐标刻度、标签、图例、标题
- 74.Seaborn介绍
- 75.数据集分布可视化(1) -- 单变量分布、双变量分布
- 76.数据集分布可视化(2) -- 变量关系可视化
- 77.类别数据可视化 -- 类别散布图、类别内数据分布、类别内统计图
- 78.交互式数据可视化工具Bokeh介绍
- 79.Bokeh绘制散点图、柱状图、盒子图、弦图
- 80.Bokeh绘制常用图形元素
- 81.D绘图 -- mplot3d
- 82.D曲线可视化
- 83.D散点图可视化
- 84.D柱状图可视化
- 85.Pandas绘图
- 86.实战:Lending Club借贷数据探索性分析及可视化
- 87.机器学习介绍及应用场景
- 88.机器学习建模介绍 (1) -- 分类
- 89.机器学习建模介绍 (2) -- 回归
- 90.机器学习建模介绍 (3) -- 聚类
- 91.机器学习分类
- 92.机器学习工具scikit-learn
- 93.使用scikit-learn的流程
- 94.数据集准备及划分
- 95.模型选择
- 96.数据预处理及特征工程
- 97.过拟合与欠拟合
- 98.模型调参介绍
- 99.模型调参方法
- 100.模型测试及评价
- 101.实战:通过移动设备行为数据预测性别和年龄
环境部署(1)
约 14 分钟
Python 科学计算环境部署:Anaconda 安装与包管理精讲
小象实战讲义 · Python数据分析实战
工欲善其事,必先利其器。进行 Python 数据分析与科学计算,第一步也是最关键的一步就是搭建一套稳定、纯净且开箱即用的开发环境。很多初学者直接从 Python 官网下载纯净版解释器,但在后续安装 NumPy、Pandas 或 Scikit-Learn 等科学计算库时,往往会遭遇复杂的 C/C++ 底层依赖编译失败与环境冲突。本节将带你使用业界主流的 Anaconda 科学计算发行版,手把手在 Windows、macOS 与 Linux 上完成环境部署与包管理工具配置。
💡 核心导读
- 为什么选择 Anaconda:理解 Anaconda 发行版与原生 Python 的本质区别及巨大优势。
- 三大操作系统安装要点:掌握 Windows、macOS 与 Linux 下的标准安装与环境变量配置。
- 环境验证三部曲:通过终端命令快速检验
python、conda与pip的运行状态。 - Conda 与 Pip 包管理速查:掌握库安装、升级、卸载与镜像源加速的核心命令。
- Python 运行环境自检代码:编写 Python 脚本自动检测当前环境的关键科学计算库版本。
1. 认识 Anaconda:数据分析师的首选平台
什么是 Anaconda?
Anaconda 是专为数据分析、科学计算与机器学习而生的 Python 发行版。它不仅包含了标准 Python 解释器,更预装了数百个数据科学领域最核心的第三方库(包括 NumPy、Pandas、SciPy、Matplotlib、Scikit-Learn 等),并自带强大的包管理与虚拟环境工具 conda。
┌─────────────────────────────────────────────────────────────┐
│ Anaconda 发行版 │
├───────────────────────────────┬─────────────────────────────┤
│ 标准 Python 解释器 │ Conda 包与环境管理器 │
├───────────────────────────────┴─────────────────────────────┤
│ 预装 1500+ 核心数据科学库 │
│ [NumPy] [Pandas] [SciPy] [Matplotlib] [Seaborn] [Scikit-Learn]│
└─────────────────────────────────────────────────────────────┘为什么不推荐直接安装原生 Python?
- 依赖冲突极少:科学计算库底层依赖许多优化编译的数学库(如 BLAS/LAPACK/MKL)。Anaconda 提供的都是预编译好的二进制包,避免了本地编译失败的噩梦;
- 虚拟环境隔离:通过
conda可以为不同项目创建完全隔离的独立 Python 环境,互不干扰。
2. 三大操作系统安装与配置指南
2.1 下载地址与版本选择
- 官方下载站:
https://www.anaconda.com/download/ - 清华大学开源镜像站(国内加速推荐):
https://mirrors.tuna.tsinghua.edu.cn/anaconda/archive/
注意:请务必根据自己的操作系统架构(Windows x64、macOS ARM64/Apple Silicon 或 Intel x64、Linux x86_64)选择对应的安装程序。
2.2 各平台安装要点
1. Windows 系统安装
- 双击运行
.exe安装程序,点击 Next 并同意用户协议(I Agree); - 选择 All Users(或 Just Me),选择安装路径(建议安装在非中文、无空格的路径下,如
D:\Anaconda3); - 关键步骤:勾选 “Add Anaconda3 to my PATH environment variable”(将其添加至系统环境变量),便于在 CMD/PowerShell 中直接调用;
- 点击 Install 开始安装,直至提示安装完成。
2. macOS 系统安装
- 下载图形化
.pkg安装包,双击打开按照安装向导点击“继续”; - 采用默认安装路径(通常位于
/Users/用户名/opt/anaconda3或/Users/用户名/anaconda3); - 安装完成后打开系统“终端(Terminal)”,终端提示符前若出现
(base)即表示环境配置成功。
3. Linux 系统安装
在终端中切换到安装包下载目录,执行 Bash 脚本安装:
# 运行安装脚本(以实际下载的脚本名为准)
bash ./Anaconda3-latest-Linux-x86_64.sh- 连续按回车滚动阅读用户协议,最后输入
yes同意; - 按回车确认默认安装路径(
/home/用户名/anaconda3); - 安装结束时提示是否执行
conda init,输入yes自动写入环境变量。
3. 环境验证与常用包管理命令
安装完成后,打开操作系统终端(Windows 下打开 CMD 或 PowerShell,macOS/Linux 下打开 Terminal),依次执行以下三条验证命令:
# 1. 验证 Python 版本
python --version
# 2. 验证 Conda 版本
conda --version
# 3. 验证 Pip 包管理器
pip --version如果三条命令均能正常输出版本号(无 command not found 报错),则表示科学计算基础环境已成功就绪!
常用包管理命令对比速查
| 操作类型 | Conda 命令 | Pip 命令 |
|---|---|---|
| 安装新库 | conda install <库名> | pip install <库名> |
| 升级指定库 | conda update <库名> | pip install --upgrade <库名> |
| 卸载库 | conda uninstall <库名> | pip uninstall <库名> |
| 列出已安装库 | conda list | pip list |
| 国内镜像加速 | 修改 .condarc 配置镜像源 | pip install <库名> -i https://pypi.tuna.tsinghua.edu.cn/simple |
4. Python 代码实战:开发环境依赖自动体检脚本
下面我们编写一段 Python 脚本,自动检测当前 Python 运行时环境,并体检常用数据科学库(numpy、pandas、matplotlib 等)的安装情况与版本号。
# 示例:检测当前运行环境并进行核心依赖库体检
import sys
import platform
print("=== Python 基础运行环境诊断 ===")
print(f"操作系统平台: {platform.system()} {platform.release()} ({platform.machine()})")
print(f"Python 解释器版本: {platform.python_version()}")
print(f"解释器执行路径: {sys.executable}")
print("-" * 50)接下来,我们编写模块化检查函数,批量体检数据科学核心库是否安装就绪:
# 核心数据分析依赖清单
required_libraries = [
("numpy", "数值计算核心库"),
("pandas", "数据清洗与结构化分析库"),
("scipy", "科学与统计计算库"),
("matplotlib", "数据可视化基础库"),
("seaborn", "高级统计图表库"),
("sklearn", "经典机器学习库")
]
print("=== 核心数据分析库安装体检 ===")
missing_libs = []
for lib_name, lib_desc in required_libraries:
try:
# 动态导入模块并读取版本号
module = __import__(lib_name)
version = getattr(module, "__version__", "已安装(无明确版本号)")
print(f"✅ {lib_name:<12} | 版本: {version:<10} | 说明: {lib_desc}")
except ImportError:
print(f"❌ {lib_name:<12} | [未安装] | 说明: {lib_desc}")
missing_libs.append(lib_name)
print("-" * 50)
if not missing_libs:
print("🎉 恭喜!当前环境已集齐全部核心科学计算库,可无缝开启后续课程实战!")
else:
print(f"⚠️ 提示:检测到缺少以下依赖库: {', '.join(missing_libs)}")
print(f"💡 建议在终端执行安装: pip install {' '.join(missing_libs)}")📝 动手练一练
问答题:如果你在公司的内网服务器上通过终端输入
conda install pandas时提示连接超时(Connection Timeout),应该如何解决?👉 点击查看参考答案
参考答案: 造成连接超时的常见原因是国外官方源网络受限。解决方法为: ① 配置国内镜像源:在用户目录下编辑或创建
.condarc配置文件,添加清华大学、中科大或阿里云的 Anaconda 镜像源频道; ② 或者临时改用国内镜像源运行pip install pandas -i https://pypi.tuna.tsinghua.edu.cn/simple进行安装。操作与编程练习:请在你的电脑上新建一个名为
test_env.py的文件,将本节实战中的环境检测脚本复制进去并运行,观察输出的 Python 版本号与操作系统名称。👉 点击查看参考答案
参考答案: 在终端中运行
python test_env.py,预期将完整打印出当前电脑的系统版本、Python 解释器路径以及各个科学计算库的安装状态。只要输出中没有报错提示,即代表当前开发环境运行正常。
本章小结
在本节中,我们完成了数据分析基石环境的搭建:
- Anaconda 发行版是数据科学领域的工业级标准,一站式解决了依赖编译与库冲突难题;
- 正确配置系统环境变量是确保在任意命令行工具中全局调用
python和conda的关键; - 掌握
conda与pip的基本管理命令,能够轻松应对后续第三方库的增量安装。
📋 行动清单
- 在个人电脑上完成 Anaconda 的下载与安装。
- 打开命令行终端,运行
python --version和conda --version完成安装校验。
—— 小象教研组
- 本节课件:环境部署(1)(PDF · 1003KB)下载
- 全套课件打包(第1-5章)(ZIP · 12.8MB)下载
- 全套课件打包(第6-8章)(ZIP · 15MB)下载
- 实战数据集:AppleStore 应用商城分析(ZIP · 329KB)下载
- 实战数据集:女性服装电商分析(ZIP · 2.8MB)下载
- Python 数据分析环境搭建指南(PDF · 2MB)下载
- Scrapy 安装教程(PDF · 12.7MB)下载
- 附加实战项目:AppleStore 应用商城数据分析(ZIP · 0.3MB · ipynb + CSV 数据)下载
- 附加实战项目:银行电话营销数据分析(ZIP · 0.4MB · ipynb + CSV 数据)下载
- 附加实战项目:女性服装电商评论数据分析(ZIP · 2.7MB · ipynb + CSV 数据)下载
- 附加实战项目:美国化学学会杂志数据分析(ZIP · 34.2MB · ipynb + SQLite 数据库)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问