Pandas 学习笔记
·
一、Pandas 介绍
- 定义:一个开源的 Python 类库,主要用于数据分析、数据处理和数据可视化。
- 特点:高性能····提供容易使用的数据结构····具备容易使用的数据分析工具
二、Pandas 安装与导入
(一)安装方法
- 使用 pip 安装:
pip install pandas - 使用 conda 安装:
conda install pandas- 可使用清华源提高下载速度,清华源地址:Simple Index
(二)导入方法
python
运行
import pandas as pd
三、Pandas 数据结构
(一)Series
- 定义:类似表格中的一个列,类似于一维数组,可以保存任何数据类型,由索引和数据组成。函数:
pandas.Series(data, index, dtype, name, copy) - 各参数说明如下:
| 参数 | 说明 |
|---|---|
| data | 一组数据(ndarray 类型) |
| index | 数据索引标签,不指定则默认从 0 开始 |
| dtype | 数据类型,默认会自动判断 |
| name | 设置名称 |
| copy | 拷贝数据,默认为 False |
-
创建方式:
- 使用列表创建:
python
运行
import pandas as pd arr = [1, 3, 6, 33, 1] s1 = pd.Series(arr) # 不指定索引,默认从0开始 - 使用 ndarray 创建:
python
运行
import numpy as np import pandas as pd n = np.random.randn(5) # 创建随机Ndarray数组 index = ['a', 'b', 'c', 'd', 'e'] s2 = pd.Series(n, index=index) - 使用字典创建:
python
运行
import numpy as np import pandas as pd score_dict = {'zhangsan': 80, 'lisi': 62, 'wangwu': 97} score = pd.Series(score_dict)
- 使用列表创建:
-
查看索引和数值:
- 查看索引:
score.index - 查看数值:
score.values
- 查看索引:
(二)DataFrame
- 定义:一个表格型的数据结构,含有一组有序的列,每列可以是不同的值类型,既有行索引也有列索引。
- 构造方法:
pandas.DataFrame(data, index, columns, dtype, copy)- 各参数说明如下:
| 参数 | 说明 |
|---|---|
| data | 一组数据(ndarray、series、map、lists、dict 等类型) |
| index | 索引值,也称行标签 |
| columns | 列标签,默认为 RangeIndex (0, 1, 2, …, n) |
| dtype | 数据类型 |
| copy | 拷贝数据,默认为 False |
- 创建方式:
- 使用列表创建:
python
运行
import pandas as pd data = [['zhangsan', 10], ['lisi', 12], ['wangwu', 13]] df = pd.DataFrame(data, columns=['site', 'Age'], dtype=float) - 使用 ndarrays 创建:
python
运行
import pandas as pd data = {'site': ['zhangsan', 'lisi', 'wangwu'], 'Age': [10, 12, 13]} df = pd.DataFrame(data) - 使用字典(key/value)创建:
python
运行
import pandas as pd data = [{'a': 1, 'b': 2}, {'a': 5, 'b': 10, 'c': 20}] df = pd.DataFrame(data)
- 使用列表创建:
四、Pandas 数据查询
- loc () 方法:
- 作用:用于返回指定行的数据。
- 用法:
- 返回第 n 行数据:
df.loc[n] - 返回多行数据:使用
[[...]]格式,...为各行的索引,以逗号隔开,如df.loc[[0, 1]] - 当指定了索引值时,可返回指定索引对应的行,如:
python
运行
import pandas as pd data = { "zhangsan": [99, 60, 70], "lisi": [80, 70, 95] } df = pd.DataFrame(data, index=["Chinese", "Math", "English"]) print(df.loc["Chinese"]) # 返回索引为"Chinese"的行
- 返回第 n 行数据:
五、Pandas 数据读取
(一)不同数据类型的读取方法
| 数据类型 | 说明 | Pandas 读取方法 |
|---|---|---|
| csv、tsv、txt | 用逗号分隔或者 tab 分割的纯文本文件 | pd.read_csv() |
| excel | xls 或者 xlsx 文件 | pd.read_excel() |
| mysql | 关系型数据库表 | pd.read_sql() |
(二)常用读取相关方法
head():用于读取前面的 n 行,默认返回 5 行。
python
运行
import pandas as pd
df = pd.read_csv('nba.csv')
print(df.head()) # 默认返回前5行
print(df.head(3)) # 返回前3行
- tail():用于读取尾部的 n 行,默认返回 5 行。
python
运行
import pandas as pd df = pd.read_csv('nba.csv') print(df.tail()) # 默认返回后5行 print(df.tail(3)) # 返回后3行info():返回表格的一些基本信息,如数据行数、列数、各列数据类型、非空值数量等。
更多推荐


所有评论(0)