一、Pandas 介绍

  • 定义:一个开源的 Python 类库,主要用于数据分析、数据处理和数据可视化。
  • 特点:高性能····提供容易使用的数据结构····具备容易使用的数据分析工具

二、Pandas 安装与导入

(一)安装方法

  1. 使用 pip 安装:pip install pandas
  2. 使用 conda 安装:conda install pandas
    • 可使用清华源提高下载速度,清华源地址:Simple Index

(二)导入方法

python

运行

import pandas as pd

三、Pandas 数据结构

(一)Series

  • 定义:类似表格中的一个列,类似于一维数组,可以保存任何数据类型,由索引和数据组成。函数pandas.Series(data, index, dtype, name, copy)
  •    各参数说明如下:

参数说明
data一组数据(ndarray 类型)
index数据索引标签,不指定则默认从 0 开始
dtype数据类型,默认会自动判断
name设置名称
copy拷贝数据,默认为 False

  • 创建方式

    1. 使用列表创建:

      python

      运行

      import pandas as pd
      arr = [1, 3, 6, 33, 1]
      s1 = pd.Series(arr)  # 不指定索引,默认从0开始
      
    2. 使用 ndarray 创建:

      python

      运行

      import numpy as np
      import pandas as pd
      n = np.random.randn(5)  # 创建随机Ndarray数组
      index = ['a', 'b', 'c', 'd', 'e']
      s2 = pd.Series(n, index=index)
      
    3. 使用字典创建:

      python

      运行

      import numpy as np
      import pandas as pd
      score_dict = {'zhangsan': 80, 'lisi': 62, 'wangwu': 97}
      score = pd.Series(score_dict)
      
  • 查看索引和数值

    • 查看索引:score.index
    • 查看数值:score.values

(二)DataFrame

  • 定义:一个表格型的数据结构,含有一组有序的列,每列可以是不同的值类型,既有行索引也有列索引。
  • 构造方法pandas.DataFrame(data, index, columns, dtype, copy)
    • 各参数说明如下:

参数说明
data一组数据(ndarray、series、map、lists、dict 等类型)
index索引值,也称行标签
columns列标签,默认为 RangeIndex (0, 1, 2, …, n)
dtype数据类型
copy拷贝数据,默认为 False

  • 创建方式
    1. 使用列表创建:

      python

      运行

      import pandas as pd
      data = [['zhangsan', 10], ['lisi', 12], ['wangwu', 13]]
      df = pd.DataFrame(data, columns=['site', 'Age'], dtype=float)
      
    2. 使用 ndarrays 创建:

      python

      运行

      import pandas as pd
      data = {'site': ['zhangsan', 'lisi', 'wangwu'], 'Age': [10, 12, 13]}
      df = pd.DataFrame(data)
      
    3. 使用字典(key/value)创建:

      python

      运行

      import pandas as pd
      data = [{'a': 1, 'b': 2}, {'a': 5, 'b': 10, 'c': 20}]
      df = pd.DataFrame(data)
      

四、Pandas 数据查询

  • loc () 方法
    • 作用:用于返回指定行的数据。
    • 用法:
      • 返回第 n 行数据:df.loc[n]
      • 返回多行数据:使用[[...]]格式,...为各行的索引,以逗号隔开,如df.loc[[0, 1]]
      • 当指定了索引值时,可返回指定索引对应的行,如:

        python

        运行

        import pandas as pd
        data = {
            "zhangsan": [99, 60, 70],
            "lisi": [80, 70, 95]
        }
        df = pd.DataFrame(data, index=["Chinese", "Math", "English"])
        print(df.loc["Chinese"])  # 返回索引为"Chinese"的行
        

五、Pandas 数据读取

(一)不同数据类型的读取方法

数据类型说明Pandas 读取方法
csv、tsv、txt用逗号分隔或者 tab 分割的纯文本文件pd.read_csv()
excelxls 或者 xlsx 文件pd.read_excel()
mysql关系型数据库表pd.read_sql()

(二)常用读取相关方法

head():用于读取前面的 n 行,默认返回 5 行。

python

运行

import pandas as pd
df = pd.read_csv('nba.csv')
print(df.head())  # 默认返回前5行
print(df.head(3))  # 返回前3行
  • tail():用于读取尾部的 n 行,默认返回 5 行。

    python

    运行

    import pandas as pd
    df = pd.read_csv('nba.csv')
    print(df.tail())  # 默认返回后5行
    print(df.tail(3))  # 返回后3行
    

    info():返回表格的一些基本信息,如数据行数、列数、各列数据类型、非空值数量等。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐