当前位置:首页 > Python > 正文内容

[Python 教程] Pandas 数据分析实战

admin4个月前 (03-18)Python133

Pandas 数据分析实战

Pandas 是 Python 数据分析的核心库,提供 DataFrame 和 Series 数据结构。本文介绍 Pandas 的实用技巧。

一、创建 DataFrame

import pandas as pd
import numpy as np

# 从字典创建
df = pd.DataFrame({
    'name': ['Alice', 'Bob', 'Charlie'],
    'age': [25, 30, 35],
    'city': ['NYC', 'LA', 'Chicago']
})

# 从 CSV 读取
# df = pd.read_csv('data.csv')

# 从 Excel 读取
# df = pd.read_excel('data.xlsx')

二、数据查看

df.head()      # 前 5 行
df.tail()      # 后 5 行
df.info()      # 数据信息
df.describe()  # 统计描述
df.shape       # (行数,列数)
df.columns     # 列名

三、数据选择

# 选择列
df['name']
df[['name', 'age']]

# 选择行
df.loc[0]       # 标签索引
df.iloc[0]      # 位置索引
df.loc[0:2]     # 行范围

# 条件筛选
df[df['age'] > 30]
df[(df['age'] > 25) & (df['city'] == 'NYC')]

四、数据处理

# 添加列
df['salary'] = [50000, 60000, 70000]

# 删除列
df.drop('city', axis=1, inplace=True)

# 重命名
df.rename(columns={'name': 'full_name'}, inplace=True)

# 排序
df.sort_values('age', ascending=False)

# 去重
df.drop_duplicates()

五、数据统计

df['age'].mean()    # 平均值
df['age'].median()  # 中位数
df['age'].std()     # 标准差
df['age'].value_counts()  # 值计数
df.groupby('city')['age'].mean()  # 分组统计

六、处理缺失值

# 检查缺失值
df.isnull().sum()

# 删除缺失值
df.dropna()

# 填充缺失值
df.fillna(0)
df['age'].fillna(df['age'].mean())

相关文章

[Python 教程] Python 网络请求与爬虫基础

Python 网络请求与爬虫基础 requests 是 Python 最常用的 HTTP 库。本文介绍网络请求和爬虫的基础知识。 一、基础请求 import requests # GET 请求 r...

Python装饰器完全指南:从基础到高级应用

装饰器是 Python 中最强大也最容易被误解的特性之一。很多初学者听说过装饰器,但总是感觉云里雾里,不敢在实际项目中使用。本文从最基础的概念讲起,逐步深入到高级应用场景,通过大量原创示例代码帮助...

Python 中利用 functools.lru_cache 实现高效缓存:从入门到进阶

Python 中利用 functools.lru_cache 实现高效缓存:从入门到进阶 在日常 Python 开发中,我们经常会遇到重复计算相同输入的问题,比如递归计算斐波那契数列、多次调用相同参...

Python 装饰器进阶:从入门到实战,写出更灵活的函数增强技巧

# Python 装饰器进阶:从入门到实战,写出更灵活的函数增强技巧 ## 简介 很多 Python 开发者都听过装饰器,也知道怎么写简单的装饰器。但大多数人对装饰器的进阶用法,比如带参数的装饰器、...

Python 异步编程实战:从入门到精通

在 Python 开发中,我们经常会遇到需要同时处理多个 I/O 操作的场景。比如同时向多个 API 发送请求、批量下载文件、或者处理实时数据流。传统的同步方式会阻塞主线程,导致性能瓶颈。而异步编程通...

发表评论

访客

看不清,换一张

◎欢迎参与讨论,请在这里发表您的看法和观点。