Pandas数据处理(一)

pandas数据处理及分析】 1.查询数据在pandas中,可以使用以下方法查找数据:这些方法可以根据不同的需求选择和组合使用,以实现对数据框中特定数据的查找和筛选。2.删除某列或某行代表标签所在级别,默认为none在pandas中,可以使用以下方法删除某列或某行:其中,'column_name'为要删除的列名,axis=1表示按列操作,inplace=True表示在原始数据上进行修改。其中,row_index为要删除的行索引,axis=0表示按行操作,inplace=True表示在原始数据上进行修改。 阅读详情

Pandas 是非常著名的开源数据处理库,我们可以通过它完成对数据集进行快速读取、转换、过滤、分析等一系列操作。除此之外,Pandas 拥有强大的缺失数据处理与数据透视功能,可谓是数据预处理中的必备利器。

特有的数据结构是 Pandas 的优势和核心。我们可以将任意格式的数据转换为 Pandas 的数据类型,并使用 Pandas 提供的一系列方法进行转换、操作,最终得到我们期望的结果。

数据读取
df = pd.read_csv("文件名.csv")
df

Pandas 提供了 head()tail() 方法,它可以帮助我们只预览一小块数据。

df.head()  # 默认显示前 5 条
df.tail(n)  # 指定显示后 n 条

describe() 相当于对数据集进行概览,会输出该数据集每一列数据的计数、最大值、最小值等。

df.describe()

df.values 将 DataFrame 转换为 NumPy 数组

df.index  # 查看索引
df.columns  # 查看列名
df.shape  # 查看形状
数据选择
基于索引数字选择

选择前 3 行数据

df.iloc[:3]

我们还可以选择特定的一行

df.iloc[5]

df.iloc[] 的 [[行],[列]] 里面可以同时接受行和列的位置。
因此,选择 1,3,5 行的代码应该是

df.iloc[[1, 3, 5]]

选择第 2-4 列

df.iloc[:, 1:4]
基于标签名称选择

选择前 3 行

df.loc[0:2]

选择 1,3,5 行

df.loc[[0, 2, 4]]

选择列名为“列名n”到“列名m”的列

df.loc[:, '列名n':'列名m']

选择 1,3 行和 列名为"列名i"后面的列

df.loc[[0, 2], '列名i':]
数据删减

虽然我们可以通过数据选择方法从一个完整的数据集中拿到我们需要的数据,但有的时候直接删除不需要的数据更加简单直接。Pandas 中,以 .drop 开头的方法都与数据删减有关。

DataFrame.drop 可以直接去掉数据集中指定的列和行。指定 labels 标签参数,通过 axis 指定按列或按行删除即可。

df.drop(labels=['Median Age', 'Total Males'], axis=1)

DataFrame.drop_duplicates 则通常用于数据去重,即剔除数据集中的重复值。通过指定去除重复值规则,以及 axis 按列还是按行去除即可。

df.drop_duplicates()

DataFrame.dropna 删除缺少值,即数据集中空缺的数据列或行

 df.dropna()
数据填充

在真实的生产环境中,我们需要处理的数据文件很大几率会遇到的情况就是缺失值。

缺失值主要是指数据丢失的现象,也就是数据集中的某一块数据不存在。除此之外、存在但明显不正确的数据也被归为缺失值一类。

检测缺失值

Pandas 中用于检测缺失值主要用到两个方法,分别是:isna()notna(),故名思意就是「是缺失值」和「不是缺失值」。默认会返回布尔值用于判断。
通过 isna()notna()中的一个即可确定数据集中的缺失值

df.isna()
df.notna()

填充缺失值 fillna() 方法
用相同的标量值替换 NaN,比如用 0

df.fillna(0)

通过参数,将缺失值前面或者后面的值填充给相应的缺失值

df.fillna(method='pad') # 使用缺失值前面的值进行填充
df.fillna(method='bfill') # 使用缺失值后面的值进行填充

通过 limit= 参数设置连续填充的限制数量

df.fillna(method='pad', limit=1)  # 最多填充一项

通过 Pandas 自带的求平均值方法等来填充特定列或行,对 C 列到 E 列用平均值填充

df.fillna(df.mean()['C':'E'])
插值填充

插值是数值分析中一种方法。简而言之,就是借助于一个函数(线性或非线性),再根据已知数据去求解未知数据的值。插值在数据领域非常常见,它的好处在于,可以尽量去还原数据本身的样子。

通过 interpolate() 方法完成线性插值

df_interpolate = df.interpolate()
df_interpolate

对于 interpolate() 支持的插值算法,也就是 method=。下面给出几条选择的建议:

  1. 如果你的数据增长速率越来越快,可以选择 method='quadratic'二次插值。
  2. 如果数据集呈现出累计分布的样子,推荐选择 method='pchip'
  3. 如果需要填补缺省值,以平滑绘图为目标,推荐选择 method='akima'

当然,最后提到的 method='akima',需要你的环境中安装了 Scipy 库。除此之外,method='barycentric'method='pchip' 同样也需要 Scipy 才能使用。

数据可视化

当我们的数据是以 DataFrame 格式呈现时,可以直接使用 Pandas 提供的 DataFrame.plot 方法调用
Matplotlib 接口绘制常见的图形。

使用插值后的数据 df_interpolate 绘制线形图

df_interpolate.plot()

选择其他样式的图形通过指定 kind= 参数即可

df_interpolate.plot(kind='bar')

Pandas常用的还有:

pandas数据处理120题 1.DataFrame基本操作 import numpy as np import pandas as pd import matplotlib.pyplot as plt 1.将下面的字典创建为DataFrame data = {"grammer":["Python","C","Java","GO",np.nan,"SQL","PHP","Python"], "score":[1,... 阅读详情

相关推荐

Pandas数据处理

本文展示了Pandas库中Series和DataFrame的核心操作。首先介绍了Series对象的创建、索引访问、数据统计、筛选排序等功能。然后演示了DataFrame的基本操作,包括数据查看、排序筛选、缺失值处理、数据合并等。最后补充了分组聚合、透视表、时间序列处理等高级功能。这些操作涵盖了Pandas数据处理的主要方法,包括数据清洗、转换和分析等常见任务,为数据分析和处理提供了实用参考。

Ming_chao的博客 1451

大数据技术基础实验报告-Linux环境下hadoop集群的搭建与基本配置.doc

大数据技术基础实验报告-Linux环境下hadoop集群的搭建与基本配置

Python数据处理——pandas

文章目录0. 基本概念Series()创建Series(二)Series的简单操作DataFrame()创建DataFrame1. 数据选取2. 加载数据3. 排序与合并4. 数据汇总5. 时间序列 0. 基本概念 Pandas的数据类型是张表,可以把Pandas理解为内存型的数据库。 import pandas as pd Series:列 DataFrame:表 Series ()创建Series 1. 使用列表list创建Series (1)默认列表索引从0 - n-1 # 使用列表List

LongXinKou的博客 4109

MysqlClient安装步骤详解

MysqlClient是个方便易用的Python库,可以用于连接和操作MySQL数据库。通过学习和掌握MysqlClient的使用方式,我们可以更加高效地进行数据库开发和管理工作。

这家伙很懒,什么都没有留下 6127

机器学习数据预处理:缺失值插值方法及Python实现

插值法是最常用的缺失值填充方法之,其思想是使用数据中已有的信息来推测缺失位置的值。其中,线性插值假设缺失位置与其它位置是线性关系,而多项式插值则假设关系是高阶多项式。本文将介绍三种常用的缺失值填充方法:插值法、拉格朗日插值和lagrange插值,并提供Python代码示例。lagrange插值也是种多项式插值方法,其基本思想是通过已知数据点来构造个满足需要的多项式。与拉格朗日插值不同的是,两者的计算方式不同。综上所述,本文介绍了三种填充缺失值的方法:插值法、拉格朗日插值和lagrange插值。

BUG?不存在的! 2193

mysql client 使用_mysqlclient操作MySQL关系型数据库

本篇文章主要讲解mysqlclient操作MySQL关系型数据库,安装mysqlclient的命令行:pip install mysqlclient;然后创建个名为XKD_Python_Course的数据库和张名为students的数据库表,我们先在命令行工具里面查看下表名是否存在,登录mysql数据库的命令行:mysql -uroot -p,然后show databases;,发现没有XK...

weixin_36439236的博客 7409

Ubuntu MySQL客户端功能介绍(mysql-client)mysql命令(mysql客户端命令)数据库导出、数据库导入

在数据驱动的世界中,MySQL作为最流行的开源关系数据库管理系统之,无疑占据了重要的地位。对于Ubuntu用户来说,使用MySQL客户端是与MySQL服务器交互的主要方式。本文将介绍Ubuntu MySQL客户端(mysql-client)的功能,并提供相关命令和代码示例。

Dontla的博客 7894

Pandas数据处理简明教程

在本章中,我们介绍了Pandas的基本数据结构、数据读取与写入、数据选择与操作、数据清洗、数据分组与聚合、数据合并与连接以及时间序列数据。这些知识是进行数据分析的基础,希望你能熟练掌握。在下章中,我们将学习如何使用Pandas进行更高级的数据分析

A15216110998的专栏 895

python Pandas数据处理

PandasPython中最强大的数据处理工具,广泛应用于数据清洗、分析和可视化。本文介绍了Pandas的核心数据结构和功能:Series维数组和DataFrame二维表格,以及数据读取、清洗、转换、分组聚合等操作方法。通过个实际案例演示了从数据加载、缺失值处理、时间转换到统计分析的全流程,展示了Pandas如何高效完成数据处理任务。作为Python生态系统的关键组件,Pandas极大提升了数据处理的效率和便捷性,是数据科学工作中不可或缺的工具。

unicrom的博客 820

100个pandas数据处理技巧

大家好,我是Peter~Pandas个强大的 Python 数据分析库,它提供了非常灵活和高效的方式来处理时间序列数据。在Pandas中,有许多强大的数据处理技巧可以帮助你高效地分析和操作数据。以下是100个Pandas数据处理技巧的简要介绍和相应的Python代码示例。每个示例都会尽量简洁,由浅入深,希望对大家有所帮助。觉得不错的话,欢迎点赞、收藏、转发~ 2. 读取CSV文件 3. 查看数据前几行 4. 查看数据列信息 5. 查看数据基本信息 6. 查看数据描述统计信息 7. 选择单列

尤尔小屋 1163

盘点Pandas数据处理问题

点击上方“Python爬虫与数据挖掘”,进行关注回复“书籍”即可获赠Python从入门到进阶共10本电子书今日鸡汤孤舟蓑笠翁,独钓寒江雪。大家好,我是Python进阶者。、前言前几天在Python最强王者交流群【黑科技·鼓包】问了pandas数据处理的问题。问题如下:请教个问题,df['区划编码'] = df['区划编码'].replace(f"420113000000", "'420113...

pdcfighting的博客 1131

pandas数据处理

单点突破,pandas数据处理操作。

weixin_44921938的博客 490

使用 MySQL Client(MySQL 客户端)执行简单的 SQL 命令是个相对直接的过程

你可以在 MySQL Client(Mysql客户端) 使用 mysql 命令连接到Mysql服务器上,默认情况下Mysql服务器的密码为空,所以本实例不需要输入密码。在这个例子中,我们首先连接到SQLite数据库(如果它不存在,它将被创建)。然后,我们创建个游标对象,该对象允许我们执行SQL命令。使用 MySQL Client(MySQL 客户端)执行简单的 SQL 命令是个相对直接的过程。语句查询表中的所有数据。最后,我们提交事务并关闭连接。语句向表中插入些数据,并使用。

[Blog][Domain] programb.blog.csdn.net 1958

linux下安装mysql客户端client

linux下安装mysql客户端client

u010080562的博客 2万+

mysql client 使用_mysqlclient怎么使用

mysql client 怎么用1.输入密码:****** 2.ues mysql;使用Mysql 3.show databases;显示数据库 4.use register;使用数据库名为register 5.show tables;显示register数据库中的表 6.describe user;对表user进行操作: insert into user(username,password) v...

weixin_39724382的博客 1万+

mysqlclient 项目常见问题解决方案

mysqlclient 是个用于 Python 的 MySQL/MariaDB 数据库连接器。它是 MySQLdb1 的个分支,主要增加了对 Python 3 的支持,并修复了许多已知的 bug。该项目的主要编程语言是 Python。 ## 新手使用注意事项及解决方案 ### 1. 安装问题 **问题描述**:新手在安装 mysqlclient 时可能会遇到依赖库缺失或版本不兼容的问题。...

gitblog_00078的博客 1456

MySQL命令行工具的配置和使用

1.打开Windows的开始菜单,找到安装好的MySQL,点击MySQL 8.0 Command Line Client - Unicode,这个带有Unicode的,是支持中文的,允许在命令行中敲中文。d.此时使用**快捷键Win + R打开运行窗口,输入cmd,从黑窗口中输入mysql -u root -p**,回车数据验证身份的密码回车,也可以登陆成功。a.找到MySQL的安装路径,正常安装完的路径是这个**C:\Program Files\MySQL\MySQL Server 8.0\bin**

weixin_45840241的博客 802
上一篇: 智能家居语音控制系统的设计与实现
下一篇: 智能家居语音控制系统项目毕业答辩
EmithFla
博客等级 码龄8年 69粉丝 35原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值