5个Python自动化EDA库

本文为博客 VIP 文章,开通 VIP 后可阅读全文

开通 VIP

EDA或探索性数据分析是一项耗时的工作,但是由于EDA是不可避免的,所以Python出现了很多自动化库来减少执行分析所需的时间。EDA的主要目标不是制作花哨的图形或创建彩色的图形,而是获得对数据集的理解,并获得对变量之间的分布和相关性的初步见解。我们在以前也介绍过EDA自动化的库,但是现在已经过了1年的时间了,我们看看现在有什么新的变化。

为了测试这些库的功能,本文使用了两个不同的数据集,只是为了更好地理解这些库如何处理不同类型的数据。

YData-Profiling

以前被称为Pandas Profiling,在今年改了名字。如果你搜索任何与EDA自动化相关的内容时,它都会作为第一个结果出现,这也是有充分理由的。

这个库最有用和最常用的是ProfileReport()命令。它生成整个数据集的详细摘要,报告对于获得数据的概览非常有用,特别是如果你不知道从哪里或如何开始分析(通常是这种情况)。这对于那些想要节省时间的新手或有经验的分析师来说非常有用。该报告提供单变量分布,突出数据质量问题,并创建相关性。让我们看一下患者风险概况数据的报告:

 patient\_data = pd.read\_csv('/kaggle/input/patient-risk-profiles/patient\_risk\_profiles.csv')  
 zomato\_data=pd.read\_csv('/kaggle/input/zomato-data-40k-restaurants-of-indias-100-cities/zomato\_dataset.csv')  
   
 from ydata\_profiling import ProfileReport  
 patient\_report=ProfileReport(patient\_data)  
 patient\_report  
   
 zomato\_report=ProfileReport(zomato\_data)  
 zomato\_report

这份报告在很直观,也非常全面,它提供了一个很好的概述:

变量统计的简明概述,缺失值的百分比,重复值等。

在Alerts选项卡的简单文本中高亮显示数据质量问题,如高相关性,类不平衡等。

在variables 选项卡中给出了所有变量的单变量分析。有助于了解该变量的分布和统计特性。

点击变量下的“More Details”可以提供对各种其他统计数据,直方图,常见值和极值的更深入分析。基本上包含了一般我们想要知道的所有信息。

对于文本变量,报告生成了一个类似于NLP的概述,如下所示:

Interactions选项卡可以进行双变量分析,其中x轴变量在左列,y轴变量在右列。可以混搭来观察变量之间的相关性。这里唯一的限制是可用的图表类型只有散点图,所以如果想使用不同类型的图表,必须手动绘制。

在Correlations 下,可以观察到所有变量的热图。但是由于变量数量太多,热图几乎难以辨认,所以最好是用自定义参数绘制手动热图。

最后还显示了缺失值和相应的列,以及重复的行(如果有的话)。

现YData报告对于在新数据集上获得立足点并找到进一步调查的方向非常有用。因为Pandas Profiling算是最早 的一个自动化EDA库了,并且YData对它做了非常大的更新。但是在较大数据集的情况下生成报告所需的时间很长,并且有时会崩溃。

通过Pythonydata-profiling生成数据分析报告 ydata-profiling提供了一个全面的数据集分析视图,使得能够快速理解数据集的特征,识别潜在的数据质量问题,并为进一步的数据分析和建模提供基础。报告可以导出为 HTML 或 JSON 格式,便于分享和进一步处理。 阅读详情

相关推荐

详解5Python自动化探索性数据分析

YData Profiling执行起来很简单,UI很直观,给了我所有的信息,这是开始EDA过程的一个很好的切入点。D-Tale不仅是EDA过程的一个很好的起点,而且可以用来轻松地预处理数据,最主要是不需要编写任何代码,这使得它非常节省时间,并且任何人都可以轻松访问。SweetViz的UI有点过时,但它提供了相当数量的信息,最主要的时他可以比较两个数据集。

Saki_Python的博客 1137

PyDDA:基于3D变分技术的Pythonic多普勒代码

PyDDA(Pythonic直接数据同化) Pythonic多普勒雷达风检索软件包 该软件旨在使用三维数据同化从一个或多个多普勒天气雷达中检索降水风暴系统中的风运动学(u,v,w)。 可以添加其他约束,包括背景字段(例如,重新分析)。 该软件包是对Potvin等人的重写。 (2012年)和Shapiro等人(2009年)将检索技术集成到一个纯Pythonic软件包中,以便与Py-ART和Python轻松集成。 这样可以使用pip和anaconda轻松安装。 这个新软件包还使用了更快的最小化技术L-BFGS-B,与使用代码相比,该技术提供了2到5倍的加速,并且语法更加优雅,并且支持任意数字。雷达。 该代码也是线程安全的,并且已经在大型(100核以上)cluser上使用HPC工具(例如Dask)进行了测试。 用户可以选择调整数据强度,质量连续性约束以及实施低通滤波器。 现在,此新版本还提供

自动执行探索性数据分析 (EDA),更快、更轻松地理解数据

EDA是exploratory data analysis (探索性数据分析 )的缩写。所谓EDA就是在数据分析之前需要对数据进行以此系统性研判,在这个研判后,得到基本的数据先验知识,在这个基础上进行数据分析。本文将在R语言python语言的探索性处理。

gongdiwudu的专栏 8341

python——ydata-profiling介绍与使用

在某些情况下,用户可能希望根据个人喜好或公司品牌来自定义报告的外观。ydata-profiling提供了两个主要的自定义方面:HTML报告的样式和其中包含的可视化和图表的样式5.1 自定义报告的主题报告的多个方面都可以进行自定义。参数类型默认描述boolTrue如果为True,则使用htmlmin包对输出的HTML进行最小化处理。boolTrue如果为True,则所有资源(样式表、脚本、图片)将被存储在本地。如果为False,则使用CDN来提供部分样式表和脚本。boolean。

whitedrogen的博客 6173

Ydata-profiling,一个强大的 Python

在数据科学的世界里,有时候探索数据就像是探险一样,你需要勇敢地踏上未知的领域,寻找隐藏在数据背后的宝藏。而在这场数据探险中,有一位强大的向导——那就是。想象一下,你拿着一大堆数据,像是一座未被勘探的神秘岛屿。你知道这些数据可能藏着无数的宝藏,但如何找到它们呢?这就是登场的时刻!Ydata-profiling简介是探索数据的好帮手。它能快速为你的数据生成报告,如同一张地图,显示数据的类型、缺失值、分布等信息,解读数据的细节。它还能通过可视化图表展示数据规律和趋势,让你一眼发现数据中的宝藏。

Trb701012的博客 1744

你必须知道的?Python自动化5EDA

YData Profiling执行起来很简单,UI很直观,给了我所有的信息,这是开始EDA过程的一个很好的切入点。D-Tale不仅是EDA过程的一个很好的起点,而且可以用来轻松地预处理数据,最主要是不需要编写任何代码,这使得它非常节省时间,并且任何人都可以轻松访问。SweetViz的UI有点过时,但它提供了相当数量的信息,最主要的时他可以比较两个数据集。

朱雀随云记的博客 1129

Qwen2.5-7B-Instruct在Python数据分析中的应用:Pandas优化

本文介绍了如何在星图GPU平台上自动化部署Qwen2.5-7B-Instruct镜像,以辅助Python数据分析工作。该平台简化了部署流程,用户可快速调用此大语言模型,将其作为智能编程助手,用于自动化生成和优化Pandas数据清洗、转换及分析代码,从而提升日常数据处理效率。

weixin_42372837的博客 430

别酸软件老哥了!硬件工程师的“AI白嫖指南”:这5个神技现在就能用!

本文为硬件工程师提供AI实战指南,针对读手册、找替代料、写测试代码等痛点,介绍了五种提效方法:用Kimi速查芯片参数、用ChatGPT生成测试代码、用AI搜索替代料、用多模态AI分析波形故障、用EDA工具脚本辅助设计。核心观点:AI是知识渊博的“免费实习生”,虽不能替代实操,但能帮工程师少加班。

s0907136的博客 1683

Py之ydata-profilin:ydata-profiling的简介、安装、使用方法之详细攻略

​ Py之ydata-profilin:ydata-profiling的简介、安装、使用方法之详细攻略 目录 ydata-profiling的简介 ydata-profiling的安装 ydata-profiling的使用方法 ydata-profiling的简介 ydata-profiling 的主要目标是在一致且快速的解决方案中提供一行探索性数据分析(EDA)体验。与 pandas 的 df.describe() 函数一样方便,ydata-profiling 提供了对 D

头部AI社区如有邀博主AI主题演讲请私信—心比天高,仗剑走天涯,保持热爱,奔赴向梦想!低调,专注,谦虚,自律,反思,成长,还算比较正能量的博主,公益免费传播…内心特别想在AI界做出一些可以推进历史进程影响力的技术(兴趣使然,有点小情怀,也有点使命感呀 3665

Data profiling in Python

Data profiling is intended to help understand data leading to a better data prepping and data quality.Data profiling is the systematic up front analysis of the content of a data source, all the way fr...

bbbeoy的专栏 836

数据质量管理—1、数据概要(Data Profiling

数据质量(Data Quality)是数据分析结论有效性和准确性的基础也是最重要的前提和保障。数据质量保证(Data Quality Assurance)是数据仓架构中的重要环节,也是ETL的重要组成部分。 我们通常通过数据清洗(Data cleansing)来过滤脏数据,保证底层数据的有效性和准确性,数据清洗一般是数据进入数据仓的前置环节,一般来说数据一旦进入数据仓,那么必须保证这些数据都...

huryer的专栏 5377

探索数据科学的新工具:ydata-profiling

探索数据科学的新工具:ydata-profiling 【免费下载链接】ydata-profiling ydataai/ydata-profiling: 是一个开源的数据探索和分析工具,用于快速分析和理解数据。它可以帮助开发者轻松发现数据中的规律和异常,提高数据分析和决策的准确性。特点包括易于使用、支持多种数据源、支持实时...

gitblog_00089的博客 1164

ydata-profiling 使用教程

ydata-profiling 使用教程 【免费下载链接】ydata-profiling ydataai/ydata-profiling: 是一个开源的数据探索和分析工具,用于快速分析和理解数据。它可以帮助开发者轻松发现数据中的规律和异常,提高数据分析和决策的准确性。特点包括易于使用、支持多种数据源、支持实时分析等。 ...

gitblog_00841的博客 743
上一篇: 汇总17个工作必备的Python自动化代码
下一篇: 【人工智能时代】:为什么将 Python 称为第一语言?
田野猫咪
博客等级 码龄3年 5012粉丝 502原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值