Python?數(shù)據(jù)分析教程探索性數(shù)據(jù)分析
什么是探索性數(shù)據(jù)分析(EDA)?
EDA 是數(shù)據(jù)分析下的一種現(xiàn)象,用于更好地理解數(shù)據(jù)方面,例如:
– 數(shù)據(jù)的主要特征
– 變量和它們之間的關(guān)系
– 確定哪些變量對(duì)我們的問題很重要
我們將研究各種探索性數(shù)據(jù)分析方法,
例如:
- 描述性統(tǒng)計(jì),這是一種簡(jiǎn)要概述我們正在處理的數(shù)據(jù)集的方法,包括樣本的一些度量和特征
- 分組數(shù)據(jù) [使用group by 進(jìn)行基本分組]
- ANOVA,方差分析,這是一種計(jì)算方法,可將觀察集中的變化劃分為不同的分量。
- 相關(guān)和相關(guān)方法
我們將使用的數(shù)據(jù)集是子投票數(shù)據(jù)集,您可以在 python 中將其導(dǎo)入為:
import pandas as pd
Df = pd.read_csv("https://vincentarelbundock.github.io / Rdatasets / csv / car / Child.csv")描述性統(tǒng)計(jì)
描述性統(tǒng)計(jì)是了解數(shù)據(jù)特征和快速總結(jié)數(shù)據(jù)的有用方法。python 中的 Pandas 提供了一個(gè)有趣的方法describe() 。describe 函數(shù)對(duì)數(shù)據(jù)集應(yīng)用基本統(tǒng)計(jì)計(jì)算,如極值、數(shù)據(jù)點(diǎn)計(jì)數(shù)標(biāo)準(zhǔn)差等。任何缺失值或 NaN 值都會(huì)被自動(dòng)跳過(guò)。describe() 函數(shù)很好地描繪了數(shù)據(jù)的分布情況。
DF.describe()
這是您在運(yùn)行上述代碼時(shí)將獲得的輸出:

另一種有用的方法是 value_counts(),它可以獲取分類屬性值系列中每個(gè)類別的計(jì)數(shù)。例如,假設(shè)您正在處理一個(gè)客戶數(shù)據(jù)集,這些客戶在列名 age 下分為青年、中年和老年類別,并且您的數(shù)據(jù)框是“DF”。您可以運(yùn)行此語(yǔ)句以了解有多少人屬于各個(gè)類別。在我們的數(shù)據(jù)集示例中可以使用教育列
DF["education"].value_counts()
上述代碼的輸出將是:

另一個(gè)有用的工具是 boxplot,您可以通過(guò) matplotlib 模塊使用它。箱線圖是數(shù)據(jù)分布的圖形表示,顯示極值、中位數(shù)和四分位數(shù)。我們可以使用箱線圖輕松找出異常值?,F(xiàn)在再次考慮我們一直在處理的數(shù)據(jù)集,讓我們?cè)趯傩钥傮w上繪制一個(gè)箱線圖
import pandas as pd
import matplotlib.pyplot as plt
DF = pd.read_csv("https://raw.githubusercontent.com / fivethirtyeight / data / master / airline-safety / airline-safety.csv")
y = list(DF.population)
plt.boxplot(y)
plt.show()發(fā)現(xiàn)異常值后,輸出圖將如下所示:

分組數(shù)據(jù)
Group by 是 pandas 中可用的一個(gè)有趣的度量,它可以幫助我們找出不同分類屬性對(duì)其他數(shù)據(jù)變量的影響。讓我們看一個(gè)在同一數(shù)據(jù)集上的示例,我們想找出人們的年齡和教育對(duì)投票數(shù)據(jù)集的影響。
DF.groupby(['education', 'vote']).mean()
輸出會(huì)有點(diǎn)像這樣:

如果按輸出表進(jìn)行分組難以理解,則進(jìn)一步的分析師使用數(shù)據(jù)透視表和熱圖對(duì)其進(jìn)行可視化。
方差分析
ANOVA 代表方差分析。執(zhí)行它是為了找出不同類別數(shù)據(jù)組之間的關(guān)系。
在 ANOVA 下,我們有兩個(gè)測(cè)量結(jié)果:
– F-testscore:顯示組均值相對(duì)于變化的變化
– p 值:顯示結(jié)果的重要性
這可以使用 python 模塊 scipy 方法名稱f_oneway()
這些樣本是每組的樣本測(cè)量值。
作為結(jié)論,如果 ANOVA 檢驗(yàn)給我們一個(gè)大的 F 檢驗(yàn)值和一個(gè)小的 p 值,我們可以說(shuō)其他變量和分類變量之間存在很強(qiáng)的相關(guān)性。
相關(guān)性和相關(guān)性計(jì)算
相關(guān)性是上下文中兩個(gè)變量之間的簡(jiǎn)單關(guān)系,使得一個(gè)變量影響另一個(gè)變量。相關(guān)性不同于引起的行為。計(jì)算變量之間相關(guān)性的一種方法是找到 Pearson 相關(guān)性。在這里,我們找到兩個(gè)參數(shù),即皮爾遜系數(shù)和 p 值。當(dāng) Pearson 相關(guān)系數(shù)接近 1 或 -1 且 p 值小于 0.0001 時(shí),我們可以說(shuō)兩個(gè)變量之間存在很強(qiáng)的相關(guān)性。
Scipy 模塊還提供了一種執(zhí)行 pearson 相關(guān)性分析的方法,
這里的示例是您要比較的屬性。
到此這篇關(guān)于Python 數(shù)據(jù)分析教程探索性數(shù)據(jù)分析的文章就介紹到這了,更多相關(guān)Python 索性數(shù)據(jù)分析內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
講解Python中的標(biāo)識(shí)運(yùn)算符
這篇文章主要介紹了講解Python中的標(biāo)識(shí)運(yùn)算符,是Python學(xué)習(xí)當(dāng)中的基礎(chǔ)知識(shí),需要的朋友可以參考下2015-05-05
python中的print()函數(shù)end=' '的使用及說(shuō)明
這篇文章主要介紹了python中的print()函數(shù)end=' '的使用及說(shuō)明,具有很好的參考價(jià)值,希望對(duì)大家有所幫助,如有錯(cuò)誤或未考慮完全的地方,望不吝賜教2024-02-02
Python 中urls.py:URL dispatcher(路由配置文件)詳解
這篇文章主要介紹了Python 中urls.py:URL dispatcher(路由配置文件)詳解的相關(guān)資料,需要的朋友可以參考下2017-03-03
python實(shí)現(xiàn)高斯判別分析算法的例子
今天小編就為大家分享一篇python實(shí)現(xiàn)高斯判別分析算法的例子,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2019-12-12
Python語(yǔ)言內(nèi)置數(shù)據(jù)類型
這篇文章主要介紹了Python語(yǔ)言中數(shù)據(jù)類型支持得運(yùn)算符,Python語(yǔ)言提供了豐富的內(nèi)置數(shù)據(jù)類型。用于有效的處理各種類型的數(shù)據(jù),下文將介紹到其數(shù)據(jù)類型支持的運(yùn)算符等相關(guān)內(nèi)容,需要的朋友可以參考一下2022-02-02
Python實(shí)現(xiàn)json對(duì)值進(jìn)行模糊搜索的示例詳解
我經(jīng)常使用json進(jìn)行存儲(chǔ)配置,于是常常遇到這樣的問題:如果想要對(duì)某個(gè)數(shù)組里的值進(jìn)行模糊搜索,同時(shí)輸出相關(guān)的其他數(shù)組相同位置的的值該如何實(shí)現(xiàn)呢?本文就來(lái)和大家詳細(xì)聊聊2023-01-01
Python實(shí)現(xiàn)Ollama的提示詞生成與優(yōu)化
這篇文章主要為大家詳細(xì)介紹了Python實(shí)現(xiàn)Ollama的提示詞生成與優(yōu)化的相關(guān)知識(shí),文中的示例代碼講解詳細(xì),感興趣的小伙伴可以跟隨小編一起學(xué)習(xí)一下2024-12-12

