python實(shí)現(xiàn)決策樹(shù)C4.5算法詳解(在ID3基礎(chǔ)上改進(jìn))
一、概論
C4.5主要是在ID3的基礎(chǔ)上改進(jìn),ID3選擇(屬性)樹(shù)節(jié)點(diǎn)是選擇信息增益值最大的屬性作為節(jié)點(diǎn)。而C4.5引入了新概念“信息增益率”,C4.5是選擇信息增益率最大的屬性作為樹(shù)節(jié)點(diǎn)。
二、信息增益

以上公式是求信息增益率(ID3的知識(shí)點(diǎn))
三、信息增益率

信息增益率是在求出信息增益值在除以
。
例如下面公式為求屬性為“outlook”的
值:

四、C4.5的完整代碼
from numpy import *
from scipy import *
from math import log
import operator
#計(jì)算給定數(shù)據(jù)的香濃熵:
def calcShannonEnt(dataSet):
numEntries = len(dataSet)
labelCounts = {} #類別字典(類別的名稱為鍵,該類別的個(gè)數(shù)為值)
for featVec in dataSet:
currentLabel = featVec[-1]
if currentLabel not in labelCounts.keys(): #還沒(méi)添加到字典里的類型
labelCounts[currentLabel] = 0;
labelCounts[currentLabel] += 1;
shannonEnt = 0.0
for key in labelCounts: #求出每種類型的熵
prob = float(labelCounts[key])/numEntries #每種類型個(gè)數(shù)占所有的比值
shannonEnt -= prob * log(prob, 2)
return shannonEnt; #返回熵
#按照給定的特征劃分?jǐn)?shù)據(jù)集
def splitDataSet(dataSet, axis, value):
retDataSet = []
for featVec in dataSet: #按dataSet矩陣中的第axis列的值等于value的分?jǐn)?shù)據(jù)集
if featVec[axis] == value: #值等于value的,每一行為新的列表(去除第axis個(gè)數(shù)據(jù))
reducedFeatVec = featVec[:axis]
reducedFeatVec.extend(featVec[axis+1:])
retDataSet.append(reducedFeatVec)
return retDataSet #返回分類后的新矩陣
#選擇最好的數(shù)據(jù)集劃分方式
def chooseBestFeatureToSplit(dataSet):
numFeatures = len(dataSet[0])-1 #求屬性的個(gè)數(shù)
baseEntropy = calcShannonEnt(dataSet)
bestInfoGain = 0.0; bestFeature = -1
for i in range(numFeatures): #求所有屬性的信息增益
featList = [example[i] for example in dataSet]
uniqueVals = set(featList) #第i列屬性的取值(不同值)數(shù)集合
newEntropy = 0.0
splitInfo = 0.0;
for value in uniqueVals: #求第i列屬性每個(gè)不同值的熵*他們的概率
subDataSet = splitDataSet(dataSet, i , value)
prob = len(subDataSet)/float(len(dataSet)) #求出該值在i列屬性中的概率
newEntropy += prob * calcShannonEnt(subDataSet) #求i列屬性各值對(duì)于的熵求和
splitInfo -= prob * log(prob, 2);
infoGain = (baseEntropy - newEntropy) / splitInfo; #求出第i列屬性的信息增益率
print infoGain;
if(infoGain > bestInfoGain): #保存信息增益率最大的信息增益率值以及所在的下表(列值i)
bestInfoGain = infoGain
bestFeature = i
return bestFeature
#找出出現(xiàn)次數(shù)最多的分類名稱
def majorityCnt(classList):
classCount = {}
for vote in classList:
if vote not in classCount.keys(): classCount[vote] = 0
classCount[vote] += 1
sortedClassCount = sorted(classCount.iteritems(), key = operator.itemgetter(1), reverse=True)
return sortedClassCount[0][0]
#創(chuàng)建樹(shù)
def createTree(dataSet, labels):
classList = [example[-1] for example in dataSet]; #創(chuàng)建需要?jiǎng)?chuàng)建樹(shù)的訓(xùn)練數(shù)據(jù)的結(jié)果列表(例如最外層的列表是[N, N, Y, Y, Y, N, Y])
if classList.count(classList[0]) == len(classList): #如果所有的訓(xùn)練數(shù)據(jù)都是屬于一個(gè)類別,則返回該類別
return classList[0];
if (len(dataSet[0]) == 1): #訓(xùn)練數(shù)據(jù)只給出類別數(shù)據(jù)(沒(méi)給任何屬性值數(shù)據(jù)),返回出現(xiàn)次數(shù)最多的分類名稱
return majorityCnt(classList);
bestFeat = chooseBestFeatureToSplit(dataSet); #選擇信息增益最大的屬性進(jìn)行分(返回值是屬性類型列表的下標(biāo))
bestFeatLabel = labels[bestFeat] #根據(jù)下表找屬性名稱當(dāng)樹(shù)的根節(jié)點(diǎn)
myTree = {bestFeatLabel:{}} #以bestFeatLabel為根節(jié)點(diǎn)建一個(gè)空樹(shù)
del(labels[bestFeat]) #從屬性列表中刪掉已經(jīng)被選出來(lái)當(dāng)根節(jié)點(diǎn)的屬性
featValues = [example[bestFeat] for example in dataSet] #找出該屬性所有訓(xùn)練數(shù)據(jù)的值(創(chuàng)建列表)
uniqueVals = set(featValues) #求出該屬性的所有值得集合(集合的元素不能重復(fù))
for value in uniqueVals: #根據(jù)該屬性的值求樹(shù)的各個(gè)分支
subLabels = labels[:]
myTree[bestFeatLabel][value] = createTree(splitDataSet(dataSet, bestFeat, value), subLabels) #根據(jù)各個(gè)分支遞歸創(chuàng)建樹(shù)
return myTree #生成的樹(shù)
#實(shí)用決策樹(shù)進(jìn)行分類
def classify(inputTree, featLabels, testVec):
firstStr = inputTree.keys()[0]
secondDict = inputTree[firstStr]
featIndex = featLabels.index(firstStr)
for key in secondDict.keys():
if testVec[featIndex] == key:
if type(secondDict[key]).__name__ == 'dict':
classLabel = classify(secondDict[key], featLabels, testVec)
else: classLabel = secondDict[key]
return classLabel
#讀取數(shù)據(jù)文檔中的訓(xùn)練數(shù)據(jù)(生成二維列表)
def createTrainData():
lines_set = open('../data/ID3/Dataset.txt').readlines()
labelLine = lines_set[2];
labels = labelLine.strip().split()
lines_set = lines_set[4:11]
dataSet = [];
for line in lines_set:
data = line.split();
dataSet.append(data);
return dataSet, labels
#讀取數(shù)據(jù)文檔中的測(cè)試數(shù)據(jù)(生成二維列表)
def createTestData():
lines_set = open('../data/ID3/Dataset.txt').readlines()
lines_set = lines_set[15:22]
dataSet = [];
for line in lines_set:
data = line.strip().split();
dataSet.append(data);
return dataSet
myDat, labels = createTrainData()
myTree = createTree(myDat,labels)
print myTree
bootList = ['outlook','temperature', 'humidity', 'windy'];
testList = createTestData();
for testData in testList:
dic = classify(myTree, bootList, testData)
print dic
五、C4.5與ID3的代碼區(qū)別

如上圖,C4.5主要在第52、53行代碼與ID3不同(ID3求的是信息增益,C4.5求的是信息增益率)。
六、訓(xùn)練、測(cè)試數(shù)據(jù)集樣例
訓(xùn)練集: outlook temperature humidity windy --------------------------------------------------------- sunny hot high false N sunny hot high true N overcast hot high false Y rain mild high false Y rain cool normal false Y rain cool normal true N overcast cool normal true Y 測(cè)試集 outlook temperature humidity windy ----------------------------------------------- sunny mild high false sunny cool normal false rain mild normal false sunny mild normal true overcast mild high true overcast hot normal false rain mild high true
以上這篇python實(shí)現(xiàn)決策樹(shù)C4.5算法詳解(在ID3基礎(chǔ)上改進(jìn))就是小編分享給大家的全部?jī)?nèi)容了,希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。
- python實(shí)現(xiàn)ID3決策樹(shù)算法
- python實(shí)現(xiàn)C4.5決策樹(shù)算法
- Python實(shí)現(xiàn)決策樹(shù)C4.5算法的示例
- python實(shí)現(xiàn)決策樹(shù)ID3算法的示例代碼
- Python決策樹(shù)和隨機(jī)森林算法實(shí)例詳解
- Python決策樹(shù)分類算法學(xué)習(xí)
- Python機(jī)器學(xué)習(xí)之決策樹(shù)算法
- python實(shí)現(xiàn)決策樹(shù)分類算法
- python代碼實(shí)現(xiàn)ID3決策樹(shù)算法
- python決策樹(shù)之C4.5算法詳解
- python實(shí)現(xiàn)ID3決策樹(shù)算法
- Python機(jī)器學(xué)習(xí)之決策樹(shù)算法實(shí)例詳解
- 基于ID3決策樹(shù)算法的實(shí)現(xiàn)(Python版)
- 解讀python如何實(shí)現(xiàn)決策樹(shù)算法
相關(guān)文章
Python實(shí)現(xiàn)RLE格式與PNG格式互轉(zhuǎn)
在機(jī)器視覺(jué)領(lǐng)域的深度學(xué)習(xí)中,很多數(shù)據(jù)集的標(biāo)注文件使用RLE的格式。但是神經(jīng)網(wǎng)絡(luò)的輸入一定是一張圖片,為此必須把RLE格式的文件轉(zhuǎn)變?yōu)閳D像格式。本文將利用Python實(shí)現(xiàn)RLE格式與PNG格式互轉(zhuǎn),感興趣的可以了解一下2022-08-08
Flask框架實(shí)現(xiàn)的前端RSA加密與后端Python解密功能詳解
這篇文章主要介紹了Flask框架實(shí)現(xiàn)的前端RSA加密與后端Python解密功能,結(jié)合實(shí)例形式詳細(xì)分析了flask框架前端使用jsencrypt.js加密與后端Python解密相關(guān)操作技巧,需要的朋友可以參考下2019-08-08
基于TensorFlow的CNN實(shí)現(xiàn)Mnist手寫(xiě)數(shù)字識(shí)別
這篇文章主要為大家詳細(xì)介紹了基于TensorFlow的CNN實(shí)現(xiàn)Mnist手寫(xiě)數(shù)字識(shí)別,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下2020-06-06
在Python中預(yù)先初始化列表內(nèi)容和長(zhǎng)度的實(shí)現(xiàn)
今天小編就為大家分享一篇在Python中預(yù)先初始化列表內(nèi)容和長(zhǎng)度的實(shí)現(xiàn),具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2019-11-11
Python readline()和readlines()函數(shù)實(shí)現(xiàn)按行讀取文件
本文主要介紹了Python readline()和readlines()函數(shù)實(shí)現(xiàn)按行讀取文件,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2023-02-02
Python?pygame派生精靈和精靈組創(chuàng)建敵機(jī)
這篇文章主要為大家介紹了Python?pygame派生精靈和精靈組創(chuàng)建敵機(jī)示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2022-08-08
Python趣味挑戰(zhàn)之教你用pygame畫(huà)進(jìn)度條
pygame四種方法教會(huì)你畫(huà)進(jìn)度條,其實(shí)也不難,文中有非常詳細(xì)的代碼示例,對(duì)正在學(xué)習(xí)python的小伙伴們很有幫助,需要的朋友可以參考下2021-05-05
Python實(shí)現(xiàn)尋找回文數(shù)字過(guò)程解析
這篇文章主要介紹了Python實(shí)現(xiàn)尋找回文數(shù)字過(guò)程解析,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下2020-06-06
Python Opencv中基礎(chǔ)的知識(shí)點(diǎn)
這篇文章主要介紹了Python Opencv中基礎(chǔ)的知識(shí)點(diǎn),主要包括創(chuàng)建窗口、保存圖片、采集視頻、鼠標(biāo)控制的代碼,代碼簡(jiǎn)單易懂,對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下2022-07-07

