最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python實(shí)現(xiàn)決策樹C4.5算法的示例

 更新時(shí)間:2018年05月30日 09:22:03   作者:WOTGL  
本篇文章主要介紹了Python實(shí)現(xiàn)決策樹C4.5算法的示例,詳解的介紹了決策樹C4.5算法的原理和實(shí)現(xiàn)代碼,非常具有實(shí)用價(jià)值,需要的朋友可以參考下

為什么要改進(jìn)成C4.5算法

原理

C4.5算法是在ID3算法上的一種改進(jìn),它與ID3算法最大的區(qū)別就是特征選擇上有所不同,一個(gè)是基于信息增益比,一個(gè)是基于信息增益。

之所以這樣做是因?yàn)樾畔⒃鲆鎯A向于選擇取值比較多的特征(特征越多,條件熵(特征劃分后的類別變量的熵)越小,信息增益就越大);因此在信息增益下面加一個(gè)分母,該分母是當(dāng)前所選特征的熵,注意:這里而不是類別變量的熵了。

這樣就構(gòu)成了新的特征選擇準(zhǔn)則,叫做信息增益比。為什么加了這樣一個(gè)分母就會(huì)消除ID3算法傾向于選擇取值較多的特征呢?

因?yàn)樘卣魅≈翟蕉啵撎卣鞯撵鼐驮酱?,分母也就越大,所以信息增益比就?huì)減小,而不是像信息增益那樣增大了,一定程度消除了算法對特征取值范圍的影響。

實(shí)現(xiàn)

在算法實(shí)現(xiàn)上,C4.5算法只是修改了信息增益計(jì)算的函數(shù)calcShannonEntOfFeature和最優(yōu)特征選擇函數(shù)chooseBestFeatureToSplit。

calcShannonEntOfFeature在ID3的calcShannonEnt函數(shù)上加了個(gè)參數(shù)feat,ID3中該函數(shù)只用計(jì)算類別變量的熵,而calcShannonEntOfFeature可以計(jì)算指定特征或者類別變量的熵。

chooseBestFeatureToSplit函數(shù)在計(jì)算好信息增益后,同時(shí)計(jì)算了當(dāng)前特征的熵IV,然后相除得到信息增益比,以最大信息增益比作為最優(yōu)特征。

在劃分?jǐn)?shù)據(jù)的時(shí)候,有可能出現(xiàn)特征取同一個(gè)值,那么該特征的熵為0,同時(shí)信息增益也為0(類別變量劃分前后一樣,因?yàn)樘卣髦挥幸粋€(gè)取值),0/0沒有意義,可以跳過該特征。

#coding=utf-8
import operator
from math import log
import time
import os, sys
import string

def createDataSet(trainDataFile):
 print trainDataFile
 dataSet = []
 try:
 fin = open(trainDataFile)
 for line in fin:
  line = line.strip()
  cols = line.split('\t')
  row = [cols[1], cols[2], cols[3], cols[4], cols[5], cols[6], cols[7], cols[8], cols[9], cols[10], cols[0]]
  dataSet.append(row)
  #print row
 except:
 print 'Usage xxx.py trainDataFilePath'
 sys.exit()
 labels = ['cip1', 'cip2', 'cip3', 'cip4', 'sip1', 'sip2', 'sip3', 'sip4', 'sport', 'domain']
 print 'dataSetlen', len(dataSet)
 return dataSet, labels

#calc shannon entropy of label or feature
def calcShannonEntOfFeature(dataSet, feat):
 numEntries = len(dataSet)
 labelCounts = {}
 for feaVec in dataSet:
 currentLabel = feaVec[feat]
 if currentLabel not in labelCounts:
  labelCounts[currentLabel] = 0
 labelCounts[currentLabel] += 1
 shannonEnt = 0.0
 for key in labelCounts:
 prob = float(labelCounts[key])/numEntries
 shannonEnt -= prob * log(prob, 2)
 return shannonEnt

def splitDataSet(dataSet, axis, value):
 retDataSet = []
 for featVec in dataSet:
 if featVec[axis] == value:
  reducedFeatVec = featVec[:axis]
  reducedFeatVec.extend(featVec[axis+1:])
  retDataSet.append(reducedFeatVec)
 return retDataSet
 
def chooseBestFeatureToSplit(dataSet):
 numFeatures = len(dataSet[0]) - 1 #last col is label
 baseEntropy = calcShannonEntOfFeature(dataSet, -1)
 bestInfoGainRate = 0.0
 bestFeature = -1
 for i in range(numFeatures):
 featList = [example[i] for example in dataSet]
 uniqueVals = set(featList)
 newEntropy = 0.0
 for value in uniqueVals:
  subDataSet = splitDataSet(dataSet, i, value)
  prob = len(subDataSet) / float(len(dataSet))
  newEntropy += prob *calcShannonEntOfFeature(subDataSet, -1) #calc conditional entropy
 infoGain = baseEntropy - newEntropy
    iv = calcShannonEntOfFeature(dataSet, i)
 if(iv == 0): #value of the feature is all same,infoGain and iv all equal 0, skip the feature
 continue
    infoGainRate = infoGain / iv
 if infoGainRate > bestInfoGainRate:
  bestInfoGainRate = infoGainRate
  bestFeature = i
 return bestFeature
  
#feature is exhaustive, reture what you want label
def majorityCnt(classList):
 classCount = {}
 for vote in classList:
 if vote not in classCount.keys():
  classCount[vote] = 0
 classCount[vote] += 1
 return max(classCount)  
 
def createTree(dataSet, labels):
 classList = [example[-1] for example in dataSet]
 if classList.count(classList[0]) ==len(classList): #all data is the same label
 return classList[0]
 if len(dataSet[0]) == 1: #all feature is exhaustive
 return majorityCnt(classList)
 bestFeat = chooseBestFeatureToSplit(dataSet)
 bestFeatLabel = labels[bestFeat]
 if(bestFeat == -1): #特征一樣,但類別不一樣,即類別與特征不相關(guān),隨機(jī)選第一個(gè)類別做分類結(jié)果
 return classList[0] 
 myTree = {bestFeatLabel:{}}
 del(labels[bestFeat])
 featValues = [example[bestFeat] for example in dataSet]
 uniqueVals = set(featValues)
 for value in uniqueVals:
 subLabels = labels[:]
 myTree[bestFeatLabel][value] = createTree(splitDataSet(dataSet, bestFeat, value),subLabels)
 return myTree
 
def main():
 if(len(sys.argv) < 3):
 print 'Usage xxx.py trainSet outputTreeFile'
 sys.exit()
 data,label = createDataSet(sys.argv[1])
 t1 = time.clock()
 myTree = createTree(data,label)
 t2 = time.clock()
 fout = open(sys.argv[2], 'w')
 fout.write(str(myTree))
 fout.close()
 print 'execute for ',t2-t1
if __name__=='__main__':
 main()

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

  • 基于Python制作簡單的井字棋游戲

    基于Python制作簡單的井字棋游戲

    這篇文章主要為大家詳細(xì)介紹了如何基于Python實(shí)現(xiàn)簡單的井字棋游戲,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2023-04-04
  • 使用Python通過win32 COM實(shí)現(xiàn)Word文檔的寫入與保存方法

    使用Python通過win32 COM實(shí)現(xiàn)Word文檔的寫入與保存方法

    今天小編就為大家分享一篇使用Python通過win32 COM實(shí)現(xiàn)Word文檔的寫入與保存方法,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-05-05
  • Pandas中DataFrame基本函數(shù)整理(小結(jié))

    Pandas中DataFrame基本函數(shù)整理(小結(jié))

    這篇文章主要介紹了Pandas中DataFrame基本函數(shù)整理(小結(jié)),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-07-07
  • Python數(shù)據(jù)可視化之matplotlib.pyplot繪圖的基本參數(shù)詳解

    Python數(shù)據(jù)可視化之matplotlib.pyplot繪圖的基本參數(shù)詳解

    matplotlib.pyplot模塊是一個(gè)功能強(qiáng)大的畫圖模塊,可以對畫圖的多個(gè)參數(shù)進(jìn)行調(diào)整,下面這篇文章主要給大家介紹了關(guān)于Python數(shù)據(jù)可視化之matplotlib.pyplot繪圖基本參數(shù)的相關(guān)資料,需要的朋友可以參考下
    2022-04-04
  • Python捕獲異常堆棧信息的幾種方法(小結(jié))

    Python捕獲異常堆棧信息的幾種方法(小結(jié))

    這篇文章主要介紹了Python捕獲異常堆棧信息的幾種方法,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-05-05
  • 解決tensorflow測試模型時(shí)NotFoundError錯(cuò)誤的問題

    解決tensorflow測試模型時(shí)NotFoundError錯(cuò)誤的問題

    今天小編就為大家分享一篇解決tensorflow測試模型時(shí)NotFoundError錯(cuò)誤的問題,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-07-07
  • python模塊之subprocess模塊級方法的使用

    python模塊之subprocess模塊級方法的使用

    這篇文章主要介紹了python模塊之subprocess模塊級方法的使用,小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2019-03-03
  • Python reques接口測試框架實(shí)現(xiàn)代碼

    Python reques接口測試框架實(shí)現(xiàn)代碼

    這篇文章主要介紹了Python reques接口測試框架實(shí)現(xiàn)代碼,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-07-07
  • Python實(shí)現(xiàn)多進(jìn)程共享數(shù)據(jù)的方法分析

    Python實(shí)現(xiàn)多進(jìn)程共享數(shù)據(jù)的方法分析

    這篇文章主要介紹了Python實(shí)現(xiàn)多進(jìn)程共享數(shù)據(jù)的方法,結(jié)合實(shí)例形式分析了Python多進(jìn)程共享數(shù)據(jù)的相關(guān)實(shí)現(xiàn)技巧,需要的朋友可以參考下
    2017-12-12
  • Python values()與itervalues()的用法詳解

    Python values()與itervalues()的用法詳解

    今天小編就為大家分享一篇Python values()與itervalues()的用法詳解,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-11-11

最新評論

栖霞市| 札达县| 阳高县| 安吉县| 安庆市| 朝阳市| 安平县| 洛隆县| 和平县| 获嘉县| 敖汉旗| 当雄县| 江北区| 东方市| 神池县| 长宁县| 兴城市| 博罗县| 磴口县| 京山县| 兴化市| 万宁市| 时尚| 云南省| 南澳县| 武清区| 祁门县| 定结县| 彭水| 文昌市| 宁陕县| 翼城县| 连江县| 米泉市| 陈巴尔虎旗| 长寿区| 秦安县| 蒙城县| 宜春市| 蕲春县| 辰溪县|