最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python數(shù)據(jù)分析之真實(shí)IP請(qǐng)求Pandas詳解

 更新時(shí)間:2016年11月18日 11:16:41   投稿:daisy  
這篇文章主要給大家介紹了Python數(shù)據(jù)分析之真實(shí)IP請(qǐng)求Pandas,文中通過示例嗲嗎給大家介紹的很詳細(xì),相信對(duì)大家的學(xué)習(xí)或者理解具有一定的參考借鑒價(jià)值,有需要的朋友們可以參考借鑒,下面來一起學(xué)習(xí)學(xué)習(xí)吧。

前言

pandas 是基于 Numpy 構(gòu)建的含有更高級(jí)數(shù)據(jù)結(jié)構(gòu)和工具的數(shù)據(jù)分析包類似于 Numpy 的核心是 ndarray,pandas 也是圍繞著 Series 和 DataFrame 兩個(gè)核心數(shù)據(jù)結(jié)構(gòu)展開的 。Series 和 DataFrame 分別對(duì)應(yīng)于一維的序列和二維的表結(jié)構(gòu)。pandas 約定俗成的導(dǎo)入方法如下:

from pandas import Series,DataFrame
import pandas as pd

1.1. Pandas分析步驟

    1、載入日志數(shù)據(jù)

    2、載入area_ip數(shù)據(jù)

    3、將 real_ip 請(qǐng)求數(shù) 進(jìn)行 COUNT。類似如下SQL:

SELECT inet_aton(l.real_ip),
  count(*),
  a.addr
FROM log AS l
INNER JOIN area_ip AS a
  ON a.start_ip_num <= inet_aton(l.real_ip)
  AND a.end_ip_num >= inet_aton(l.real_ip)
GROUP BY real_ip
ORDER BY count(*)
LIMIT 0, 100;

1.2. 代碼

cat pd_ng_log_stat.py
#!/usr/bin/env python
#-*- coding: utf-8 -*-
 
from ng_line_parser import NgLineParser
 
import pandas as pd
import socket
import struct
 
class PDNgLogStat(object):
 
  def __init__(self):
    self.ng_line_parser = NgLineParser()
 
  def _log_line_iter(self, pathes):
    """解析文件中的每一行并生成一個(gè)迭代器"""
    for path in pathes:
      with open(path, 'r') as f:
        for index, line in enumerate(f):
          self.ng_line_parser.parse(line)
          yield self.ng_line_parser.to_dict()
 
  def _ip2num(self, ip):
    """用于IP轉(zhuǎn)化為數(shù)字"""
    ip_num = -1
    try:
      # 將IP轉(zhuǎn)化成INT/LONG 數(shù)字
      ip_num = socket.ntohl(struct.unpack("I",socket.inet_aton(str(ip)))[0])
    except:
      pass
    finally:
      return ip_num
 
  def _get_addr_by_ip(self, ip):
    """通過給的IP獲得地址"""
    ip_num = self._ip2num(ip)
 
    try:
      addr_df = self.ip_addr_df[(self.ip_addr_df.ip_start_num <= ip_num) & 
                   (ip_num <= self.ip_addr_df.ip_end_num)]
      addr = addr_df.at[addr_df.index.tolist()[0], 'addr']
      return addr
    except:
      return None
           
  def load_data(self, path):
    """通過給的文件路徑加載數(shù)據(jù)生成 DataFrame"""
    self.df = pd.DataFrame(self._log_line_iter(path))
 
 
  def uv_real_ip(self, top = 100):
    """統(tǒng)計(jì)cdn ip量"""
    group_by_cols = ['real_ip'] # 需要分組的列,只計(jì)算和顯示該列
     
    # 直接統(tǒng)計(jì)次數(shù)
    url_req_grp = self.df[group_by_cols].groupby(
                   self.df['real_ip'])
    return url_req_grp.agg(['count'])['real_ip'].nlargest(top, 'count')
     
  def uv_real_ip_addr(self, top = 100):
    """統(tǒng)計(jì)real ip 地址量"""
    cnt_df = self.uv_real_ip(top)
 
    # 添加 ip 地址 列
    cnt_df.insert(len(cnt_df.columns),
           'addr',
           cnt_df.index.map(self._get_addr_by_ip))
    return cnt_df
     
  def load_ip_addr(self, path):
    """加載IP"""
    cols = ['id', 'ip_start_num', 'ip_end_num',
        'ip_start', 'ip_end', 'addr', 'operator']
    self.ip_addr_df = pd.read_csv(path, sep='\t', names=cols, index_col='id')
    return self.ip_addr_df
 
def main():
  file_pathes = ['www.ttmark.com.access.log']
 
  pd_ng_log_stat = PDNgLogStat()
  pd_ng_log_stat.load_data(file_pathes)
 
  # 加載 ip 地址
  area_ip_path = 'area_ip.csv'
  pd_ng_log_stat.load_ip_addr(area_ip_path)
 
  # 統(tǒng)計(jì) 用戶真實(shí) IP 訪問量 和 地址
  print pd_ng_log_stat.uv_real_ip_addr()
 
if __name__ == '__main__':
  main()

運(yùn)行統(tǒng)計(jì)和輸出結(jié)果

python pd_ng_log_stat.py
 
         count  addr
real_ip            
60.191.123.80  101013 浙江省杭州市
-        32691  None
218.30.118.79  22523   北京市
......
136.243.152.18   889   德國
157.55.39.219   889   美國
66.249.65.170   888   美國
 
[100 rows x 2 columns]

總結(jié)

以上就是這篇文章的全部?jī)?nèi)容了,希望本文的內(nèi)容對(duì)大家的學(xué)習(xí)或者工作帶來一定的幫助,如果有疑問大家可以留言交流。

相關(guān)文章

  • Python使用gRPC實(shí)現(xiàn)數(shù)據(jù)分析能力的共享

    Python使用gRPC實(shí)現(xiàn)數(shù)據(jù)分析能力的共享

    gRPC是一個(gè)高性能、開源、通用的遠(yuǎn)程過程調(diào)用(RPC)框架,由Google推出,本文主要介紹了Python如何使用gRPC實(shí)現(xiàn)數(shù)據(jù)分析能力的共享,感興趣的可以了解下
    2024-02-02
  • Python?statistics模塊示例詳解

    Python?statistics模塊示例詳解

    這篇文章主要介紹了Python?statistics模塊示例詳解,本文總結(jié)了 statistics 模塊的常規(guī)操作,對(duì)于數(shù)據(jù)分析還是非常有益處的,需要的朋友可以參考下
    2023-05-05
  • Python獲取網(wǎng)頁數(shù)據(jù)詳解流程

    Python獲取網(wǎng)頁數(shù)據(jù)詳解流程

    讀萬卷書不如行萬里路,只學(xué)書上的理論是遠(yuǎn)遠(yuǎn)不夠的,只有在實(shí)戰(zhàn)中才能獲得能力的提升,本篇文章手把手帶你用Python來獲取網(wǎng)頁的數(shù)據(jù),主要應(yīng)用了Requests庫,大家可以在過程中查缺補(bǔ)漏,提升水平
    2021-10-10
  • Python讀寫yaml文件

    Python讀寫yaml文件

    這篇文章主要介紹了Python讀寫yaml文件,yaml?是專門用來寫配置文件的語言,非常簡(jiǎn)潔和強(qiáng)大,之前用ini也能寫配置文件,有點(diǎn)類似于json格式,下面關(guān)于Python讀寫yaml文件的詳細(xì)資料,需要的小伙伴可以參考一下
    2022-03-03
  • Python對(duì)Excel按列值篩選并拆分表格到多個(gè)文件的代碼

    Python對(duì)Excel按列值篩選并拆分表格到多個(gè)文件的代碼

    這篇文章主要介紹了Python對(duì)Excel按列值篩選并拆分表格到多個(gè)文件,本文通過代碼給大家介紹的非常詳細(xì),需要的朋友可以參考下
    2019-11-11
  • Python中列表的高級(jí)索引技巧分享

    Python中列表的高級(jí)索引技巧分享

    列表是?Python?中最常用的數(shù)據(jù)結(jié)構(gòu)之一,它允許你存儲(chǔ)多個(gè)元素,并且可以通過索引來訪問這些元素,本文將帶你深入了解?Python?列表的高級(jí)索引技巧,希望對(duì)大家有所幫助
    2025-01-01
  • Python實(shí)現(xiàn)針對(duì)中文排序的方法

    Python實(shí)現(xiàn)針對(duì)中文排序的方法

    這篇文章主要介紹了Python實(shí)現(xiàn)針對(duì)中文排序的方法,結(jié)合實(shí)例形式較為詳細(xì)的分析了Python針對(duì)中文進(jìn)行排序操作出現(xiàn)的問題與相關(guān)處理技巧,需要的朋友可以參考下
    2017-05-05
  • 詳解python多線程之間的同步(一)

    詳解python多線程之間的同步(一)

    這篇文章主要介紹了python多線程之間的同步,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-04-04
  • Python異常處理例題整理

    Python異常處理例題整理

    在本篇文章里
    2019-07-07
  • python讀取raw binary圖片并提取統(tǒng)計(jì)信息的實(shí)例

    python讀取raw binary圖片并提取統(tǒng)計(jì)信息的實(shí)例

    今天小編就為大家分享一篇python讀取raw binary圖片并提取統(tǒng)計(jì)信息的實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過來看看吧
    2020-01-01

最新評(píng)論

曲阜市| 宁国市| 永济市| 滨州市| 会昌县| 宜宾市| 丰台区| 绥宁县| 晋宁县| 合作市| 杭州市| 黄山市| 沂水县| 阳信县| 临海市| 平山县| 宜川县| 洛隆县| 五华县| 泗洪县| 淳安县| 翼城县| 勐海县| 芜湖县| 松江区| 宣化县| 类乌齐县| 洛隆县| 郑州市| 甘泉县| 靖州| 马公市| 延安市| 长乐市| 故城县| 南川市| 垫江县| 左权县| 济阳县| 板桥市| 瑞丽市|