最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

python數(shù)據(jù)預(yù)處理 :數(shù)據(jù)抽樣解析

 更新時(shí)間:2020年02月24日 14:47:56   作者:泛泛之素  
這篇文章主要介紹了python數(shù)據(jù)預(yù)處理 :數(shù)據(jù)抽樣解析,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧

何為數(shù)據(jù)抽樣:

抽樣是數(shù)據(jù)處理的一種基本方法,常常伴隨著計(jì)算資源不足、獲取全部數(shù)據(jù)困難、時(shí)效性要求等情況使用。

抽樣方法:

一般有四種方法:

隨機(jī)抽樣 直接從整體數(shù)據(jù)中等概率抽取n個(gè)樣本。這種方法優(yōu)勢是,簡單、好操作、適用于分布均勻的場景;缺點(diǎn)是總體大時(shí)無法一一編號

系統(tǒng)抽樣 又稱機(jī)械、等距抽樣,將總體中個(gè)體按順序進(jìn)行編號,然后計(jì)算出間隔,再按照抽樣間隔抽取個(gè)體。優(yōu)勢,易于理解、簡便易行。缺點(diǎn)是,如有明顯分布規(guī)律時(shí)容易產(chǎn)生偏差。

群體抽樣 總體分群,在隨機(jī)抽取幾個(gè)小群代表總體。優(yōu)點(diǎn)是簡單易行、便與組織;缺點(diǎn)是群體劃分容易造成誤差

分層抽樣 先按照觀察指標(biāo)影響較大的某一種特征,將總體分若干個(gè)類別,再從每一層隨機(jī)抽取一定數(shù)量的單位合并成總體。優(yōu)點(diǎn)樣本代表性好,少誤差

以上四種基本抽樣方法都屬單階段抽樣,實(shí)際應(yīng)用中常根據(jù)實(shí)際情況將整個(gè)抽樣過程分為若干階段來進(jìn)行,稱為多階段抽樣。

各種抽樣方法的抽樣誤差一般是:整群抽樣≥單純隨機(jī)抽樣≥系統(tǒng)抽樣≥分層抽樣

python代碼實(shí)現(xiàn)

import random
import numpy as np
import pandas as pd

# 導(dǎo)入數(shù)據(jù)
df = pd.read_csv('https://raw.githubusercontent.com/ffzs/dataset/master/glass.csv')

df.index.size
# 214

##########隨機(jī)抽樣##########
#
# 使用pandas
# DataFrame.sample(n=None, frac=None, replace=False, weights=None, random_state=None, axis=None)
# n是要抽取的行數(shù)。(例如n=20000時(shí),抽取其中的2W行)
# frac是抽取的比列。(有一些時(shí)候,我們并對具體抽取的行數(shù)不關(guān)系,我們想抽取其中的百分比,這個(gè)時(shí)候就可以選擇使用frac,例如frac=0.8,就是抽取其中80%)
# replace:是否為有放回抽樣,取replace=True時(shí)為有放回抽樣。
# weights這個(gè)是每個(gè)樣本的權(quán)重,具體可以看官方文檔說明。
# random_state這個(gè)在之前的文章已經(jīng)介紹過了。
# axis是選擇抽取數(shù)據(jù)的行還是列。axis=0的時(shí)是抽取行,axis=1時(shí)是抽取列(也就是說axis=1時(shí),在列中隨機(jī)抽取n列,在axis=0時(shí),在行中隨機(jī)抽取n行)

df_0 = df.sample(n=20, replace=True)
df_0.index.size
# 20

# 數(shù)據(jù)準(zhǔn)備
data = df.values
# 使用random
data_sample = random.sample(list(data), 20)
len(data_sample)
# 20

##########等距抽樣##########
# 指定抽樣數(shù)量
sample_count = 50
# 獲取最大樣本量
record_count = data.shape[0]
# 抽樣間距
width = record_count//sample_count
data_sample = []
i = 0
# 本量小于等于指定抽樣數(shù)量并且矩陣索引在有效范圍內(nèi)是
while len(data_sample) <= sample_count and i * width <= record_count -1:
  data_sample.append(data[i*width])
  i += 1
len(data_sample)
# 51

##########分層抽樣##########
# 數(shù)據(jù)只是隨便找的分層僅限于演示
# 定義每個(gè)分層的抽樣數(shù)量
each_sample_count = 6
# 定義分層值域
label_data_unique = np.unique(data[:, -1])
# 定義一些數(shù)據(jù)
sample_list, sample_data, sample_dict = [], [], {}
# 遍歷每個(gè)分層標(biāo)簽
for label_data in label_data_unique:
  for data_tmp in data: # 讀取每條數(shù)據(jù)
    if data_tmp[-1] == label_data:
      sample_list.append(data_tmp)
  # 對每層數(shù)據(jù)都數(shù)據(jù)抽樣
  each_sample_data = random.sample(sample_list, each_sample_count)
  sample_data.extend(each_sample_data)
  sample_dict[label_data] = len(each_sample_data)
sample_dict
# {1.0: 6, 2.0: 6, 3.0: 6, 5.0: 6, 6.0: 6, 7.0: 6}

##########整群抽樣##########
# 數(shù)據(jù)分群僅限于演示,不符合實(shí)際情況
# 定義整群的標(biāo)簽
label_data_unique = np.unique(data[:, -1])
# 隨機(jī)抽取2個(gè)群
sample_label = random.sample(list(label_data_unique), 2)
# 定義空列表
sample_data = []
# 遍歷每個(gè)整群標(biāo)簽值域
for each_label in sample_label:
  for data_tmp in data:
    if data_tmp[-1] == each_label:
      sample_data.append(data_tmp)
len(sample_data)
# 83

需要注意的問題

數(shù)據(jù)抽樣過程中要注意一些問題

數(shù)據(jù)時(shí)效性 不能用過時(shí)的數(shù)據(jù)來分析現(xiàn)在的運(yùn)營狀態(tài)

關(guān)鍵因素?cái)?shù)據(jù) 整體數(shù)據(jù)的關(guān)鍵性數(shù)據(jù)必須要在模型中,如雙十一帶來的銷售增長

業(yè)務(wù)隨機(jī)性 抽樣數(shù)據(jù)要使各個(gè)場景的數(shù)據(jù)分布均衡

數(shù)據(jù)來源多樣性 數(shù)據(jù)覆蓋要全面

抽樣數(shù)據(jù)量問題

時(shí)間分布 能包含業(yè)務(wù)周期。月銷售預(yù)測,至少包含12個(gè)月數(shù)據(jù);時(shí)間還要考慮季節(jié)、節(jié)假日、特定促銷日等周期性。

做預(yù)測分析 考慮特征數(shù)據(jù)和特征值域的分布,通常數(shù)據(jù)記錄要同時(shí)是特征數(shù)量和特征值域的100倍以上。例如數(shù)據(jù)集有5個(gè)特征值,每個(gè)特征有2個(gè)值域,那么數(shù)據(jù)記錄數(shù)需要至少1000(10052)條以上

做關(guān)聯(lián)規(guī)則分析 根據(jù)關(guān)聯(lián)前后項(xiàng)數(shù)量(每個(gè)前項(xiàng)或后項(xiàng)可包含多個(gè)要關(guān)聯(lián)的主體,例如品牌+商品+價(jià)格關(guān)聯(lián)),每個(gè)主體需要至少1000條數(shù)據(jù)。例如只做單品銷售關(guān)聯(lián),那么單品的銷售記錄需要在1000條以上;如果要同時(shí)做單品+品牌的關(guān)聯(lián),那么需要至少2000條數(shù)據(jù)。

異常檢測 無論是監(jiān)督室還是非監(jiān)督式建模,對于異常數(shù)據(jù)本來就是小概率分布的,因此異常數(shù)據(jù)記錄一般越多越好。

以上這篇python數(shù)據(jù)預(yù)處理 :數(shù)據(jù)抽樣解析就是小編分享給大家的全部內(nèi)容了,希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python實(shí)戰(zhàn)之生成有關(guān)聯(lián)單選問卷

    Python實(shí)戰(zhàn)之生成有關(guān)聯(lián)單選問卷

    這篇文章主要為大家分享了一個(gè)Python實(shí)戰(zhàn)小案例——生成有關(guān)聯(lián)單選問卷,并且能根據(jù)問卷總分?jǐn)?shù)生成對應(yīng)判斷文案結(jié)果,感興趣的可以了解一下
    2023-04-04
  • 關(guān)于Python中的同步異步阻塞與非阻塞

    關(guān)于Python中的同步異步阻塞與非阻塞

    這篇文章主要介紹了關(guān)于Python中的同步異步阻塞與非阻塞,具有一定的參考價(jià)值,有需要的朋友可以看一下
    2023-03-03
  • keras 權(quán)重保存和權(quán)重載入方式

    keras 權(quán)重保存和權(quán)重載入方式

    這篇文章主要介紹了keras 權(quán)重保存和權(quán)重載入方式,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-05-05
  • win10系統(tǒng)中安裝scrapy-1.1

    win10系統(tǒng)中安裝scrapy-1.1

    在win10的環(huán)境下安裝scrapy,并不能直接按照官網(wǎng)的手冊(http://doc.scrapy.org/en/1.0/intro/install.html)一次性安裝成功,根據(jù)我自己的安裝過程中遇到的問題,特意整理了一下安裝過程
    2016-07-07
  • Python使用paramiko操作linux的方法講解

    Python使用paramiko操作linux的方法講解

    今天小編就為大家分享一篇關(guān)于Python使用paramiko操作linux的方法講解,小編覺得內(nèi)容挺不錯(cuò)的,現(xiàn)在分享給大家,具有很好的參考價(jià)值,需要的朋友一起跟隨小編來看看吧
    2019-02-02
  • python中adb有什么功能

    python中adb有什么功能

    在本篇文章里小編給大家分享的是關(guān)于python中adb有功能的知識點(diǎn)總結(jié),有需要的可以跟著學(xué)習(xí)下。
    2020-06-06
  • 一文帶你了解Python中的字符串是什么

    一文帶你了解Python中的字符串是什么

    通過本文帶你了解Python中的字符串是什么,本文給大家介紹的非常詳細(xì),具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2018-11-11
  • Python unittest框架操作實(shí)例解析

    Python unittest框架操作實(shí)例解析

    這篇文章主要介紹了Python unittest框架操作實(shí)例解析,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-04-04
  • Python中常見內(nèi)置函數(shù)的用法合集

    Python中常見內(nèi)置函數(shù)的用法合集

    本文將從基礎(chǔ)到高級,詳細(xì)介紹Python中常見的內(nèi)置函數(shù),通過代碼示例和中文注釋,幫助您深入理解如何在不同情景下靈活應(yīng)用這些函數(shù),需要的可以學(xué)習(xí)一下
    2023-09-09
  • python 讀取dicom文件,生成info.txt和raw文件的方法

    python 讀取dicom文件,生成info.txt和raw文件的方法

    今天小編就為大家分享一篇python 讀取dicom文件,生成info.txt和raw文件的方法,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-01-01

最新評論

平乡县| 达日县| 岳普湖县| 武隆县| 麻阳| 柳江县| 青浦区| 河池市| 靖江市| 仪征市| 东平县| 杂多县| 阿拉善左旗| 神池县| 太湖县| 十堰市| 中方县| 宁武县| 丽水市| 赣榆县| 南通市| 澜沧| 建阳市| 阳城县| 即墨市| 平安县| 昭苏县| 黄平县| 荃湾区| 都安| 隆尧县| 响水县| 涿州市| 互助| 政和县| 夹江县| 台湾省| 永宁县| 通化市| 丰原市| 改则县|