最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

淺談dataframe兩列相乘構造新特征

 更新時間:2021年05月18日 11:40:00   作者:所念皆山海  
這篇文章主要介紹了dataframe兩列相乘構造新特征,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧

假如我們要構建新特征b

目的是從a中篩選出數(shù)值在4~6之間的數(shù)據(jù),如果符合就是True,否則就是False。

那么代碼如下

import pandas as pd
lists=pd.DataFrame({'a':[1,2,3,4,5,6,7,8,9]})
lists['b']=(lists['a']<6).mul(lists['a']>4)

補充:dataframe求兩列的相乘,再將輸出為新的一列

看代碼吧~

df["new"]=df3["rate"]*df3["duration"]

new為新的一列的列名

rate和duration為需要相乘的列

加,減,乘,除都適用!

補充:DataFrame衍生新特征操作

1.DataFrame中某一列的值衍生為新的特征

#將LBL1特征的值衍生為one-hot形式的新特征
piao=df_train_log.LBL1.value_counts().index
#先構造一個臨時的df
df_tmp=pd.DataFrame({'USRID':df_train_log.drop_duplicates('USRID').USRID.values})
#將所有的新特征列都置為0
for i in piao:
    df_tmp['PIAO_'+i]=0
#進行分組便利,有這個特征就置為1,原數(shù)據(jù)每個USRID有多條記錄,所以分組統(tǒng)計
group=df_train_log.groupby(['USRID'])
for k in group.groups.keys():
    t = group.get_group(k)
    id=t.USRID.value_counts().index[0]
    tmp_list=t.LBL1.value_counts().index
    for j in tmp_list:
        df_tmp['PIAO_'+j].loc[df_tmp.USRID==id]=1

2.分組統(tǒng)計,選出同一USRID下該變量中出現(xiàn)次數(shù)最多的值項

group=df_train_log.groupby(['USRID'])
lt=[]
list_max_lbl1=[]
list_max_lbl2=[]
list_max_lbl3=[]
for k in group.groups.keys():
    t = group.get_group(k)
    #通過value_counts找出出現(xiàn)次數(shù)最多的項
    argmx = np.argmax(t['EVT_LBL'].value_counts())
    lbl1_max=np.argmax(t['LBL1'].value_counts())
    lbl2_max=np.argmax(t['LBL2'].value_counts())
    lbl3_max=np.argmax(t['LBL3'].value_counts())
    list_max_lbl1.append(lbl1_max)
    list_max_lbl2.append(lbl2_max)
    list_max_lbl3.append(lbl3_max)
    #只留下出現(xiàn)次數(shù)最多的項
    c = t[t['EVT_LBL']==argmx].drop_duplicates('EVT_LBL')
    #放入list中
    lt.append(c)
#構造一個新的df
df_train_log_new = pd.concat(lt)
#另外又構造了三個特征,LBL1-LBL3分別出現(xiàn)次數(shù)最多的項
df_train_log_new['LBL1_MAX']=list_max_lbl1
df_train_log_new['LBL2_MAX']=list_max_lbl2
df_train_log_new['LBL3_MAX']=list_max_lbl3

3.衍生出某天是否發(fā)生的ont-hot新特征

#創(chuàng)造臨時df,星期三,星期六,星期七,都默認置為0
df_day=pd.DataFrame({'USRID':df_train_log.drop_duplicates('USRID').USRID.values})
df_day['weekday_3']=0
df_day['weekday_6']=0
df_day['weekday_7']=0
#分組統(tǒng)計,有就置為1,沒有置為0
group=df_train_log.groupby(['USRID'])
for k in group.groups.keys():
    t = group.get_group(k)
    id=t.USRID.value_counts().index[0]
    tmp_list=t.occ_dayofweek.value_counts().index
    for j in tmp_list:
        if j==3:
            df_day['weekday_3'].loc[df_tmp.USRID==id]=1
        elif j==6:
            df_day['weekday_6'].loc[df_tmp.USRID==id]=1
        elif j==7:
            df_day['weekday_7'].loc[df_tmp.USRID==id]=1

4.查看用戶一共停留在APP上多少秒,共有幾天看了APP

#首先將日期轉化為時間戳,并賦予一個新特征
tmp_list=[]
for i in df_train_log.OCC_TIM:
    d=datetime.datetime.strptime(str(i),"%Y-%m-%d %H:%M:%S")
    evt_time = time.mktime(d.timetuple())
    tmp_list.append(evt_time)
df_train_log['time']=tmp_list
#每下一行減去上一行,得到app停留時間
df_train_log['diff_time']=df_train_log.time-df_train_log.time.shift(1)
#構造一個新的dataFrame,分組得到查看app的天數(shù)
df_time=pd.DataFrame({'USRID':df_train_log.drop_duplicates('USRID').USRID.values})
#有幾天查看
df_time['days']=0
group=df_train_log.groupby(['USRID'])
for k in group.groups.keys():
    t = group.get_group(k)
    id=set(t.USRID).pop()
    df_time['days'].loc[df_time.USRID==id]= len(t.occ_day.value_counts().index)
#去掉一些異常時間戳,比如間隔兩天的相減,肯定不合適,na的也去掉了
df_train_log=df_train_log[(df_train_log.diff_time>0)&(df_train_log.diff_time<8000)]
#累計停留時間
group_stayTime=df_train_log['diff_time'].groupby(df_train_log['USRID']).sum()
#創(chuàng)造新的df
df_tmp=pd.DataFrame({'USRID':list(group_stayTime.index.values),'stay_time':list(group_stayTime.values)})
#合并成一個新的df
df=pd.merge(df_time,df_tmp,on=['USRID'],how='left')#合并后,缺失的停留時間,置為0df.fillna(0,axis=1,inplace=True)

以上為個人經(jīng)驗,希望能給大家一個參考,也希望大家多多支持腳本之家。

相關文章

  • Python字典的基礎操作

    Python字典的基礎操作

    這篇文章主要介紹了Python字典的基礎操作,Python中的字典數(shù)據(jù)類型和現(xiàn)實中的字典很像,它是以鍵值對(鍵和值的組合)的方式把數(shù)據(jù)組織到一起,可以通過鍵找到與之對應的值并進行操作,下面來看文章金額提內(nèi)容吧,需要的朋友可以參考一下
    2021-11-11
  • Python生成requirements.txt的三種方法

    Python生成requirements.txt的三種方法

    requirements.txt?文件通常用于列出項目所需的所有Python包及其版本,本文主要介紹了Python生成requirements.txt的三種方法,具有一定的參考價值,感興趣的可以了解一下
    2024-07-07
  • Python 專題五 列表基礎知識(二維list排序、獲取下標和處理txt文本實例)

    Python 專題五 列表基礎知識(二維list排序、獲取下標和處理txt文本實例)

    本文主要簡單的介紹使用Python處理txt漢字文字、二維列表排序和獲取list下標的相關知識。具有很好的參考價值,下面跟著小編一起來看下吧
    2017-03-03
  • Python保存MongoDB上的文件到本地的方法

    Python保存MongoDB上的文件到本地的方法

    這篇文章主要介紹了Python保存MongoDB上的文件到本地的方法,涉及Python調用pymongo模塊的gridfs方法來操作MongoDB文件的相關技巧,需要的朋友可以參考下
    2016-03-03
  • python中nuitka使用程序打包的實現(xiàn)

    python中nuitka使用程序打包的實現(xiàn)

    本文主要介紹了python中nuitka使用程序打包的實現(xiàn),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2025-04-04
  • Django 導出項目依賴庫到 requirements.txt過程解析

    Django 導出項目依賴庫到 requirements.txt過程解析

    這篇文章主要介紹了Django 導出項目依賴庫到 requirements.txt過程解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2019-08-08
  • 在Python的Flask框架中實現(xiàn)全文搜索功能

    在Python的Flask框架中實現(xiàn)全文搜索功能

    這篇文章主要介紹了在Python的Flask框架中實現(xiàn)全文搜索功能,這個基本的web功能實現(xiàn)起來非常簡單,需要的朋友可以參考下
    2015-04-04
  • django開發(fā)post接口簡單案例,獲取參數(shù)值的方法

    django開發(fā)post接口簡單案例,獲取參數(shù)值的方法

    今天小編就為大家分享一篇django開發(fā)post接口簡單案例,獲取參數(shù)值的方法,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-12-12
  • 人工智能學習Pytorch梯度下降優(yōu)化示例詳解

    人工智能學習Pytorch梯度下降優(yōu)化示例詳解

    這篇文章主要為大家介紹了人工智能學習Pytorch梯度下降優(yōu)化示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步早日升職加薪
    2021-11-11
  • pymysql模塊的操作實例

    pymysql模塊的操作實例

    在本篇文章里小編給大家分享的是關于pymysql模塊的簡單操作,有需要的朋友們可以參考下。
    2019-12-12

最新評論

丹巴县| 阳山县| 衡东县| 安西县| 梁河县| 英超| 肥乡县| 阳泉市| 基隆市| 玉田县| 冀州市| 林西县| 观塘区| 青铜峡市| 伊宁县| 廉江市| 龙海市| 桦川县| 方山县| 宜良县| 石棉县| 常山县| 秦安县| 娄底市| 卓资县| 合山市| 突泉县| 绵阳市| 广宗县| 佛坪县| 江源县| 道孚县| 定兴县| 柘荣县| 夏河县| 汤阴县| 岗巴县| 汶上县| 会理县| 葵青区| 林甸县|