最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python實現提取和去除數據中包含關鍵詞的行

 更新時間:2023年08月01日 16:48:24   作者:上景  
這篇文章主要介紹了Python如何提取數據中包含關鍵詞的行已經如何去除數據中包含關鍵詞的行,文中的示例代碼講解詳細,需要的可以參考一下

幫對象處理所需數據時寫的代碼——第六彈(實現功能一:Python實現根據某列中找到的關鍵字從原始數據中過濾行,然后匹配到關鍵詞的行數據保存到新的 CSV 文件中;實現功能二:從原始數據中刪除“刪除的關鍵字”列中找到的任何關鍵字的行,然后將剩余數據保存到新的 CSV 文件中)

功能一:篩選出包含關鍵詞的行

第一節(jié) 讀取數據和設置

在這一部分中,代碼從兩個不同的源讀取數據:

It reads "Table 1" from an Excel file (需要保留的關鍵詞.xlsx) into a DataFrame called keywords_df.
It reads "Table 2" from a CSV file (原始數據.csv) into another DataFrame called data_df.

創(chuàng)建一個名為的空 DataFrame,result_df其列與相同data_df。

import pandas as pd
from tqdm import tqdm
# Read Table 1 
keywords_df = pd.read_excel(r"C:\Users\Desktop\需要保留的關鍵詞.xlsx")
# Read Table 2 (數據表格)
data_df = pd.read_csv(r"C:\Users\Desktop\原始數據.csv", dtype=str)
# Create an empty Table 3
result_df = pd.DataFrame(columns=data_df.columns)
# Iterate over the keywords in Table 1

第二節(jié) 迭代關鍵字并過濾數據

在此部分中,代碼使用循環(huán)和庫迭代“關鍵字”列中的每個關鍵字,tqdm以顯示名為“處理”的進度條。

對于每個關鍵字,它執(zhí)行以下步驟:

它搜索“表 2”( data_df) 中“地址”列包含當前關鍵字的行。該str.contains()方法用于檢查部分匹配,并na=False用于忽略缺失值。

匹配的行存儲在名為 的 DataFrame 中matched_rows。

使用, 將DataFramematched_rows附加到先前創(chuàng)建的空 DataFrame 中,以重置串聯 DataFrame 的索引。result_dfpd.concat()ignore_index=True

for keyword in tqdm(keywords_df['關鍵詞'], desc="Processing"):
    # Find rows in Table 2 where the "地址" column matches the keyword
    matched_rows = data_df[data_df['地址'].str.contains(keyword, na=False)]
    # Append the matched rows to Table 3
    result_df = pd.concat([result_df, matched_rows], ignore_index=True)

第三節(jié) 刪除重復行并保存結果

在這一部分中,代碼執(zhí)行以下步驟:

它使用該方法根據所有列從“表 3”( ) 中刪除重復行drop_duplicates()。DataFrameresult_df已更新為僅包含唯一行。

使用該方法將刪除重復行的結果 DataFrame 保存到名為“篩選出包含關鍵詞的行.csv”的新 CSV 文件中to_csv()。設置index為False避免將 DataFrame 索引保存為 CSV 文件中的單獨列。

最后,打印“Query Complete”,表示關鍵字搜索、過濾和CSV保存過程已完成。

# Remove duplicate rows from Table 3 based on all columns
result_df = result_df.drop_duplicates()
# Save Table 3 to a CSV file
result_df.to_csv(r"C:\Users\Desktop\篩選出包含關鍵詞的行.csv", index=False)
# Print "Query Complete"
print("Query Complete")

第四節(jié) 運行示例

原始數據如下:

需要保留的關鍵詞假設如下: 

代碼運行完畢后(只保留了包含太原市和陽泉市的行):

完整代碼

import pandas as pd
from tqdm import tqdm
# Read Table 1 
keywords_df = pd.read_excel(r"C:\Users\Desktop\需要保留的關鍵詞.xlsx")
# Read Table 2 (數據表格)
data_df = pd.read_csv(r"C:\Users\Desktop\原始數據.csv", dtype=str)
# Create an empty Table 3
result_df = pd.DataFrame(columns=data_df.columns)
# Iterate over the keywords in Table 1
for keyword in tqdm(keywords_df['關鍵詞'], desc="Processing"):
    # Find rows in Table 2 where the "地址" column matches the keyword
    matched_rows = data_df[data_df['地址'].str.contains(keyword, na=False)]
    # Append the matched rows to Table 3
    result_df = pd.concat([result_df, matched_rows], ignore_index=True)
# Remove duplicate rows from Table 3 based on all columns
result_df = result_df.drop_duplicates()
# Save Table 3 to a CSV file
result_df.to_csv(r"C:\Users\Desktop\篩選出包含關鍵詞的行.csv", index=False)
# Print "Query Complete"
print("Query Complete")

功能二:去除掉包含關鍵詞的行

第一節(jié) 數據加載

在這一部分中,代碼導入所需的庫、pandas 和 tq??dm。然后它從外部文件加載兩個數據集。

import pandas as pd
from tqdm import tqdm
# Read Table 1
keywords_df = pd.read_excel(r"C:\Users\Desktop\需要刪除的關鍵詞.xlsx")
# Read Table 2
data_df = pd.read_csv(r"C:\Users\Desktop\篩選包含關鍵詞的行.csv", dtype=str)

第二節(jié) 關鍵字處理和過濾

該部分涉及迭代keywords_dfDataFrame 中的每個關鍵字。對于每個關鍵字,代碼都會搜索data_df“地址”列包含該關鍵字作為子字符串的行。結果存儲在matched_rows.

for keyword in tqdm(keywords_df['刪除的關鍵詞'], desc="Processing"):
    matched_rows = data_df[data_df['地址'].str.contains(keyword, na=False, regex=False)]
    data_df = data_df[~data_df['地址'].str.contains(keyword, na=False, regex=False)]

第三節(jié) 保存和完成

在這一部分中,DataFrame中的剩余數據data_df(在過濾掉具有匹配關鍵字的行之后)將保存到桌面上名為“消失掉包含關鍵字的行.csv”的新CSV文件中。該index=False參數確保索引列不會保存到 CSV 文件中。最后,腳本打印“Query Complete”,表明關鍵字處理和過濾操作已完成。

data_df.to_csv(r"C:\Users\Desktop\去除掉包含關鍵詞的行.csv", index=False)
print("Query Complete")

第四節(jié) 運行示例

原始數據如下:

需要刪除的關鍵詞假設如下: 

代碼運行完畢后(刪除了包含太原市和陽泉市的行):

完整代碼 

import pandas as pd
from tqdm import tqdm
# Read Table 1 
keywords_df = pd.read_excel(r"C:\Users\Desktop\需要刪除的關鍵詞.xlsx")
# Read Table 2 
data_df = pd.read_csv(r"C:\Users\Desktop\原始數據.csv", dtype=str)
# Iterate over the keywords in Table 1
for keyword in tqdm(keywords_df['刪除的關鍵詞'], desc="Processing"):
    # Find rows in Table 2 where the "地址" column contains the keyword as a substring
    matched_rows = data_df[data_df['地址'].str.contains(keyword, na=False, regex=False)]
    # Remove the matched rows from Table 2
    data_df = data_df[~data_df['地址'].str.contains(keyword, na=False, regex=False)]
# Save the remaining data to a CSV file
data_df.to_csv(r"C:\Users\Desktop\去除掉包含關鍵詞的行.csv", index=False)
# Print "Query Complete"
print("Query Complete")
 

上述代碼注意文件的格式,有csv格式和xlsx格式,根據需要適當修改程序即可。

以上就是Python實現提取和去除數據中包含關鍵詞的行的詳細內容,更多關于Python提取和去除關鍵詞的資料請關注腳本之家其它相關文章!

相關文章

  • python開發(fā)飛機大戰(zhàn)游戲

    python開發(fā)飛機大戰(zhàn)游戲

    這篇文章主要為大家詳細介紹了python開發(fā)飛機大戰(zhàn)游戲,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2021-07-07
  • Python實現完整的事務操作示例

    Python實現完整的事務操作示例

    這篇文章主要介紹了Python實現完整的事務操作,結合實例形式分析了Python操作mysql數據庫相關事務操作的具體流程與實現技巧,需要的朋友可以參考下
    2017-06-06
  • python將三維數組展開成二維數組的實現

    python將三維數組展開成二維數組的實現

    今天小編就為大家分享一篇python將三維數組展開成二維數組的實現,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2019-11-11
  • Python并發(fā):多線程與多進程的詳解

    Python并發(fā):多線程與多進程的詳解

    今天小編就為大家分享一篇關于Python并發(fā):多線程與多進程的詳解,小編覺得內容挺不錯的,現在分享給大家,具有很好的參考價值,需要的朋友一起跟隨小編來看看吧
    2019-01-01
  • python批量替換頁眉頁腳實例代碼

    python批量替換頁眉頁腳實例代碼

    這篇文章主要介紹了python批量替換頁眉頁腳實例代碼,小編覺得還是挺不錯的,具有一定借鑒價值,需要的朋友可以參考下
    2018-01-01
  • pandas函數isnull的具體使用

    pandas函數isnull的具體使用

    本文主要介紹了pandas函數isnull的具體使用,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2022-06-06
  • Python中處理YAML文件的使用技巧分享

    Python中處理YAML文件的使用技巧分享

    在日常開發(fā)中,你是否經常需要處理各種配置文件?是否曾為不同環(huán)境下的配置管理而頭疼?今天我們來聊聊Python中處理YAML文件的實用技巧,讓你的配置管理變得更加輕松,需要的朋友可以參考下
    2025-11-11
  • Python調用騰訊API實現人臉身份證比對功能

    Python調用騰訊API實現人臉身份證比對功能

    這篇文章主要介紹了Python調用騰訊API進行人臉身份證比對,簡單介紹了調用騰訊云API步驟,通過完整代碼展示與結果,需要的朋友可以參考下
    2022-04-04
  • 講清楚fit_transform()和transform()的區(qū)別及說明

    講清楚fit_transform()和transform()的區(qū)別及說明

    這篇文章主要介紹了講清楚fit_transform()和transform()的區(qū)別及說明,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2024-02-02
  • Python類的定義和使用詳情

    Python類的定義和使用詳情

    這篇文章主要介紹了Python類的定義和使用詳情,在Python中,類表示具有相同屬性和方法的對象的集合,文章圍繞主題相關資料展開更多的相關介紹,需要的小伙伴可以參考一下
    2022-06-06

最新評論

阳山县| 石首市| 都昌县| 叙永县| 霞浦县| 商城县| 文安县| 星子县| 建德市| 竹北市| 镇赉县| 崇义县| 夏津县| 江门市| 韶关市| 宁乡县| 牟定县| 龙里县| 大同县| 靖宇县| 故城县| 沙湾县| 宜君县| 平昌县| 麻城市| 温州市| 山西省| 阜城县| 文山县| 资溪县| 策勒县| 仪陇县| 兴隆县| 江油市| 杭锦旗| 天等县| 延吉市| 曲水县| 山东省| 仲巴县| 甘孜|