最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python數(shù)據(jù)清洗之表格字段智能去重

 更新時間:2025年03月07日 09:30:14   作者:Bruce_xiaowei  
數(shù)據(jù)清洗是數(shù)據(jù)分析和處理過程中一個至關(guān)重要的步驟,其中字段去重更是一個常見且關(guān)鍵的任務(wù),下面我們看看如何利用Python進行表格字段智能去重吧

一、業(yè)務(wù)場景與痛點分析

在處理結(jié)構(gòu)化數(shù)據(jù)的實際業(yè)務(wù)場景中(如產(chǎn)品目錄管理、客戶信息統(tǒng)計、科研數(shù)據(jù)整理等),我們經(jīng)常會遇到以下典型問題:

數(shù)據(jù)表中存在重復(fù)的分類標簽(如示例中的"AI Assistant"重復(fù)項)

不同維護人員填寫標準不統(tǒng)一產(chǎn)生的語義重復(fù)(如"Code Assistant"和"Coding Assistant")

缺失值影響后續(xù)聚類分析的準確性

手動處理流程耗時且容易遺漏

本文將以AI工具推薦數(shù)據(jù)集為例,展示如何通過Python快速構(gòu)建自動化字段清洗工具,解決上述業(yè)務(wù)痛點。

二、技術(shù)方案設(shè)計

采用分層架構(gòu)實現(xiàn)數(shù)據(jù)處理工具:

數(shù)據(jù)輸入層(Excel/CSV)
       ↓
 核心處理層(Pandas)
       ↓        異常處理層
數(shù)據(jù)清洗模塊 → 日志監(jiān)控
       ↓
 輸出結(jié)果層(TXT/DB)

關(guān)鍵技術(shù)選型:

  • Pandas:高性能DataFrame處理庫(執(zhí)行效率比純Python快57倍)
  • Openpyxl:處理Excel 2010+格式文件(支持.xlsx讀寫)
  • CSV模塊:輕量級文本數(shù)據(jù)處理

三、代碼深度解析

# 增強型數(shù)據(jù)預(yù)處理流程
unique_values = (
    df[COLUMN_NAME]
    .str.strip()  # 去除首尾空格
    .str.title()  # 規(guī)范大小寫格式
    .replace(r'^\s*$', pd.NA, regex=True)  # 空字符轉(zhuǎn)NA
    .dropna()  # 清除缺失值
    .drop_duplicates()  # 精準去重
    .sort_values()  # 結(jié)果排序
)

改進后的處理流程增加:

  • 字符串規(guī)范化:統(tǒng)一文本格式
  • 正則表達式過濾:識別"隱形"空值
  • 智能排序:提高結(jié)果可讀性

四、實戰(zhàn)操作指南

以AI工具數(shù)據(jù)集為例的4步操作:

配置文件設(shè)置

FILE_PATH = 'ai_tools_dataset.xlsx'
SHEET_NAME = 'AI Tools' 
COLUMN_NAME = '技術(shù)領(lǐng)域'  # 支持多語言字段

執(zhí)行環(huán)境準備

# 創(chuàng)建虛擬環(huán)境
python -m venv data_cleaning_env
source data_cleaning_env/bin/activate

# 安裝依賴(帶版本控制)
pip install pandas==2.1.0 openpyxl==3.1.2

異常處理機制演示

try:
    df = pd.read_excel(...)
except FileNotFoundError as e:
    logging.error(f"文件路徑錯誤: {e}")
    sys.exit(1001)
except KeyError as e:
    logging.warning(f"字段缺失: {e}")
    sys.exit(1002)

結(jié)果驗證方法

# 結(jié)果文件行數(shù)驗證
wc -l output.txt

# 與原始數(shù)據(jù)對比
awk -F, '{print $2}' input.csv | sort | uniq | wc -l

五、行業(yè)應(yīng)用場景拓展

該工具的多領(lǐng)域應(yīng)用案例:

1.電商行業(yè)

商品類目標準化:檢測"電子配件"與"數(shù)碼配件"等近似類目

地址信息清洗:歸并"北京市"與"北京"的行政區(qū)劃表述

2.醫(yī)療健康

藥品名稱歸一化:識別"阿司匹林"與"Aspirin"的對應(yīng)關(guān)系

病例特征提?。簭脑\療記錄中提取癥狀關(guān)鍵詞

3.金融領(lǐng)域

風(fēng)險標簽管理:統(tǒng)一"信用風(fēng)險"與"信貸風(fēng)險"等行業(yè)術(shù)語

客戶分類清洗:標準化投資者風(fēng)險等級劃分

六、性能優(yōu)化建議

針對千萬級數(shù)據(jù)的處理優(yōu)化:

優(yōu)化維度原始方法優(yōu)化方案提升幅度
內(nèi)存占用普通DataFrame使用category類型降低65%
并行處理單線程處理Dask并行計算快3-5倍
去重算法遍歷比對法(O(n²))哈希索引法(O(n))快20倍
IO吞吐量單文件讀寫分塊處理(chunksize=10000)內(nèi)存降80%

進階代碼示例:

# 分塊處理大數(shù)據(jù)文件
chunk_size = 100000
unique_set = set()

for chunk in pd.read_csv(FILE_PATH, 
                        chunksize=chunk_size, 
                        usecols=[COLUMN_NAME]):
    unique_set.update(chunk[COLUMN_NAME].dropna().unique())

七、工具擴展方向

智能合并模塊

from rapidfuzz import fuzz

def fuzzy_merge(str1, str2):
    return fuzz.token_set_ratio(str1, str2) > 85

# 可合并:"AI Assistant"和"AI Assistants"

多維度統(tǒng)計分析

analysis_report = {
    "原始數(shù)據(jù)量": len(df),
    "缺失值數(shù)量": df[COLUMN_NAME].isna().sum(),
    "重復(fù)值比例": 1 - len(unique_values)/len(df),
    "數(shù)據(jù)類型分布": df[COLUMN_NAME].apply(type).value_counts()
}

自動化報表輸出

with pd.ExcelWriter('分析報告.xlsx') as writer:
    unique_values.to_excel(writer, sheet_name='去重結(jié)果')
    pd.DataFrame(analysis_report).to_excel(writer, 
                                        sheet_name='統(tǒng)計概覽')

通過這個可擴展的Python數(shù)據(jù)處理工具,企業(yè)可以實現(xiàn)從基礎(chǔ)數(shù)據(jù)清洗到智能分析的完整解決方案,大大提高數(shù)據(jù)資產(chǎn)的標準化水平。該框架已在多個行業(yè)的數(shù)據(jù)中臺建設(shè)項目中驗證,平均提升數(shù)據(jù)團隊效率40%以上。

到此這篇關(guān)于Python數(shù)據(jù)清洗之表格字段智能去重的文章就介紹到這了,更多相關(guān)Python表格字段去重內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • Python 實例進階之預(yù)測房價走勢

    Python 實例進階之預(yù)測房價走勢

    買房應(yīng)該是大多數(shù)都會要面臨的一個選擇,當前經(jīng)濟和政策背景下,未來房價會漲還是跌?這是很多人都關(guān)心的一個話題。今天分享的這篇文章,以波士頓的房地產(chǎn)市場為例,根據(jù)低收入人群比例、老師學(xué)生數(shù)量等特征,利用 Python 進行了預(yù)測,給大家做一個參考
    2021-11-11
  • Python實現(xiàn)自動裝機功能案例分析

    Python實現(xiàn)自動裝機功能案例分析

    這篇文章主要介紹了Python實現(xiàn)自動裝機功能,本文給大家介紹的非常詳細,對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2020-10-10
  • Python 中的參數(shù)傳遞、返回值、淺拷貝、深拷貝

    Python 中的參數(shù)傳遞、返回值、淺拷貝、深拷貝

    這篇文章主要介紹了Python 中的參數(shù)傳遞、返回值、淺拷貝、深拷貝,非常不錯,具有一定的參考借鑒價值,需要的朋友可以參考下
    2019-06-06
  • Python?selenium下拉選擇框?qū)崙?zhàn)應(yīng)用例子

    Python?selenium下拉選擇框?qū)崙?zhàn)應(yīng)用例子

    Selenium是一個開源的和便攜式的自動化軟件測試工具,用于測試Web應(yīng)用程序有能力在不同的瀏覽器和操作系統(tǒng)運行,下面這篇文章主要給大家介紹了關(guān)于Python?selenium下拉選擇框?qū)崙?zhàn)應(yīng)用的相關(guān)資料,需要的朋友可以參考下
    2022-07-07
  • Python?面向切面編程?AOP?及裝飾器

    Python?面向切面編程?AOP?及裝飾器

    這篇文章主要介紹了Python?面向切面編程?AOP?及裝飾器,AOP,就是面向切面編程,簡單的說,就是動態(tài)地將代碼切入到類的指定方法、指定位置上的編程思想就是面向切面的編程,更多相關(guān)資需要的小伙伴可以參考下面文章內(nèi)容
    2022-05-05
  • python3中的logging記錄日志實現(xiàn)過程及封裝成類的操作

    python3中的logging記錄日志實現(xiàn)過程及封裝成類的操作

    這篇文章主要介紹了python3中的logging記錄日志實現(xiàn)過程及封裝成類的操作,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-05-05
  • 使用python如何提取JSON數(shù)據(jù)指定內(nèi)容

    使用python如何提取JSON數(shù)據(jù)指定內(nèi)容

    這篇文章主要介紹了使用python如何提取JSON數(shù)據(jù)指定內(nèi)容,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-07-07
  • python通過pil將圖片轉(zhuǎn)換成黑白效果的方法

    python通過pil將圖片轉(zhuǎn)換成黑白效果的方法

    這篇文章主要介紹了python通過pil將圖片轉(zhuǎn)換成黑白效果的方法,實例分析了Python中pil庫的使用技巧,需要的朋友可以參考下
    2015-03-03
  • python變量賦值機制踩坑記錄

    python變量賦值機制踩坑記錄

    這篇文章主要介紹了python變量賦值機制踩坑記錄,我們都知道python有深拷貝和淺拷貝,但變量賦值又是什么機制呢?這是個容易被忽略卻又極易踩坑的點,下面我們來一探究竟,需要的朋友可以參考一下
    2022-02-02
  • yolov5使用flask部署至前端實現(xiàn)照片\視頻識別功能

    yolov5使用flask部署至前端實現(xiàn)照片\視頻識別功能

    初學(xué)者在使用YOLO和Flask構(gòu)建應(yīng)用時,往往需要實現(xiàn)上傳圖片和視頻的識別功能,本文介紹了如何在Flask框架中實現(xiàn)這一功能,包括文件上傳、圖片放大查看、視頻識別以及識別后的文件下載,文中通過代碼介紹的非常詳細,需要的朋友可以參考下
    2024-09-09

最新評論

衡水市| 瑞丽市| 尚义县| 安乡县| 洱源县| 资中县| 阆中市| 南充市| 凤山县| 广东省| 安乡县| 天台县| 怀远县| 德化县| 望奎县| 盱眙县| 藁城市| 清镇市| 文登市| 建瓯市| 肃宁县| 油尖旺区| 娄烦县| 土默特左旗| 云林县| 平凉市| 通海县| 泗洪县| 红原县| 土默特右旗| 哈尔滨市| 澎湖县| 吴江市| 福贡县| 高阳县| 阆中市| 疏勒县| 临安市| 湘潭市| 白河县| 河北区|