最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python如何將大TXT文件分割成4KB小文件

 更新時(shí)間:2025年04月15日 14:36:04   作者:程序員總部  
處理大文本文件是程序員經(jīng)常遇到的挑戰(zhàn),特別是當(dāng)我們需要把一個(gè)幾百M(fèi)B甚至幾個(gè)GB的TXT文件分割成小塊時(shí),下面我們來(lái)聊聊如何用Python自動(dòng)完成這個(gè)任務(wù)吧

處理大文本文件是程序員經(jīng)常遇到的挑戰(zhàn)。特別是當(dāng)我們需要把一個(gè)幾百M(fèi)B甚至幾個(gè)GB的TXT文件分割成小塊時(shí),手動(dòng)操作顯然不現(xiàn)實(shí)。今天我們就來(lái)聊聊如何用Python自動(dòng)完成這個(gè)任務(wù),特別是如何精確控制每個(gè)分割文件的大小為4KB。

為什么需要分割TXT文件

在實(shí)際開(kāi)發(fā)中,我們可能會(huì)遇到這些情況:

  • 某些老舊系統(tǒng)只能處理小體積文本文件
  • 需要將日志文件分割后上傳到云存儲(chǔ)
  • 進(jìn)行分布式處理時(shí)需要將數(shù)據(jù)分片
  • 調(diào)試時(shí)需要用小文件快速測(cè)試

4KB是個(gè)很常用的分割尺寸,因?yàn)樗檬呛芏嘞到y(tǒng)默認(rèn)的內(nèi)存頁(yè)大小,處理起來(lái)效率很高。那么問(wèn)題來(lái)了:怎么用Python實(shí)現(xiàn)這個(gè)需求呢?

基礎(chǔ)版:按行分割

我們先來(lái)看一個(gè)最簡(jiǎn)單的實(shí)現(xiàn)方式:

def split_by_line(input_file, output_prefix, chunk_size=4000):
    with open(input_file, 'r', encoding='utf-8') as f:
        file_count = 1
        current_size = 0
        output_file = None
        
        for line in f:
            line_size = len(line.encode('utf-8'))
            
            if current_size + line_size > chunk_size:
                if output_file:
                    output_file.close()
                output_file = open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8')
                file_count += 1
                current_size = 0
                
            if not output_file:
                output_file = open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8')
                file_count += 1
                
            output_file.write(line)
            current_size += line_size
            
        if output_file:
            output_file.close()

這個(gè)腳本可以按行分割文件,盡量保證每個(gè)文件不超過(guò)指定大小。但是有個(gè)問(wèn)題:它不能精確控制文件大小正好是4KB,特別是當(dāng)某一行特別長(zhǎng)時(shí),單個(gè)文件可能會(huì)超過(guò)限制。

進(jìn)階版:精確控制文件大小

要實(shí)現(xiàn)更精確的控制,我們需要按字節(jié)而不是按行來(lái)處理:

def split_by_size(input_file, output_prefix, chunk_size=4096):
    with open(input_file, 'rb') as f:
        file_count = 1
        while True:
            chunk = f.read(chunk_size)
            if not chunk:
                break
            with open(f"{output_prefix}_{file_count}.txt", 'wb') as out_file:
                out_file.write(chunk)
            file_count += 1

注意! 這里我們用二進(jìn)制模式(‘rb’)打開(kāi)文件,這樣可以精確控制讀取的字節(jié)數(shù)。但是這樣可能會(huì)在UTF-8編碼的中文文件中出現(xiàn)亂碼,因?yàn)橐粋€(gè)中文字符可能被從中間截?cái)唷?/p>

完美解決方案:支持UTF-8編碼

為了解決中文亂碼問(wèn)題,我們需要更智能的處理方式:

def split_utf8_safely(input_file, output_prefix, chunk_size=4096):
    buffer = ""
    file_count = 1
    current_size = 0
    
    with open(input_file, 'r', encoding='utf-8') as f:
        while True:
            char = f.read(1)
            if not char:
                if buffer:
                    with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
                        out_file.write(buffer)
                break
                
            char_size = len(char.encode('utf-8'))
            if current_size + char_size > chunk_size:
                with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
                    out_file.write(buffer)
                file_count += 1
                buffer = ""
                current_size = 0
                
            buffer += char
            current_size += char_size

這個(gè)方法逐個(gè)字符讀取文件,確保不會(huì)截?cái)喽嘧止?jié)字符。雖然速度會(huì)慢一些,但能保證分割后的文件都能正常顯示中文內(nèi)容。

性能優(yōu)化:使用緩沖區(qū)

處理大文件時(shí),逐個(gè)字符讀取效率太低。我們可以用緩沖區(qū)來(lái)提升性能:

def split_with_buffer(input_file, output_prefix, chunk_size=4096, buffer_size=1024):
    buffer = ""
    file_count = 1
    current_size = 0
    
    with open(input_file, 'r', encoding='utf-8') as f:
        while True:
            chunk = f.read(buffer_size)
            if not chunk:
                if buffer:
                    with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
                        out_file.write(buffer)
                break
                
            buffer += chunk
            while len(buffer.encode('utf-8')) >= chunk_size:
                # 找到不超過(guò)chunk_size的最大子串
                split_pos = 0
                for i in range(1, len(buffer)+1):
                    if len(buffer[:i].encode('utf-8')) <= chunk_size:
                        split_pos = i
                    else:
                        break
                        
                with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
                    out_file.write(buffer[:split_pos])
                file_count += 1
                buffer = buffer[split_pos:]
                current_size = 0

處理特殊情況

實(shí)際應(yīng)用中我們還需要考慮一些特殊情況:

  • 文件頭處理:如果需要保留原文件的頭信息到每個(gè)分割文件
  • 行完整性:某些場(chǎng)景下需要保持行的完整性
  • 內(nèi)存限制:處理超大文件時(shí)的內(nèi)存優(yōu)化
  • 進(jìn)度顯示:添加進(jìn)度條讓長(zhǎng)時(shí)間運(yùn)行的任務(wù)更友好

這里給出一個(gè)保留文件頭的實(shí)現(xiàn)示例:

def split_with_header(input_file, output_prefix, chunk_size=4096, header_lines=1):
    # 先讀取文件頭
    with open(input_file, 'r', encoding='utf-8') as f:
        header = [next(f) for _ in range(header_lines)]
    
    buffer = ""
    file_count = 1
    current_size = len(''.join(header).encode('utf-8'))
    
    with open(input_file, 'r', encoding='utf-8') as f:
        # 跳過(guò)已經(jīng)讀取的文件頭
        for _ in range(header_lines):
            next(f)
            
        while True:
            char = f.read(1)
            if not char:
                if buffer:
                    with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
                        out_file.writelines(header)
                        out_file.write(buffer)
                break
                
            char_size = len(char.encode('utf-8'))
            if current_size + char_size > chunk_size:
                with open(f"{output_prefix}_{file_count}.txt", 'w', encoding='utf-8') as out_file:
                    out_file.writelines(header)
                    out_file.write(buffer)
                file_count += 1
                buffer = ""
                current_size = len(''.join(header).encode('utf-8'))
                
            buffer += char
            current_size += char_size

總結(jié)

我們介紹了多種Python分割TXT文件的方法:

簡(jiǎn)單的按行分割適合行結(jié)構(gòu)明顯的文件

按字節(jié)分割效率最高但不支持UTF-8

帶UTF-8支持的版本適合中文文本

緩沖區(qū)的版本在性能和準(zhǔn)確性之間取得平衡

特殊需求如保留文件頭需要額外處理

記住! 選擇哪種方法取決于你的具體需求。如果是處理GB級(jí)別的大文件,建議使用緩沖區(qū)方案并考慮內(nèi)存映射等高級(jí)技術(shù)。希望這篇指南能幫你解決文件分割的問(wèn)題!

到此這篇關(guān)于Python如何將大TXT文件分割成4KB小文件的文章就介紹到這了,更多相關(guān)Python大文件分割內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python 數(shù)據(jù)庫(kù)查詢(xún)返回list或tuple實(shí)例

    python 數(shù)據(jù)庫(kù)查詢(xún)返回list或tuple實(shí)例

    這篇文章主要介紹了python 數(shù)據(jù)庫(kù)查詢(xún)返回list或tuple實(shí)例,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧
    2020-05-05
  • python?Helium自動(dòng)化庫(kù)的功能特性探索

    python?Helium自動(dòng)化庫(kù)的功能特性探索

    這篇文章主要為大家介紹了python?Helium自動(dòng)化庫(kù)的功能特性探索,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2024-02-02
  • 在Python的Django框架中編寫(xiě)錯(cuò)誤提示頁(yè)面

    在Python的Django框架中編寫(xiě)錯(cuò)誤提示頁(yè)面

    這篇文章主要介紹了在Python的Django框架中編寫(xiě)錯(cuò)誤提示頁(yè)面,包括傳統(tǒng)的404頁(yè)面和設(shè)置連接中斷警告等,需要的朋友可以參考下
    2015-07-07
  • Python?UserWarning:?Glyph?missing?from?font(s)?DejaVu?Sans警告及解決方法

    Python?UserWarning:?Glyph?missing?from?font(s)?DejaVu?

    這篇文章主要介紹了Python?UserWarning:?Glyph?missing?from?font(s)?DejaVu?Sans警告及解決方法,文中通過(guò)代碼介紹的非常詳細(xì),需要的朋友可以參考下
    2026-01-01
  • python實(shí)現(xiàn)三種隨機(jī)請(qǐng)求頭方式

    python實(shí)現(xiàn)三種隨機(jī)請(qǐng)求頭方式

    這篇文章主要介紹了python實(shí)現(xiàn)三種隨機(jī)請(qǐng)求頭方式,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2021-01-01
  • 基于python 字符編碼的理解

    基于python 字符編碼的理解

    下面小編就為大家?guī)?lái)一篇基于python 字符編碼的理解。小編覺(jué)得挺不錯(cuò)的,現(xiàn)在就分享給大家,也給大家做個(gè)參考。一起跟隨小編過(guò)來(lái)看看吧
    2017-09-09
  • 基于Pyinstaller打包Python程序并壓縮文件大小

    基于Pyinstaller打包Python程序并壓縮文件大小

    這篇文章主要介紹了基于Pyinstaller打包Python程序并壓縮文件大小,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-05-05
  • Python操作Elasticsearch詳細(xì)指南

    Python操作Elasticsearch詳細(xì)指南

    Elasticsearch?是一種強(qiáng)大且靈活的分布式搜索引擎,而?Python?則以其易用性和強(qiáng)大的數(shù)據(jù)處理能力,成為開(kāi)發(fā)者在數(shù)據(jù)操作中的理想選擇,下面我們就來(lái)看看如何使用Python操作Elasticsearch吧
    2025-02-02
  • Python動(dòng)態(tài)規(guī)劃實(shí)現(xiàn)虛擬機(jī)部署的算法思想

    Python動(dòng)態(tài)規(guī)劃實(shí)現(xiàn)虛擬機(jī)部署的算法思想

    這篇文章主要介紹了Python動(dòng)態(tài)規(guī)劃實(shí)現(xiàn)虛擬機(jī)部署的算法思想,本文給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2021-07-07
  • 使用Python自制GUI版時(shí)間戳轉(zhuǎn)換器

    使用Python自制GUI版時(shí)間戳轉(zhuǎn)換器

    在日常開(kāi)發(fā)工作中,我們經(jīng)常需要處理時(shí)間戳的轉(zhuǎn)換問(wèn)題,本文將和大家分享一個(gè)使用Python和Tkinter開(kāi)發(fā)的時(shí)間戳轉(zhuǎn)換器GUI應(yīng)用,有需要的可以了解下
    2025-08-08

最新評(píng)論

汨罗市| 磐石市| 抚远县| 乐都县| 博客| 库车县| 益阳市| 遵化市| 兰坪| 海原县| 绩溪县| 邵阳县| 武川县| 昭通市| 林州市| 井陉县| 台山市| 玛纳斯县| 武宣县| 苏尼特右旗| 南康市| 板桥市| 桂东县| 静宁县| 彩票| 团风县| 泾源县| 秦皇岛市| 资中县| 海口市| 古蔺县| 哈巴河县| 进贤县| 三门县| 泰安市| 来凤县| 深水埗区| 招远市| 巴林右旗| 穆棱市| 调兵山市|