最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

一文帶你了解Python中的編碼和解碼

 更新時間:2025年02月07日 09:55:48   作者:科雷learning  
這篇文章主要為大家詳細(xì)介紹了常見編碼和解碼的基本原理,例如ASCII,GBK以及Python中的默認(rèn)編碼等,感興趣的小伙伴可以跟隨小編一了解一下

什么是編碼和解碼

大家都知道計算機是二進制的世界,計算機系統(tǒng)只能識別數(shù)字0和1組成的一串串的數(shù)字。1位數(shù)字代表1個比特(bit),每8個比特代表1個字節(jié)(byte),那么1個字節(jié)如果都為數(shù)字1,如11111111,代表的最大數(shù)字是255。

如果是2 個字節(jié)最大可以表示為 65535,4 個字節(jié)最大表示為4294967295。

每一種不同的數(shù)字0和1的組合,就可以代表一個字符?;谏鲜鲈沓霈F(xiàn)了各種編碼格式:

ASCII 編碼

ASCII(American Standard Code for Information Interchange,美國信息交換標(biāo)準(zhǔn)代碼)字符集是一個基于拉丁字母的字符編碼系統(tǒng),它主要用于顯示現(xiàn)代英語和其他西歐語言。ASCII字符集共定義了128個字符,每個字符都有一個對應(yīng)的數(shù)字,這個數(shù)字被稱為碼點(code point)。可最大擴展為 256 個字符,僅支持英文字母,數(shù)字和少部分符號,不支持中文。

以下是ASCII字符集中一些常見的字符及其對應(yīng)的數(shù)字(碼點):

  • 空字符(Null):0
  • 控制字符(如LF、CR、FF、DEL等):1-31(共31個)
  • 數(shù)字0-9:48-57
  • 大寫英文字母A-Z:65-90
  • 小寫英文字母a-z:97-122
  • 標(biāo)點符號、運算符號等:其他碼點(如33表示"!",34表示"""等)
  • 刪除字符(DEL):127

GBK 編碼

中國文字博大精深,漢字特別多,其他編碼格式并不能滿足要求,所以才有了適合中文編解碼的 GB2312。編碼(后來升級到了 GBK 編碼),可以容納將近7000個漢字。

Unicode

世界上除了英文/中文等還有各個國家的文字語言,每個國家的編碼不統(tǒng)一會帶來很多編解碼的困難,后來Unicode 字符集就出現(xiàn)了,它將所有的語言都容納在一起,后續(xù)為了在存儲和傳輸數(shù)據(jù)時節(jié)省空間,出現(xiàn)了目前常用的UTF8編碼。

編解碼基本原理

平常工作中,我們通過鍵盤輸入英文字符或者中文字符或者一些逗號等符號,程序通過編碼將字符轉(zhuǎn)為計算機識別的2進制字節(jié)流,當(dāng)計算機處理完成后再通過解碼轉(zhuǎn)為我們能識別的字符。

python的默認(rèn)編碼

安裝完python3版本的程序后,我們通過sys庫,檢查下默認(rèn)的編碼。

import sys
print(sys.getdefaultencoding())

結(jié)果:

utf-8

因為utf-8本來就支持中文,所以我們可直接在python3版本上定義中文變量并直接使用,而不會出現(xiàn)亂碼問題。

什么是10進制/2進制/8進制/16進制

10進制通常我們說的數(shù)字,比如數(shù)字10 100 200等,沒有前綴表示
2進制由數(shù)字0和1組成,以0b或者0B前綴開頭,比如0b1010,換算為十進制表示數(shù)字10
8進制由數(shù)字0到7組成,每3位2進制數(shù)字組成一個8進制數(shù),比如3位111表式數(shù)字7,所以最大數(shù)字為7,而000就表示為0。
以0O或者0o前綴開頭,比如0o12,換算為十進制表示數(shù)字10
16進制由數(shù)字0到9,字母a,b,c,d,e,f共16位組成,字母a到f代表的是數(shù)字10到15;相當(dāng)于每4位2進制數(shù)字組成一個16進制數(shù),比如4位1111表式數(shù)字15,用f表示,而0000就表示為0。
以0x或者0X開頭,比如0xa,換算為十進制表示數(shù)字10

python中可通過bin(),oct(),hex()函數(shù)依次將十進制數(shù)轉(zhuǎn)換為2進制,8進制,16進制。

#定義數(shù)字10
dig1 = 10
 
#轉(zhuǎn)為2進制
bin_dig1 = bin(dig1)
print(f'十進制 數(shù)字10 轉(zhuǎn)為2進制為:{bin_dig1}')
 
#轉(zhuǎn)為8進制
oct_dig1 = oct(dig1)
print(f'十進制 數(shù)字10 轉(zhuǎn)為8進制為:{oct_dig1}')
 
#轉(zhuǎn)為16進制
hex_dig1 = hex(dig1)
print(f'十進制 數(shù)字10 轉(zhuǎn)為16進制為:{hex_dig1}')

結(jié)果:

十進制 數(shù)字10 轉(zhuǎn)為2進制為:0b1010
十進制 數(shù)字10 轉(zhuǎn)為8進制為:0o12
十進制 數(shù)字10 轉(zhuǎn)為16進制為:0xa

同理2進制,8進制和16進制可通過int()函數(shù)轉(zhuǎn)為10進制。

print(f'2進制 數(shù)字10 轉(zhuǎn)為10進制為:{int(bin_dig1,base=2)}')
print(f'8進制 數(shù)字10 轉(zhuǎn)為10進制為:{int(oct_dig1,base=8)}')
print(f'16進制 數(shù)字10 轉(zhuǎn)為10進制為:{int(hex_dig1,base=16)}')

結(jié)果:

2進制 數(shù)字10 轉(zhuǎn)為10進制為:10
8進制 數(shù)字10 轉(zhuǎn)為10進制為:10
16進制 數(shù)字10 轉(zhuǎn)為10進制為:10

python的字符串編解碼

使用str.encode()編碼 ,str.decode()解碼

userinfo = '章三'

以 encoding 指定的編碼格式編碼 string,  默認(rèn)會使用‘utf-8’編碼,所以encoding='utf-8'這個參數(shù)可以不帶; 如果采用其他編碼格式,需要帶上encoding參數(shù)。

userinfo_byte = userinfo.encode(encoding='utf-8')
print(userinfo_byte)
#結(jié)果顯示被編碼為 前綴帶字母b的字節(jié)碼
b'\xe7\xab\xa0\xe4\xb8\x89'

編碼后字符串類型為bytes,輸出的是16進制的字節(jié)碼,而且1個中文字占了3個字節(jié)

print(type(userinfo_byte))
<class 'bytes'>

通過decode函數(shù)解碼字節(jié)碼為字符串。

print(userinfo_byte.decode())
章三

再舉個例子: 比如我們在http請求拿到的響應(yīng)中,body體為'sdsdsdsdsdAAAAA10000000-s\xe6\x88\x91\xe7\x88\xb1\xe4\xbd\xa0\xe4\xb8\xad\xe5\x9b\xbd',像這種既有字母符號 又有一些十六進制的字符,一般都是編碼后的字節(jié)碼(因為英文字母/符號本身就支持ASCII碼,轉(zhuǎn)碼后也會保留原樣子)。 此時我們在這些字符串加上字母b的前綴,然后用decode函數(shù)節(jié)碼就得到原字符串

str_b = b'sdsdsdsdsdAAAAA10000000-s\xe6\x88\x91\xe7\x88\xb1\xe4\xbd\xa0\xe4\xb8\xad\xe5\x9b\xbd'
print(str_b.decode())

解碼后打印結(jié)果:

sdsdsdsdsdAAAAA10000000-s我愛你中國

解碼的亂碼問題

如果編碼和解碼使用的編碼不一樣,解碼后會出現(xiàn)亂碼。 比如下面的示例將中文通過utf-8編碼,然后通過gbk解碼

使用bytes()函數(shù)定義編碼格式為utf-8的字節(jié)碼,解碼使用gbk編碼

zhongwen = bytes('章三',encoding='utf-8')
print(zhongwen.decode(encoding='gbk'))

打印結(jié)果時出現(xiàn)亂碼:

绔犱笁

所以我們在平時使用時一般都是統(tǒng)一編碼格式,目前使用的都是默認(rèn)編碼utf-8。

16進制字符串解碼為普通字符串

以上中文“章三”編碼輸出的16進制為b'\xe7\xab\xa0\xe4\xb8\x89'可通過str.decode().hex()函數(shù)轉(zhuǎn)為16進制字符串:“e7aba0e4b889”

然后使用codecs.decode() 或者bytes.fromhex()或者binascii.unhexlify()方法將16進制的字符串解碼為普通字符串。

codecs.decode()

import codecs
hex_str = "e7aba0e4b889"
str_result = codecs.decode(hex_str, "hex").decode("utf-8")
print(str_result)
章三

binascii.unhexlify()

import binascii
byte_str = binascii.unhexlify(hex_str)
str_result = byte_str.decode("utf-8")
print(str_result)

bytes.fromhex()

byte_str = bytes.fromhex(hex_str)
str_result = byte_str.decode("utf-8")
print(str_result)

python字符串和unicode類型編碼轉(zhuǎn)換

char = "章三"
char.encode(encoding='unicode_escape')

通過unicode_escape編碼為unicode類型,結(jié)果如下:

b'\\u7ae0\\u4e09'

unicode字節(jié)碼以\\u的前綴表示,unicode編碼中每個中文占2個字節(jié)(跟utf8編碼不同,utf8編碼占用3個字節(jié)),7ae0和4e09表示的是16進制,16進制轉(zhuǎn)為10進制數(shù)分別是31456,19977

print(f'16進制 7ae0 轉(zhuǎn)為10進制為:{int("7ae0",base=16)}')
print(f'16進制 4e09 轉(zhuǎn)為10進制為:{int("4e09",base=16)}')

結(jié)果:

16進制 7ae0 轉(zhuǎn)為10進制為:31456
16進制 4e09 轉(zhuǎn)為10進制為:19977

通過chr函數(shù)可以解析出某數(shù)字對應(yīng)的unicode字符

print(f'16進制 7ae0 轉(zhuǎn)為10進制 通過chr函數(shù)獲取對應(yīng)數(shù)字的字符:{chr(int("7ae0",base=16))}')
print(f'16進制 4e09 轉(zhuǎn)為10進制 通過chr函數(shù)獲取對應(yīng)數(shù)字的字符:{chr(int("4e09",base=16))}')

結(jié)果: 可以反推出我們字符串定義的“章三”兩個漢字。

16進制 7ae0 轉(zhuǎn)為10進制 通過chr函數(shù)獲取對應(yīng)數(shù)字的字符:章
16進制 4e09 轉(zhuǎn)為10進制 通過chr函數(shù)獲取對應(yīng)數(shù)字的字符:三

通過ord()函數(shù)可以直接得出unicode字符對應(yīng)的編碼中的數(shù)字

print(f'漢字 章 對應(yīng)的unicode編碼中的數(shù)字是 {ord("章")}')
print(f'漢字 三 對應(yīng)的unicode編碼中的數(shù)字是 {ord("三")}')

結(jié)果:

漢字 章 對應(yīng)的unicode編碼中的數(shù)字是 31456
漢字 三 對應(yīng)的unicode編碼中的數(shù)字是 19977

到此這篇關(guān)于一文帶你了解Python中的編碼和解碼的文章就介紹到這了,更多相關(guān)Python編碼和解碼內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • python獲取當(dāng)前計算機cpu數(shù)量的方法

    python獲取當(dāng)前計算機cpu數(shù)量的方法

    這篇文章主要介紹了python獲取當(dāng)前計算機cpu數(shù)量的方法,涉及Python操作計算機硬件的技巧,代碼簡單易懂,非常具有實用價值,需要的朋友可以參考下
    2015-04-04
  • 使用numpy.ndarray添加元素

    使用numpy.ndarray添加元素

    這篇文章主要介紹了使用numpy.ndarray添加元素,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-05-05
  • Django中的ORM詳解(最新推薦)

    Django中的ORM詳解(最新推薦)

    Django ORM是一種用于操作數(shù)據(jù)庫的高級工具,它允許開發(fā)者通過Python代碼來管理數(shù)據(jù)庫模型和執(zhí)行查詢,而無需直接編寫SQL語句,ORM的主要優(yōu)勢是提高了開發(fā)效率,但也會犧牲一定的執(zhí)行效率,本文介紹Django的ORM詳解,感興趣的朋友一起看看吧
    2025-03-03
  • python輸出當(dāng)前目錄下index.html文件路徑的方法

    python輸出當(dāng)前目錄下index.html文件路徑的方法

    這篇文章主要介紹了python輸出當(dāng)前目錄下index.html文件路徑的方法,涉及Python操作目錄的相關(guān)技巧,需要的朋友可以參考下
    2015-04-04
  • PyQt5實現(xiàn)多界面自由切換的完整項目實踐指南

    PyQt5實現(xiàn)多界面自由切換的完整項目實踐指南

    在Python GUI開發(fā)中,PyQt5提供了強大的界面構(gòu)建能力,支持通過QMainWindow、QStackedWidget和QWizard等組件實現(xiàn)多界面來回切換,下面我們就來看看具體實現(xiàn)方法吧
    2025-12-12
  • Python基礎(chǔ)之?dāng)?shù)據(jù)類型詳解

    Python基礎(chǔ)之?dāng)?shù)據(jù)類型詳解

    python的數(shù)值類型包括整數(shù),浮點數(shù),復(fù)數(shù),集合,小數(shù)和分?jǐn)?shù),布爾值.它們都是python中的數(shù)值類型.如果是有過其他語言編寫經(jīng)驗的人,一定很好奇,浮點數(shù)和小數(shù)的區(qū)別是什么?文中有非常詳細(xì)的介紹,需要的朋友可以參考下
    2021-06-06
  • python使用標(biāo)準(zhǔn)庫根據(jù)進程名如何獲取進程的pid詳解

    python使用標(biāo)準(zhǔn)庫根據(jù)進程名如何獲取進程的pid詳解

    Python有一套很有用的標(biāo)準(zhǔn)庫(standard library)。標(biāo)準(zhǔn)庫會隨著Python解釋器,一起安裝在你的電腦中的,所以下面這篇文章主要給大家介紹了關(guān)于python使用標(biāo)準(zhǔn)庫根據(jù)進程名如何獲取進程pid的相關(guān)資料,需要的朋友可以參考下。
    2017-10-10
  • 詳解Python中正則匹配TAB及空格的小技巧

    詳解Python中正則匹配TAB及空格的小技巧

    這篇文章主要介紹了詳解Python中正則匹配TAB及空格的小技巧,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2019-07-07
  • python機器學(xué)習(xí)庫常用匯總

    python機器學(xué)習(xí)庫常用匯總

    這篇文章主要為大家匯總了常用python機器學(xué)習(xí)庫,具有一定的參考價值,感興趣的小伙伴們可以參考一下
    2017-11-11
  • 解決python3 urllib 鏈接中有中文的問題

    解決python3 urllib 鏈接中有中文的問題

    今天小編就為大家分享一篇解決python3 urllib 鏈接中有中文的問題,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-07-07

最新評論

延庆县| 高阳县| 乌兰浩特市| 会宁县| 平邑县| 万山特区| 自治县| 新乡市| 句容市| 宜兰市| 沙洋县| 阜平县| 商水县| 离岛区| 京山县| 大同县| 虞城县| 玉门市| 新野县| 家居| 武宣县| 阳原县| 桃江县| 沙雅县| 柳河县| 富宁县| 连南| 牙克石市| 双峰县| 怀化市| 邵东县| 丹寨县| 顺义区| 满城县| 抚宁县| 乾安县| 永嘉县| 衡山县| 镇平县| 保亭| 微博|