最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

對Python生成漢字字庫文字,以及轉(zhuǎn)換為文字圖片的實(shí)例詳解

 更新時(shí)間:2019年01月29日 08:52:05   作者:JohnieLi  
今天小編就為大家分享一篇對Python生成漢字字庫文字,以及轉(zhuǎn)換為文字圖片的實(shí)例詳解,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧

筆者小白在收集印刷體漢字的深度學(xué)習(xí)訓(xùn)練集的時(shí)候,一開始就遇到的了一個(gè)十分棘手的問題,就是如何獲取神經(jīng)網(wǎng)絡(luò)的訓(xùn)練集數(shù)據(jù)。通過上網(wǎng)搜素,筆者沒有找到可用的現(xiàn)成的可下載的漢字的訓(xùn)練集,于是筆者采用了代碼自建漢字的訓(xùn)練集數(shù)據(jù)。

這里采用的是python編寫程序,需要import 的python庫請?zhí)崆鞍惭b。

那么,首先如何用python輸出漢字字庫的文字?

筆者查到在計(jì)算機(jī)中漢字編碼范圍是0x4E00到0x9FA5,利用unichr()可以將十六進(jìn)制的編碼轉(zhuǎn)成人類可讀的字。

這里擴(kuò)展一下在python庫中什么是unichr(),以及什么是chr()和ord()。

chr( )函數(shù)用一個(gè)范圍在range(256)內(nèi)的(就是0~255)整數(shù)作參數(shù),返回一個(gè)對應(yīng)的字符。

unichr( )跟它一樣,只不過返回的是Unicode字符,這個(gè)從Python 2.0才加入的unichr( )的參數(shù)范圍依賴于你的Python是如何被編譯的。

如果是配置為USC2的Unicode,那么它的允許范圍就是range(65536)或0x0000-0xFFFF;如果配置為UCS4,那么這個(gè)值應(yīng)該是range(1114112)或0x000000-0x110000。

如果提供的參數(shù)不在允許的范圍內(nèi),則會報(bào)一個(gè)ValueError的異常。

ord( )函數(shù)是chr( )函數(shù)(對于8位的ASCII字符串)或unichr( )函數(shù)(對于Unicode對象)的配對函數(shù),它以一個(gè)字符(長度為1的字符串)作為參數(shù),返回對應(yīng)的ASCII數(shù)值,或者Unicode數(shù)值,如果所給的Unicode字符超出了你的Python定義范圍,則會引發(fā)一個(gè)TypeError的異常。

接下來就是把unicode編碼的字寫入文件呢,如果直接用open()的話,會提示UnicodeEncodeError: ‘a(chǎn)scii' codec can't encode character u'\u4e00' in position 0: ordinal not in range(128)

這里就是涉及到python讀寫文件時(shí)候的兩種方式了,一種是open(),還一種是codecs.open( )。

對于open()這個(gè)python的內(nèi)置函數(shù)來說, 打開文件的方式一般為:

f=open(file_name,access_mode = 'r',buffering = -1)。

file_name就是文件的路徑加文件名字,不加路徑則文件會存放在python程序的路徑下,

access_mode就是操作文件的模式,主要有r,w,rb,wb等,細(xì)節(jié)網(wǎng)上一大堆,buffering = -1是用于指示訪問文件所采用的緩存方式。0表示不緩存;1表示只緩存一行,n代表緩存n行。如果不提供或?yàn)樨?fù)數(shù),則代表使用系統(tǒng)默認(rèn)的緩存機(jī)制。

>>> fr = open('test1.txt','wb')
>>> line1 = "我是誰"
>>> fr.write(line1)

打開以后就是寫和讀的操作。但是用open方法打開會有一些問題。open打開文件只能寫入str類型,不管字符串是什么編碼方式。所以對于寫入文件的數(shù)據(jù)的編碼不統(tǒng)一的時(shí)候,需要用到codecs.open()。

這種方法可以指定一個(gè)編碼打開文件,使用這個(gè)方法打開的文件讀取返回的將是unicode。

寫入時(shí),如果參數(shù) 是unicode,則使用open()時(shí)指定的編碼進(jìn)行編碼后寫入;如果是str,則先根據(jù)源代碼文件聲明的字符編碼,解碼成unicode后再進(jìn)行前述 操作。

相對內(nèi)置的open()來說,這個(gè)方法比較不容易在編碼上出現(xiàn)問題。

>>> import codecs
>>> line2 = u'我是誰'
>>> fw = codecs.open('test1.txt','wb','utf-8')
>>> fw.write(line2)

這里是將漢字字庫的文字寫出到文本文件中,代碼如下:

import codecs
start,end = (0x4E00, 0x9FA5) #漢字編碼的范圍
with codecs.open("chinese.txt", "wb", encoding="utf-8") as f:
 for codepoint in range(int(start),int(end)):
 f.write(unichr(codepoint)) #寫出漢字

在同目錄文件下,生成漢字字庫的chinese.txt文件:

Python生成漢字字庫文字,以及轉(zhuǎn)換為文字圖片

接下來就是把漢字字庫的字一個(gè)個(gè)保存成圖片,這里需要pip install pygame的庫。

pygame可以將文字渲染到圖片上保存。

代碼如下:

#encoding: utf-8
import os
import pygame

chinese_dir = 'chinese'
if not os.path.exists(chinese_dir):
 os.mkdir(chinese_dir)

pygame.init()
start,end = (0x4E00, 0x9FA5) # 漢字編碼范圍
for codepoint in range(int(start), int(end)):
 word = unichr(codepoint)
 font = pygame.font.Font("msyh.ttc", 64)
 # 當(dāng)前目錄下要有微軟雅黑的字體文件msyh.ttc,或者去c:\Windows\Fonts目錄下找
 # 64是生成漢字的字體大小
 rtext = font.render(word, True, (0, 0, 0), (255, 255, 255))
 pygame.image.save(rtext, os.path.join(chinese_dir, word + ".png"))

這里是在chinese文件夾里面生成的文字圖片,字體是黑體,然后再在個(gè)基礎(chǔ)上可以繼續(xù)自制漢字識別的訓(xùn)練集了。

Python生成漢字字庫文字,以及轉(zhuǎn)換為文字圖片

以上這篇對Python生成漢字字庫文字,以及轉(zhuǎn)換為文字圖片的實(shí)例詳解就是小編分享給大家的全部內(nèi)容了,希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。

相關(guān)文章

  • Python中?join()?函數(shù)的使用示例講解

    Python中?join()?函數(shù)的使用示例講解

    Python中有join()和os.path.join()兩個(gè)函數(shù),這篇文章主要介紹了Python中?join()?函數(shù)的使用方法,需要的朋友可以參考下
    2023-04-04
  • Python使用pyecharts控件繪制圖表

    Python使用pyecharts控件繪制圖表

    這篇文章介紹了Python使用pyecharts控件繪制圖表的方法,文中通過示例代碼介紹的非常詳細(xì)。對大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2022-06-06
  • Python爬蟲lxml庫處理XML和HTML文檔

    Python爬蟲lxml庫處理XML和HTML文檔

    在當(dāng)今信息爆炸的時(shí)代,網(wǎng)絡(luò)上的數(shù)據(jù)量龐大而繁雜,為了高效地從網(wǎng)頁中提取信息,Python爬蟲工程師們需要強(qiáng)大而靈活的工具,其中,lxml庫憑借其卓越的性能和豐富的功能成為Python爬蟲領(lǐng)域的不可或缺的工具之一,本文將深入介紹lxml庫的各個(gè)方面,充分掌握這個(gè)強(qiáng)大的爬蟲利器
    2023-12-12
  • 使用Python實(shí)現(xiàn)windows下的抓包與解析

    使用Python實(shí)現(xiàn)windows下的抓包與解析

    這篇文章主要介紹了使用Python實(shí)現(xiàn)windows下的抓包與解析,非常不錯(cuò),具有參考借鑒價(jià)值,需要的朋友可以參考下
    2018-01-01
  • 利用python畫一顆心的方法示例

    利用python畫一顆心的方法示例

    最近工作中要用到python的統(tǒng)計(jì)和繪圖功能,無意間搜索到了這個(gè),還挺有意思的。就分享給大家,下面這篇文章主要介紹了利用python畫一顆心的方法示例,需要的朋友可以參考借鑒,一起來看看吧。
    2017-01-01
  • python神經(jīng)網(wǎng)絡(luò)TensorFlow簡介常用基本操作教程

    python神經(jīng)網(wǎng)絡(luò)TensorFlow簡介常用基本操作教程

    這篇文章主要介紹了python神經(jīng)網(wǎng)絡(luò)入門TensorFlow簡介常用基本操作教程,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步
    2021-11-11
  • 探索python?dask靈活的并行計(jì)算庫應(yīng)用場景示例

    探索python?dask靈活的并行計(jì)算庫應(yīng)用場景示例

    這篇文章主要介紹了探索python?dask靈活的并行計(jì)算庫應(yīng)用場景示例,Dask?是?Python?中的一個(gè)靈活的并行計(jì)算庫,允許用戶利用?CPU?內(nèi)核的強(qiáng)大功能,對大于內(nèi)存的數(shù)據(jù)集執(zhí)行分布式計(jì)算
    2024-01-01
  • Python queue模塊的用法

    Python queue模塊的用法

    本文主要介紹了Python queue模塊的用法,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2023-06-06
  • Django中使用Celery的方法示例

    Django中使用Celery的方法示例

    這篇文章主要介紹了Django中使用Celery的方法示例,小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2018-11-11
  • python實(shí)現(xiàn)字符串和數(shù)字拼接

    python實(shí)現(xiàn)字符串和數(shù)字拼接

    今天小編就為大家分享一篇python實(shí)現(xiàn)字符串和數(shù)字拼接,具有很好的參考價(jià)值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2020-03-03

最新評論

枣强县| 延安市| 墨脱县| 旺苍县| 原阳县| 佛教| 汉中市| 天津市| 江华| 永宁县| 马山县| 黄浦区| 洞口县| 麦盖提县| 通江县| 抚松县| 四平市| 久治县| 济宁市| 门头沟区| 东安县| 千阳县| 凤城市| 金坛市| 扎鲁特旗| 杭州市| 富裕县| 临江市| 龙岩市| 甘德县| 于田县| 孟津县| 鹤山市| 井陉县| 龙江县| 台南县| 安国市| 厦门市| 敖汉旗| 永顺县| 洪雅县|