最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python實(shí)現(xiàn)復(fù)制文檔數(shù)據(jù)

 更新時(shí)間:2022年12月14日 14:06:17   作者:魔王不會(huì)哭  
我們百度搜索一些東西得時(shí)候,經(jīng)常找到文檔里面然后就會(huì)發(fā)現(xiàn)需要充值才能復(fù)制!怎么可以不花錢(qián)也保存呢?今天就分享給大家一個(gè)python獲取文檔數(shù)據(jù)得方法,需要的可以收藏一下

前言

我們百度搜索一些東西得時(shí)候,經(jīng)常找到文檔里面

然后就會(huì)發(fā)現(xiàn)需要充值才能復(fù)制!怎么可以不花錢(qián)也保存呢?

今天就分享給大家一個(gè)python獲取文檔數(shù)據(jù)得方法

環(huán)境使用

python 3.8

pycharm

模塊使用

requests >>> 數(shù)據(jù)請(qǐng)求模塊 pip install requests

docx >>> 文檔保存 pip install python-docx

re 內(nèi)置模塊 不需要安裝

ctrl + R : 首先你得看得數(shù)據(jù), 才能想辦法獲取

安裝python第三方模塊

win + R 輸入 cmd 點(diǎn)擊確定, 輸入安裝命令 pip install 模塊名 (pip install requests) 回車(chē)

在pycharm中點(diǎn)擊Terminal(終端) 輸入安裝命令

基本思路流程

一. 分析數(shù)據(jù)來(lái)源

找文檔數(shù)據(jù)內(nèi)容, 是在那個(gè)url里面生成的

通過(guò)開(kāi)發(fā)者工具進(jìn)行抓包分析

1.打開(kāi)開(kāi)發(fā)者工具: F12 / 鼠標(biāo)右鍵點(diǎn)擊檢查選擇network

2.刷新網(wǎng)頁(yè): 讓本網(wǎng)頁(yè)數(shù)據(jù)內(nèi)容重新加載一遍

如果你是非VIP賬號(hào), 看數(shù)據(jù), 圖片形式 —> 把數(shù)據(jù)<圖片> 獲取下來(lái) —> 做文字識(shí)別

3.分析文庫(kù)數(shù)據(jù)內(nèi)容, 圖片所在地址

獲取所有圖片內(nèi)容: 文庫(kù)數(shù)據(jù) --> 圖片形式 —> 所有圖片內(nèi)容保存下載

文字識(shí)別, 把圖片文字識(shí)別出來(lái), 保存word文檔里面

二. 代碼實(shí)現(xiàn)步驟

1.發(fā)送請(qǐng)求, 模擬瀏覽器對(duì)于url地址發(fā)送請(qǐng)求

圖片數(shù)據(jù)包

2.獲取數(shù)據(jù), 獲取服務(wù)器返回響應(yīng)數(shù)據(jù)

開(kāi)發(fā)者工具: response

3.解析數(shù)據(jù), 提取圖片鏈接地址

4.保存數(shù)據(jù), 把圖片內(nèi)容保存到本地文件夾

5.做文字識(shí)別, 識(shí)別文字內(nèi)容

6.把文字?jǐn)?shù)據(jù)信息, 保存word文檔里面

代碼展示

# 導(dǎo)入數(shù)據(jù)請(qǐng)求模塊
import requests
# 導(dǎo)入格式化輸出模塊
from pprint import pprint
# 導(dǎo)入base64
import base64
# 導(dǎo)入os模塊
import os
# 導(dǎo)入文檔模塊
from docx import Document
# 導(dǎo)入正則
import re
# 導(dǎo)入json
import json

文字識(shí)別:

  • 注冊(cè)一個(gè)百度云API賬號(hào)
  • 創(chuàng)建應(yīng)用 并且去免費(fèi)領(lǐng)取資源
  • 在技術(shù)文檔里面 Access Token獲取
  • 調(diào)用API接口去做文字識(shí)別
def get_content(file):
    # client_id 為官網(wǎng)獲取的AK, client_secret 為官網(wǎng)獲取的SK
    host = 'https://aip.****.com/oauth/2.0/token?grant_type=client_credentials&client_id=Gu7BGsfoKFZjLGvOKP7WezYv&client_secret=rGa2v2FcVnxBDFlerSW5H0D2eO7nRxdp'
    response = requests.get(host)
    access_token = response.json()['access_token']
    '''
    通用文字識(shí)別(高精度版)
    '''
    request_url = "https://aip.****.com/rest/2.0/ocr/v1/accurate_basic"
    # 二進(jìn)制方式打開(kāi)圖片文件
    f = open(file, 'rb')
    img = base64.b64encode(f.read())
    params = {"image":img}
    request_url = request_url + "?access_token=" + access_token
    headers = {'content-type': 'application/x-www-form-urlencoded'}
    json_data = requests.post(request_url, data=params, headers=headers).json()
    # 列表推導(dǎo)式
    words = '\n'.join([i['words'] for i in json_data['words_result']])
    return words
# # 讀取文件夾里面所有圖片內(nèi)容
# content_list = []
# files = os.listdir('img\\')
# for file in files:
#     filename = 'img\\' + file
#     words = get_content(file=filename)
#     print(words)
#     content_list.append(words)
#
# # 保存word文檔里面
# doc = Document()
# # 添加第一段文檔內(nèi)容
# content = '\n'.join(content_list)
# doc.add_paragraph(content)
# doc.save('data.docx')
link = 'https://wenku.****.com/aggs/74d1a923482fb4daa58d4b8e?index=0&_wkts_=1670327737660&bdQuery=%E7%AD%94%E9%A2%98'
# 請(qǐng)求頭
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36'
}
html_data = requests.get(url=link, headers=headers).text
json_data = json.loads(re.findall('var pageData = (.*?);', html_data)[0])
pprint(json_data)
for j in json_data['aggInfo']['docList']:
    name = j['title']  # 名字
    score = j['score'] # 評(píng)分
    viewCount = j['viewCount'] # 閱讀量
    downloadCount = j['downloadCount'] # 下載量
    docId = j['docId'] # 數(shù)據(jù)包ID

1.發(fā)送請(qǐng)求, 模擬瀏覽器對(duì)于url地址發(fā)送請(qǐng)求

長(zhǎng)鏈接, 可以分段寫(xiě)

問(wèn)號(hào)前面: url鏈接

問(wèn)號(hào)后面: 請(qǐng)求參數(shù)/查詢(xún)參數(shù)

    # 確定請(qǐng)求鏈接
    url = 'https://wenku.****.com/gsearch/rec/pcviewdocrec'
    # 請(qǐng)求參數(shù)
    data = {
        'docId': docId,
        'query': name,
        'recPositions': ''
    }
    # 請(qǐng)求頭
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/101.0.0.0 Safari/537.36'
    }
    #發(fā)送請(qǐng)求
    response = requests.get(url=url, params=data, headers=headers)
    # <Response [200]> 響應(yīng)對(duì)象, 200 表示請(qǐng)求成功
    print(response)

2.獲取數(shù)據(jù), 獲取服務(wù)器返回響應(yīng)數(shù)據(jù)

開(kāi)發(fā)者工具: response

  • response.json() 獲取響應(yīng)json字典數(shù)據(jù), 但是返回?cái)?shù)據(jù)必須是完整json數(shù)據(jù)格式 花括號(hào) {}
  • response.text 獲取響應(yīng)文本數(shù)據(jù), 返回字符串 任何時(shí)候都可以, 但是基本獲取網(wǎng)頁(yè)源代碼的時(shí)候
  • response.content 獲取響應(yīng)二進(jìn)制數(shù)據(jù), 返回字節(jié) 保存圖片/音頻/視頻/特定格式文件
  • print(response.json()) 打印字典數(shù)據(jù), 呈現(xiàn)一行
  • pprint(response.json()) 打印字典數(shù)據(jù), 呈現(xiàn)多行, 展開(kāi)效果

3.解析數(shù)據(jù), 提取圖片鏈接地址

字典取值: 鍵值對(duì) 根據(jù)冒號(hào)左邊內(nèi)容[鍵], 提取冒號(hào)右邊的內(nèi)容[值]

    # 定義文件名 整型
    num = 1
    # for循環(huán)遍歷, 把列表里面元素一個(gè)一個(gè)提取出來(lái)
    for index in response.json()['data']['relateDoc']:
        # index 字典呀
        pic = index['pic']
        print(pic)
        # # 4. 保存數(shù)據(jù)  發(fā)送請(qǐng)求 + 獲取數(shù)據(jù) 二進(jìn)制數(shù)據(jù)內(nèi)容
        # img_content = requests.get(url=pic, headers=headers).content
        # # 'img\\'<文件夾名字> + str(num)<文件名> + '.jpg'<文件后綴>  mode='wb' 保存方式, 二進(jìn)制保存
        # # str(num) 強(qiáng)制轉(zhuǎn)換成 字符串
        # # '圖片\\' 相對(duì)路徑, 相對(duì)于你代碼的路徑 你代碼在那個(gè)地方, 那個(gè)代碼所在地方圖片文件夾
        # with open('圖片\\' + str(num) + '.jpg', mode='wb') as f:
        #     # 寫(xiě)入數(shù)據(jù) 保存數(shù)據(jù)  把圖片二進(jìn)制數(shù)據(jù)保存
        #     f.write(img_content)
        # # 每次循環(huán) + 1
        # print(num)
        # num += 1

以上就是Python實(shí)現(xiàn)復(fù)制文檔數(shù)據(jù)的詳細(xì)內(nèi)容,更多關(guān)于Python復(fù)制文檔數(shù)據(jù)的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • python備份文件的腳本

    python備份文件的腳本

    作用:將目錄備份到其他路徑。
    2008-08-08
  • Python中操作各種多媒體,視頻、音頻到圖片的代碼詳解

    Python中操作各種多媒體,視頻、音頻到圖片的代碼詳解

    這篇文章主要介紹了Python玩轉(zhuǎn)各種多媒體,視頻、音頻到圖片,本文通過(guò)實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-06-06
  • 淺析Python 條件控制語(yǔ)句

    淺析Python 條件控制語(yǔ)句

    這篇文章主要介紹了Python 條件控制語(yǔ)句的相關(guān)資料,文中講解非常細(xì)致,幫助大家更好的理解和學(xué)習(xí),感興趣的朋友可以了解下
    2020-07-07
  • python交互模式基礎(chǔ)知識(shí)點(diǎn)學(xué)習(xí)

    python交互模式基礎(chǔ)知識(shí)點(diǎn)學(xué)習(xí)

    在本篇內(nèi)容里小編給大家整理的是關(guān)于python交互模式是什么的相關(guān)基礎(chǔ)知識(shí)點(diǎn),需要的朋友們可以參考下。
    2020-06-06
  • Python中Matplotlib的簡(jiǎn)單使用

    Python中Matplotlib的簡(jiǎn)單使用

    這篇文章主要介紹了Python中Matplotlib的簡(jiǎn)單使用,Matplotlib是一個(gè)用于繪制數(shù)據(jù)可視化圖形的Python庫(kù),支持繪制各種靜態(tài),動(dòng)態(tài),交互式的圖表,它是數(shù)據(jù)科學(xué)和機(jī)器學(xué)習(xí)領(lǐng)域最流行的可視化庫(kù)之一,需要的朋友可以參考下
    2023-07-07
  • Python通過(guò)DOM和SAX方式解析XML的應(yīng)用實(shí)例分享

    Python通過(guò)DOM和SAX方式解析XML的應(yīng)用實(shí)例分享

    這篇文章主要介紹了Python通過(guò)DOM和SAX方式解析XML的應(yīng)用實(shí)例分享,針對(duì)這兩種解析方式Python都有相關(guān)的模塊可供使用,需要的朋友可以參考下
    2015-11-11
  • Python列表與元組操作技巧分享

    Python列表與元組操作技巧分享

    Python 中的列表(List)和元組(Tuple)是兩種常用的數(shù)據(jù)結(jié)構(gòu),它們都可以用來(lái)存儲(chǔ)一系列的元素,在本文中,我們將分享一些 Python 中列表和元組的操作技巧,幫助您更好地理解它們的用法和特性,需要的朋友可以參考下
    2024-05-05
  • 使用python處理題庫(kù)表格并轉(zhuǎn)化為word形式的實(shí)現(xiàn)

    使用python處理題庫(kù)表格并轉(zhuǎn)化為word形式的實(shí)現(xiàn)

    這篇文章主要介紹了使用python處理題庫(kù)表格并轉(zhuǎn)化為word形式的實(shí)現(xiàn),文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧
    2020-04-04
  • pycharm中顯示CSS提示的知識(shí)點(diǎn)總結(jié)

    pycharm中顯示CSS提示的知識(shí)點(diǎn)總結(jié)

    在本篇文章里小編給大家整理了關(guān)于pycharm中顯示CSS提示的知識(shí)點(diǎn)內(nèi)容,需要的朋友們可以參考學(xué)習(xí)下。
    2019-07-07
  • python爬蟲(chóng)學(xué)習(xí)筆記之pyquery模塊基本用法詳解

    python爬蟲(chóng)學(xué)習(xí)筆記之pyquery模塊基本用法詳解

    這篇文章主要介紹了python爬蟲(chóng)學(xué)習(xí)筆記之pyquery模塊基本用法,結(jié)合實(shí)例形式詳細(xì)分析了python爬蟲(chóng)pyquery模塊基本功能、用法及操作注意事項(xiàng),需要的朋友可以參考下
    2020-04-04

最新評(píng)論

阳城县| 吉林市| 天门市| 尖扎县| 霍城县| 冕宁县| 富裕县| 攀枝花市| 舟山市| 水富县| 上杭县| 南康市| 游戏| 图木舒克市| 富裕县| 繁昌县| 临泉县| 大名县| 同德县| 巴塘县| 雷波县| 潢川县| 上杭县| 遵化市| 元阳县| 湖南省| 西贡区| 汝州市| 缙云县| 泾阳县| 宣汉县| 博客| 江都市| 章丘市| 汉川市| 定兴县| 成都市| 林芝县| 怀宁县| 宿松县| 蒙山县|