獲取CSDN文章內(nèi)容并轉(zhuǎn)換為markdown文本的python
更新時間:2020年09月06日 23:36:34 作者:tansty
這篇文章主要介紹了自己寫的小工具,可以直接獲取csdn文章并轉(zhuǎn)換為markdown格式,需要的朋友可以參考下
自己寫的小工具,可以直接獲取csdn文章并轉(zhuǎn)換為markdown格式
效果圖

核心代碼
from PySide2.QtWidgets import QApplication,QMainWindow,QPushButton,QPlainTextEdit,QMessageBox
import re
import parsel
import tomd
import requests
class CSDN():
def __init__(self):
self.windows = QMainWindow()
self.windows.resize(450, 300)
self.windows.setWindowTitle("輕松獲取csdn文章--by tansty")
self.setup_ui()
self.set_connect()
def set_connect(self):
#設(shè)置建立聯(lián)系
self.button.clicked.connect(self.spider_csdn)
def setup_ui(self):
#設(shè)置ui界面的建立
self.button = QPushButton(self.windows)
self.button.resize(100, 100)
self.button.move(150, 150)
self.button.setText("獲取文章")
self.text = QPlainTextEdit(self.windows)
self.text.setPlaceholderText("請輸入需要獲取文章的鏈接")
self.text.resize(450, 100)
def spider_csdn(self):
# 目標(biāo)文章的鏈接
title_url=self.text.toPlainText()
MessageBox = QMessageBox(self.windows)
if not title_url:
MessageBox.critical(self.windows, "錯誤", "請輸入網(wǎng)址")
return
head={"User-Agent":"Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/84.0.4147.105 Safari/537.36 Edg/84.0.522.52"
}
html=requests.get(url=title_url,headers=head).text
page=parsel.Selector(html)
#創(chuàng)建解釋器
title=page.css(".title-article::text").get()
res = re.compile("[^\u4e00-\u9fa5^a-z^A-Z^0-9]")
restr = ''
res.sub(restr, title)
content=page.css("article").get()
content=re.sub("<a.*?a>","",content)
content = re.sub("<br>", "", content)
texts=tomd.Tomd(content).markdown
#轉(zhuǎn)換為markdown 文件
with open(title+".md",mode="w",encoding="utf-8") as f:
f.write("#"+title)
f.write(texts)
MessageBox.information(self.windows,"正確","獲取文章完成")
if __name__ == '__main__':
app = QApplication()
csdn=CSDN()
csdn.windows.show()
app.exec_()
文件打包下載 鏈接: https://pan.baidu.com/s/1R6RcrDagwf1vWzmRCBja4w 提取碼: ug6n
相關(guān)文章
自定義Django_rest_framework_jwt登陸錯誤返回的解決
這篇文章主要介紹了自定義Django_rest_framework_jwt登陸錯誤返回的解決,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧2020-10-10
詳解NumPy中的線性關(guān)系與數(shù)據(jù)修剪壓縮
本文將通過股票均線計算的案例來為大家講解一下NumPy中的線性關(guān)系以及數(shù)據(jù)修剪壓縮的實現(xiàn),文中的示例代碼講解詳細(xì),感興趣的可以了解一下2022-05-05
使用Python實現(xiàn)屏幕截圖功能的詳細(xì)教程
Python使用ImageGrab截圖主要依賴于Pillow庫(PIL庫的一個分支),該庫提供了ImageGrab模塊來實現(xiàn)屏幕截圖功能,以下是一個詳細(xì)的截圖教程,需要的朋友可以參考下2025-01-01
Pandas實現(xiàn)在線文件和剪貼板數(shù)據(jù)讀取詳解
這篇文章主要為大家介紹的是Pandas兩種少用的讀取文件方式:讀取在線文件的數(shù)據(jù)和讀取剪貼板的數(shù)據(jù),感興趣的小伙伴可以跟隨小編一起學(xué)習(xí)一下2022-06-06
Python+wxPython實現(xiàn)自動生成PPTX文檔程序
這篇文章主要介紹了如何使用 wxPython 模塊和 python-pptx 模塊來編寫一個程序,用于生成包含首頁、內(nèi)容頁和感謝頁的 PPTX 文檔,感興趣的小伙伴可以學(xué)習(xí)一下2023-08-08

