C#使用HtmlAgilityPack實(shí)現(xiàn)解析提取HTML內(nèi)容
寫在前面
HtmlAgilityPack是一個(gè)HTML解析類庫(kù),日常用法就是爬蟲獲取到內(nèi)容后,先用XPath獲取目標(biāo)節(jié)點(diǎn),再用正則進(jìn)行匹配;使用XPath的目的主要是將目標(biāo)節(jié)點(diǎn)或內(nèi)容限定在一個(gè)較小的范圍,如果一上來(lái)就用正則那效率肯定不行,因?yàn)檎齽t的規(guī)則設(shè)計(jì)耗時(shí)較長(zhǎng);而XPath直接可以用瀏覽器F12開發(fā)者工具窗口,鼠標(biāo)右鍵復(fù)制XPath獲得,非常方便。但在微觀內(nèi)容的操作上XPath就顯得太粗糙了,這時(shí)候就需要用正則來(lái)匹配,由于范圍已經(jīng)用XPath做過了篩選,所以此時(shí)的正則規(guī)則的設(shè)計(jì)要考慮的就很少了;兩者結(jié)合效率就大大提升了,解析HTML源碼實(shí)在是個(gè)耗時(shí)費(fèi)力的體力活。
老套路通過NuGet獲取類庫(kù)

代碼實(shí)現(xiàn)
using HtmlAgilityPack;
public static class HtmlDocumentMgr
{
#region Public Methods
public static HtmlNodeCollection GetNodes(string xPath)
{
var body = BrowserController.GetFrameBody();
var doc = GetHtmlDocument(body);
return doc.DocumentNode.SelectNodes(xPath);
}
public static HtmlNode GetNode(string xPath)
{
var body = BrowserController.GetFrameBody();
var doc = GetHtmlDocument(body);
return doc.DocumentNode.SelectSingleNode(xPath);
}
public static HtmlDocument GetHtmlDocument(string html)
{
var doc = new HtmlDocument();
doc.LoadHtml(html);
return doc;
}
#endregion
}
HTML 內(nèi)容可以是獨(dú)立爬蟲直接獲取的,也可以從內(nèi)嵌瀏覽器中獲得,本文采用內(nèi)嵌瀏覽器的方式,獲得HTML的代碼如下,僅做參考示意。
public static string GetFrameBody()
{
var js = "document.querySelector('body').outerHTML";
var evalRet = Browser.MainFrame.EvaluateScriptAsync(js);
evalRet.Wait();
if (evalRet.Result != null)
{
var ret = evalRet.Result.Result;
return ret.ToNormalString();
}
return string.Empty;
}調(diào)用示例
public static HtmlNode GetDescribeNode(string describe)
{
var body = BrowserController.GetFrameBody();
var doc = new HtmlDocument();
doc.LoadHtml(body);
var match = string.Format(".//label[contains(text(), \"{0}\")]", describe);
var labelNode = doc.DocumentNode.SelectSingleNode(match);
if (labelNode == null && describe.Contains(" "))
{
describe = describe.Replace(" ", " ");
match = string.Format(".//label[contains(text(), \"{0}\")]", describe);
labelNode = doc.DocumentNode.SelectSingleNode(match);
}
return labelNode;
}到此這篇關(guān)于C#使用HtmlAgilityPack實(shí)現(xiàn)解析提取HTML內(nèi)容的文章就介紹到這了,更多相關(guān)C# HtmlAgilityPack解析HTML內(nèi)容請(qǐng)搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
C#實(shí)現(xiàn)繪制隨機(jī)噪點(diǎn)和直線
這篇文章主要為大家詳細(xì)介紹了C#如何實(shí)現(xiàn)繪制隨機(jī)噪點(diǎn)和直線,文中的示例代碼講解詳細(xì),對(duì)我們學(xué)習(xí)C#有一定的幫助,感興趣的小伙伴可以跟隨小編一起了解一下2023-01-01
使用C#實(shí)現(xiàn)將CSV數(shù)據(jù)輕松轉(zhuǎn)換為PDF
將 CSV 數(shù)據(jù)轉(zhuǎn)換為 PDF 格式在許多業(yè)務(wù)中是一個(gè)常見的需求,在這篇文章中,我們將探討如何使用 使用 C# 和 Spire.XLS for .NET 庫(kù)高效地將 CSV 文件轉(zhuǎn)換為 PDF,希望對(duì)大家有所幫助2025-11-11
Linq兩個(gè)List集合取交集的實(shí)現(xiàn)
這篇文章主要介紹了Linq兩個(gè)List集合取交集的實(shí)現(xiàn),文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2019-12-12
C#實(shí)現(xiàn)獲得某個(gè)枚舉的所有名稱
這篇文章主要為大家詳細(xì)介紹了C#如何實(shí)現(xiàn)獲得某個(gè)枚舉的所有名稱,文中的示例代碼講解詳細(xì),具有一定的借鑒價(jià)值,有需要的小伙伴可以參考一下2025-01-01

