最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

dede3.1分頁文字采集過濾規(guī)則詳說(圖文教程)續(xù)二

 更新時間:2007年04月03日 00:00:00   作者:  
稍微了解dede采集規(guī)則的朋友上篇內容完全可以略過,下面看看如何以靜制動、以不變就萬變地解決分頁采集問題。
二、采集新目標

目標地址:
1、http://www.tiansou.net/Html/Y_CYFW/R_Gzzj/F_Gzjh/index.html
2、http://www.tiansou.net/Html/Y_CYFW/R_Gzzj/F_Gzjh/2007-2/9/20070209110903558.html
之所以選取兩個目標頁面,是因為以上的兩個頁面一個有分頁,而另一個沒有,并且在分頁和全文取樣部分有較大的差別。以下的說明是在為采集目標地址(首頁)全部鏈接的基礎上改動的,個別地方會顯得蛇足,只為說明的方便。

目標文字部分頭部代碼1:


目標文字部分頭部代碼2:



通過比較不難發(fā)現,兩個文字部分的開始采集部分能確定下來為描黑部分,開頭部分好說,代碼如下:
復制代碼 代碼如下:

              <TR>
                <TD height="8"></TD>
              </TR>
              <TR>
                <TD valign="top" class=Connet><p>

目標文尾及分頁區(qū)域代碼1:



目標文尾及分頁區(qū)域代碼2:



比較一下兩個結尾,盡管想把第一個的結尾再往前提一點,但沒法子,要考慮到全部鏈接的共同部分,就只好取描黑的部分了,這也給今后確定過濾規(guī)則添了點麻煩,這是后話。先把結尾部分確定了吧:
復制代碼 代碼如下:

</p>
                  </TD>
              </TR>

相關文章

最新評論

南皮县| 酉阳| 通榆县| 濮阳县| 孟津县| 崇礼县| 宝鸡市| 秦皇岛市| 淳安县| 梅河口市| 柳林县| 洛阳市| 栾川县| 咸宁市| 井研县| 新竹县| 信阳市| 延津县| 台南市| 射洪县| 木兰县| 合水县| 华安县| 清涧县| 文安县| 吕梁市| 安岳县| 喀什市| 迁安市| 锦州市| 宝山区| 三门县| 宣威市| 洪江市| 车致| 天镇县| 万荣县| 紫阳县| 云阳县| 临江市| 惠水县|