主頁 > 知識庫 > 雨哲防采集策略之列表篇

雨哲防采集策略之列表篇

熱門標簽:服務器配置 銀行業(yè)務 Linux服務器 科大訊飛語音識別系統(tǒng) 團購網站 阿里云 Mysql連接數(shù)設置 電子圍欄
在一般的鏈接地址形式如:  
復制代碼 代碼如下:

1、a class="鏈接樣式" href="鏈接地址" title="鏈接說明" target="_blank">文章標題/a>  
2、a class='鏈接樣式' href='鏈接地址' title='鏈接說明' target='_blank'>文章標題/a>  

       大家注意看上面兩行代碼,有一個區(qū)別就是第一個中間使用的是雙引號,第二個使用的是單引號。一般來說,如果在文章列表頁面都使用雙引號或者使用單引號,很容易讓采集者找到文章路徑(開始代碼:href=' ,結束代碼:' )。 

      那如果我們混合著用,也就是有的使用單引號,有的使用雙引號,那么就會給采集者帶來一定的麻煩。至少他不能采集到所有文章(如果采集程序差一點的話可能一篇也采集不到)。 

在上面的基礎上,更深入一步將A中間的參數(shù)進行隨機排列:  
復制代碼 代碼如下:

a href="鏈接地址" title="鏈接說明" target="_blank" class="鏈接樣式">  
a href="鏈接地址" class="鏈接樣式" title="鏈接說明" target="_blank">  
a title="鏈接說明" href="鏈接地址" class="鏈接樣式" target="_blank">  
       然后再在其中混用單雙引號,在href=后面還可以不使用引號。那么采集者將不能正確獲取列表頁面中文章地址。 

       再深入一步,可以在列表中加入干擾碼,如把鏈接部分重復加一次空白鏈接,(a href="鏈接地址" title="鏈接說明" target="_blank" class="鏈接樣式">/a>),那么如果對方能夠獲取一部分文章地址,或者能夠采集一部分文章,那么這部分文章也肯定是重復的。 

在進行以上修改后,我想大部分采集者都會知難退的哈。缺點就是代碼不太標準。以上僅雨哲個人觀點。 

標簽:萍鄉(xiāng) 江蘇 大理 廣元 蚌埠 棗莊 衢州 衡水

巨人網絡通訊聲明:本文標題《雨哲防采集策略之列表篇》,本文關鍵詞  ;如發(fā)現(xiàn)本文內容存在版權問題,煩請?zhí)峁┫嚓P信息告之我們,我們將及時溝通與處理。本站內容系統(tǒng)采集于網絡,涉及言論、版權與本站無關。
  • 相關文章
  • 收縮
    • 微信客服
    • 微信二維碼
    • 電話咨詢

    • 400-1100-266