过期域名预定抢注

 找回密碼
 免费注册

一個防採集思路

[複製鏈接]
發表於 2006-10-17 12:08:03 | 顯示全部樓層 |閱讀模式
前段日子接而連三發現自己站的內容給人採了,有點鬱悶,於是又開始研究防採集的策略,一點想法,在這裡和大家交流一下。1 P/ p; S' T& j/ w  h' X
$ }& U0 a1 o+ u. b5 n9 p
隨便在網上搜一下「防採集」,會出來N多結果,基本上都差不多。但在實際應用中,很少可以用得上或者難以實現。總結了一下,隨機碼和隨機模版可以防止一些採集系統,我之前的站也這麼做了。但現在的採集器功能實在太強,特別是隨即變量的出現使隨即碼完全沒有了意義,對於隨機模版採集者可能會花多點時間進行研究,但依然是可以採到的。
7 @4 ]3 g1 G* [( T( n! r( i  _2 t; Y5 {
採集系統的原理基本上都是利用代碼中存在[唯一的開始點]和[唯一的結束點],那麼,想徹底的防止採集,就必須讓代碼沒有[唯一的開始點]和[唯一的結束點]。4 m" b6 N- ~1 H, x3 g
, A( t2 ^- V( W8 R* B- b: S* X
   下面分析一下一般頁面的代碼結構:
0 ^! B4 @" m* ^% w/ o8 D7 s, \
<html>
- f- a  |3 S( w5 d<head>
) U$ o( O! w- A  G<title>標題塊<title>( A9 O; y9 L# d& _
</head>9 H, J! e7 [  E# @3 {: C
<body><div class="content">內容塊</div></body>
0 f  {# X9 S7 C9 y6 P  _5 t0 p</html>
& @9 h2 C) q  l" K6 k+ h1 ]0 y  D; ]- K# r  x4 H$ A5 \& g! k7 N
當然實際頁面中間會複雜很多,這裡只放上基本的結刮乙??析。很容易看出來,採集者採集這篇文章的內容會以<div class="content">開始以</div>結束。那麼,如何讓這些唯一的開始和結束不存在呢?我想到的是讓頁面中存在兩份一模一樣的代碼,那麼無論任何地方都不會有唯一的開始了。至於兩份一模一樣的代碼頁面顯示呈現出來的解決方法可以用DISPLAY或者註釋的辦法讓頁面正常顯示。比方,按上面的例子,我們代碼可以這樣寫:
4 u( G  d5 R" U8 M# _8 g& g0 [, E# P
<html>8 G  m9 d# K0 E& g& ~0 i
<head>; f" _" i; q2 ~2 b0 [6 p
<title>標題塊</title>
, i( k2 ~  F2 N# g</head>
1 V% j, j. P& d; }2 c0 ]<body><div class="content">內容塊</div><div class="other">其他內容</div></body>/ a* Z5 j) _0 M! k
</html>& M8 ^- o. K! M( I: c$ e& \8 ]3 ]  I
<!--' B6 I9 a7 \6 g+ d
<html>9 Y  Z' J8 J4 c
<head>' V) i0 ]" b) q6 {
<title></title>5 Z" S0 _& w/ J: B, W/ o+ z% O; V
</head>) l) n, Y* a8 p7 V5 N
<body><div class="content"></div><div class="other"></div></body>* l& X) |# t, {! ]) o) Y4 j3 j* K
</html>
& J( `1 i% c  T/ M0 ]-->
' V! t: J) [7 j& Y6 ]  B9 `
2 X; I9 i# l1 k( G; x上面的是實際上的頁面代碼,下面的是以這篇文章的模版代碼註釋多一次。
$ V; ^6 S* S" e2 y! ]8 L2 a; C7 B5 E8 E: i/ g0 l. S: S0 B% @  \
或許你會說,這塊內容
* Z% y4 r4 N% Q; M( U# u9 g3 Z
: I) B( x( [  i9 C: |, Q# A<!--, W6 r& H# ]5 b% B. Q( {% m; ]
<html>
. q% k7 u" R- P0 l: Y7 T% N+ X<head>3 x; ?  v" c5 b
<title></title>( I6 ^; }  X  G! @9 H
</head>+ A* T# \7 r" Q8 E$ q# D+ r& d
<body><div class="content">* [1 D+ ?- k- p* W# R0 |
4 k# k* `  C2 Q0 Y
是唯一的,然而實際上的頁面會比這個複雜非常多,會多出非常的內容塊,也就是說中間會有非常非常多的變量。8 s4 @6 r5 s& A. v
6 z0 k, k4 B2 J0 T7 R  e
  事實上,這種方法只是一個思路,第二份代碼可以不需要是整個頁面的複製品,而只是某一部分。當然這樣的方法同樣存在弊端(或許任何事得到一些注定要失去一些),就是會讓頁面的體積增大 ;] 如果不是將代碼複製一份而是將整個頁面內容複製一份出來,搜索引擎會不會認為EMU呢......
您需要登錄後才可以回帖 登錄 | 免费注册

本版積分規則

點基

GMT+8, 2026-8-28 03:20

By DZ X3.5

小黑屋

快速回復 返回頂部 返回列表