學習下百度的原創內容的搜索方法及搜索服務器
0 X$ [$ k# D! [% F1 K0 W5 F3 T' ~# \5 F
1.搜索服務器接收客戶端發送的搜索詞。
* Y( N, u7 s8 \+ a: U( R" Y8 x' U' M( x: `4 y/ s: u! M' p; \
2.搜索服務器根據搜索詞獲得N 個搜索結果,N 為大於1 的正整數。' P4 Q" Y7 P/ Q) i
( Z* Y, b: d# o d3.搜索服務器對N 個搜索結果進行文本相似度分析。
4 W4 r+ `# E# Y8 e
9 R' x, J8 V" Y( e6 Y9 v4.通過深度學習技術計算搜索結果的文本相似度,並可認為文本相似度, l4 v1 w) M/ [% q
滿足預設閾值的搜索結果的主題內容一致,進而可根據主題內容對N 個搜索結果進行分組。* k: b! S0 i0 H3 p
4 n7 s, K2 Y& s: T: Q" l3 J- d5.獲得相似度滿足預設閾值的搜索結果的數量Q,並進一步判斷搜 索數量Q是否大於預設數量。0 N0 v. G& r6 m3 Q5 i
9 \2 a+ l! v2 J" i. J6.相似度滿足預設閾值的搜索結果組,可獲取其中搜索結果的數量Q,並進一步判斷每組中搜索結果的數量Q 是否大於預設數量。
' v& X$ t. E; A+ C" t$ t- O& _6 X
7.如果判斷大於預設數量,則搜索服務器從Q 個搜索結果中抽取M 個原創內容發佈源中的一個,其中,M 為正整數且小於N。其中,原創內容發佈源可以是具有原創內容的搜索結果的URL,具體地,如果有M組的搜索結果的數量Q大於預設數量,則可在這M組中每組分別抽取一個遠程內容發佈源。
. r! i* B3 i; {, }& c# C( S1 ?例如,可設定預設數量為10,對於搜索到的40 個搜索結果,如果文本相似度滿足
8 K: S- Z& u: d8 g% n. G) _: w* e預設閾值的搜索結果有A、B、C 三組,搜索結果數量分別8、12、14,則可在B 組合C 組中分別
. Z* P5 T" c2 C9 R- A- h抽取一個原創內容發佈源。; ?0 N" u& Y' R6 r5 L9 w
z+ s+ ~$ d/ G6 I9 b
8.根據權威網站獲取的原創數據對M 個原創內容發佈源進行修正。8 f3 Q* W. q8 T$ g; X
, H) ~) p {; J# f4 U- N% |. e |