精品国产乱码久久久久久小说,中文字幕无线码一区中文免费,国产午夜人做人免费视频中文

摘要：搜索引擎，通常指的是收集了因特網(wǎng)上幾千萬(wàn)到幾十億個(gè)網(wǎng)頁(yè)并對(duì)網(wǎng)頁(yè)中的每一個(gè)詞（即關(guān)鍵詞）進(jìn)行索引，建立索引數(shù)據(jù)庫(kù)的全文搜索引擎。當(dāng)用戶(hù)查找某個(gè)關(guān)鍵詞的時(shí)候，所有在頁(yè)面內(nèi)容中包含了該關(guān)鍵詞的網(wǎng)頁(yè)都將作為...

搜索引擎，通常指的是收集了因特網(wǎng)上幾千萬(wàn)到幾十億個(gè)網(wǎng)頁(yè)并對(duì)網(wǎng)頁(yè)中的每一個(gè)詞（即關(guān)鍵詞）進(jìn)行索引，建立索引數(shù)據(jù)庫(kù)的全文搜索引擎。當(dāng)用戶(hù)查找某個(gè)關(guān)鍵詞的時(shí)候，所有在頁(yè)面內(nèi)容中包含了該關(guān)鍵詞的網(wǎng)頁(yè)都將作為搜索結(jié)果被搜出來(lái)。在經(jīng)過(guò)復(fù)雜的算法進(jìn)行排序后，這些結(jié)果將按照與搜索關(guān)鍵詞的相關(guān)度高低，依次排列。根據(jù)自己的優(yōu)化程度，獲得相應(yīng)的名次。

原理概述

在搜索引擎的后臺(tái)，有一些用于搜集網(wǎng)頁(yè)信息的程序。所收集的信息一般是能表明網(wǎng)站內(nèi)容（包括網(wǎng)頁(yè)本身、網(wǎng)頁(yè)的URL地址、構(gòu)成網(wǎng)頁(yè)的代碼以及進(jìn)出網(wǎng)頁(yè)的連接）的關(guān)鍵詞或者短語(yǔ)。接著將這些信息的索引存放到數(shù)據(jù)庫(kù)中。
搜索引擎原理詳解
搜索引擎的系統(tǒng)架構(gòu)和運(yùn)行方式吸收了信息檢索系統(tǒng)設(shè)計(jì)中許多有價(jià)值的經(jīng)驗(yàn)，也針對(duì)萬(wàn)維網(wǎng)數(shù)據(jù)和用戶(hù)的特點(diǎn)進(jìn)行了許多修改，如右圖所示的搜索引擎系統(tǒng)架構(gòu)。其核心的文檔處理和查詢(xún)處理過(guò)程與傳統(tǒng)信息檢索系統(tǒng)的運(yùn)行原理基本類(lèi)似，但其所處理的數(shù)據(jù)對(duì)象即萬(wàn)維網(wǎng)數(shù)據(jù)的繁雜特性決定了搜索引擎系統(tǒng)必須進(jìn)行系統(tǒng)結(jié)構(gòu)的調(diào)整，以適應(yīng)處理數(shù)據(jù)和用戶(hù)查詢(xún)的需要。

工作原理
搜索引擎原理詳解
爬行和抓取

搜索引擎派出一個(gè)能夠在網(wǎng)上發(fā)現(xiàn)新網(wǎng)頁(yè)并抓文件的程序，這個(gè)程序通常稱(chēng)之為蜘蛛（Spider）。搜索引擎從已知的數(shù)據(jù)庫(kù)出發(fā)，就像正常用戶(hù)的瀏覽器一樣訪(fǎng)問(wèn)這些網(wǎng)頁(yè)并抓取文件。搜索引擎通過(guò)這些爬蟲(chóng)去爬互聯(lián)網(wǎng)上的外鏈，從這個(gè)網(wǎng)站爬到另一個(gè)網(wǎng)站，去跟蹤網(wǎng)頁(yè)中的鏈接，訪(fǎng)問(wèn)更多的網(wǎng)頁(yè)，這個(gè)過(guò)程就叫爬行。這些新的網(wǎng)址會(huì)被存入數(shù)據(jù)庫(kù)等待搜索。所以跟蹤網(wǎng)頁(yè)鏈接是搜索引擎蜘蛛（Spider）發(fā)現(xiàn)新網(wǎng)址的最基本的方法，所以反向鏈接成為搜索引擎優(yōu)化的最基本因素之一。搜索引擎抓取的頁(yè)面文件與用戶(hù)瀏覽器得到的完全一樣，抓取的文件存入數(shù)據(jù)庫(kù)。

建立索引

蜘蛛抓取的頁(yè)面文件分解、分析，并以巨大表格的形式存入數(shù)據(jù)庫(kù)，這個(gè)過(guò)程即是索引（index).在索引數(shù)據(jù)庫(kù)中，網(wǎng)頁(yè)文字內(nèi)容，關(guān)鍵詞出現(xiàn)的位置、字體、顏色、加粗、斜體等相關(guān)信息都有相應(yīng)記錄。

搜索詞處理

用戶(hù)在搜索引擎界面輸入關(guān)鍵詞，單擊“搜索”按鈕后，搜索引擎程序即對(duì)搜索詞進(jìn)行處理，如中文特有的分詞處理，去除停止詞，判斷是否需要啟動(dòng)整合搜索，判斷是否有拼寫(xiě)錯(cuò)誤或錯(cuò)別字等情況。搜索詞的處理必須十分快速。

排序

對(duì)搜索詞處理后，搜索引擎程序便開(kāi)始工作，從索引數(shù)據(jù)庫(kù)中找出所有包含搜索詞的網(wǎng)頁(yè)，并且根據(jù)排名算法計(jì)算出哪些網(wǎng)頁(yè)應(yīng)該排在前面，然后按照一定格式返回到“搜索”頁(yè)面。

再好的搜索引擎也無(wú)法與人相比，這就是為什么網(wǎng)站要進(jìn)行搜索引擎優(yōu)化。沒(méi)有SEO的幫助，搜索引擎常常并不能正確的返回最相關(guān)、最權(quán)威、最有用的信息。

數(shù)據(jù)結(jié)構(gòu)

搜索引擎的核心數(shù)據(jù)結(jié)構(gòu)為倒排文件（也稱(chēng)倒排索引），倒排索引是指用記錄的非主屬性值(也叫副鍵)來(lái)查找記錄而組織的文件叫倒排文件，即次索引。倒排文件中包括了所有副鍵值，并列出了與之有關(guān)的所有記錄主鍵值，主要用于復(fù)雜查詢(xún)。與傳統(tǒng)的SQL查詢(xún)不同，在搜索引擎收集完數(shù)據(jù)的預(yù)處理階段，搜索引擎往往需要一種高效的數(shù)據(jù)結(jié)構(gòu)來(lái)對(duì)外提供檢索服務(wù)。而現(xiàn)行最有效的數(shù)據(jù)結(jié)構(gòu)就是“倒排文件”。倒排文件簡(jiǎn)單一點(diǎn)可以定義為“用文檔的關(guān)鍵詞作為索引，文檔作為索引目標(biāo)的一種結(jié)構(gòu)（類(lèi)似于普通書(shū)籍中，索引是關(guān)鍵詞，書(shū)的頁(yè)面是索引目標(biāo)）。
全文搜索引擎

在搜索引擎分類(lèi)部分我們提到過(guò)全文搜索引擎從網(wǎng)站提取信息建立網(wǎng)頁(yè)數(shù)據(jù)庫(kù)的概念。搜索引擎的自動(dòng)信息搜集功能分兩種。一種是定期搜索，即每隔一段時(shí)間（比如Google一般是28天），搜索引擎主動(dòng)派出“蜘蛛”程序，對(duì)一定IP地址范圍內(nèi)的互聯(lián)網(wǎng)站進(jìn)行檢索，一旦發(fā)現(xiàn)新的網(wǎng)站，它會(huì)自動(dòng)提取網(wǎng)站的信息和網(wǎng)址加入自己的數(shù)據(jù)庫(kù)。

另一種是提交網(wǎng)站搜索，即網(wǎng)站擁有者主動(dòng)向搜索引擎提交網(wǎng)址，它在一定時(shí)間內(nèi)（2天到數(shù)月不等）定向向你的網(wǎng)站派出“蜘蛛”程序，掃描你的網(wǎng)站并將有關(guān)信息存入數(shù)據(jù)庫(kù)，以備用戶(hù)查詢(xún)。由于搜索引擎索引規(guī)則發(fā)生了很大變化，主動(dòng)提交網(wǎng)址并不保證你的網(wǎng)站能進(jìn)入搜索引擎數(shù)據(jù)庫(kù)，因此目前最好的辦法是多獲得一些外部鏈接，讓搜索引擎有更多機(jī)會(huì)找到你并自動(dòng)將你的網(wǎng)站收錄。

當(dāng)用戶(hù)以關(guān)鍵詞查找信息時(shí)，搜索引擎會(huì)在數(shù)據(jù)庫(kù)中進(jìn)行搜尋，如果找到與用戶(hù)要求內(nèi)容相符的網(wǎng)站，便采用特殊的算法——通常根據(jù)網(wǎng)頁(yè)中關(guān)鍵詞的匹配程度，出現(xiàn)的位置/頻次，鏈接質(zhì)量等——計(jì)算出各網(wǎng)頁(yè)的相關(guān)度及排名等級(jí)，然后根據(jù)關(guān)聯(lián)度高低，按順序?qū)⑦@些網(wǎng)頁(yè)鏈接返回給用戶(hù)。

轉(zhuǎn)載請(qǐng)保留原文地址: http://www.hlqj168.cn/show-545.html

搜索引擎原理詳解

時(shí)間：2016/4/13 21:29:21 點(diǎn)擊：298

相關(guān)文章

本類(lèi)熱門(mén)

本類(lèi)推薦

本類(lèi)固頂