搜尋引擎原理

搜尋引擎原理

搜尋引擎,通常指的是收集了全球資訊網上幾千萬到幾十億個網頁並對網頁中的每一個詞(即關鍵字)進行索引,建立索引資料庫全文搜尋引擎。當用戶查找某個關鍵字的時候,所有在頁面內容中包含了該關鍵字的網頁都將作為搜尋結果被搜出來。再經過複雜的算法進行排序(或者包含商業化的競價排名、商業推廣或者廣告)後,這些結果將按照與搜尋關鍵字的相關度高低(或與相關度毫無關係),依次排列。

基本介紹

  • 中文名:搜尋引擎原理
  • 外文名:Principle of Search Engine
  • 工作原理:爬行和抓取、建立索引等
  • 數據結構:倒排索引
引擎結構,分類,工作原理,工作流程,爬行和抓取,建立索引,搜尋詞處理,排序,數據結構,

引擎結構

搜尋引擎基本結構一般包括:搜尋器、索引器、檢索器、用戶接口等四個功能模組。
1)搜尋器,也叫網路蜘蛛,是搜尋引擎用來爬行和抓取網頁的一個自動程式,在系統後台不停歇地在網際網路各個節點爬行,在爬行過程中儘可能快的發現和抓取網頁。
2)索引器。它的主要功能是理解搜尋器所採集的網頁信息,並從中抽取索引項。
3)檢索器。其功能是快速查找文檔,進行文檔與查詢的相關度評價,對要輸出的結果進行排序。
4)用戶接口。它為用戶提供可視化的查詢輸入和結果輸出的界面。

分類

全文搜尋引擎一般都有一種叫作“網路機器人”或“網路蜘蛛”的軟體,這些軟體能遍歷WEB空間,掃描一定IP範圍內的網站,並延著網路上的連結從一個網頁到另一個網頁,從一個網站到另一個網站採集網頁資料。為了保持網頁資料的最新,它還會回訪已抓取的網頁。對已經抓取到的網頁,搜尋引擎還會用一定的程式進行分析,根據一定的相關度算法建立網頁索引,添加到索引資料庫中。全文搜尋引擎因為依靠軟體進行採集網頁,所以資料庫的容量非常龐大,但是,它的查詢結果往往不夠準確。我們平時看到的全文搜尋引擎,實際上是只是一個搜尋引擎的搜尋界面。當我們輸入關鍵字進行查詢時,搜尋引擎便會從寵大的索引資料庫中找到包含該關鍵字的所有相關網頁的索引,並按一定的排名規則呈現給我們。不同的搜尋引擎,網頁索引資料庫也不同,排名規則也不盡相同,所以當我們以同一關鍵字在不同的搜尋引擎上進行查詢時,搜尋的結果和排列順序通常也不相同。
搜尋引擎原理搜尋引擎原理
2、分類目錄搜尋引擎
和全文搜尋引擎一樣,分類目錄搜尋引擎的整個工作過程同樣也經過收集信息、分析信息和查詢信息三部分,只不過分類目錄搜尋引擎的前兩部分,收集信息和分析信息全部由人工來完成。分類目錄一般都有專門的編輯人員,負責收集網站的信息。分類目錄依靠人工收集和整理網站,能夠提供更為準確的查詢結果,但收集的內容卻非常有限。
3、元搜尋引擎
這類搜尋引擎一般都沒有自己的網頁搜尋軟體以及資料庫,它的搜尋結果是通過調用、控制和最佳化其它多個獨立搜尋引擎的搜尋結果並以一定的格式在同一界面集中顯示。通常元搜尋引擎在索引請求提交、檢索接口代理和檢索接口顯示等方面,均有自己開發的具有特色的元搜尋技術。在搜尋結果上,這些元搜尋引擎往往搜尋範圍更大一些。
4、集成搜尋引擎
集成搜尋引擎是通過網路技術在一個網頁上連結很多個獨立的搜尋引擎,查詢時,點選或指定搜尋引擎,一次輸入,多個搜尋引擎同時查詢。搜尋的結果由各個搜尋引擎分別以不同的頁面顯示。

工作原理

搜尋引擎的工作原理是從網際網路上抓取網頁,建立索引資料庫,在索引資料庫中搜尋排序。它的整個工作過程大體分為信息採集、信息分析、信息查詢和用戶接口四部分。信息採集是網路機器人掃描一定IP位址範圍內的網站,通過連結遍歷Web空間,來進行採集網頁資料,為保證採集的資料最新,網路機器人還會回訪已抓取過的網頁;信息分析是通過分析程式,從採集的信息中提取索引項,用索引項表示文檔並生成文檔庫的索引表,從而建立索引資料庫;信息查詢是指用戶以關鍵字查找信息時,搜尋引擎會根據用戶的查詢條件在索引庫中快速檢索文檔,然後對檢出的文檔與查詢條件的相關度進行評價,最後根據相關度對檢索結果進行排序並輸出。

工作流程

爬行和抓取

搜尋引擎派出一個能夠在網上發現新網頁並抓檔案的程式,這個程式通常稱之為蜘蛛(Spider)。搜尋引擎從已知的資料庫出發,就像正常用戶的瀏覽器一樣訪問這些網頁並抓取檔案。搜尋引擎通過這些爬蟲去爬網際網路上的外鏈,從這個網站爬到另一個網站,去跟蹤網頁中的連結,訪問更多的網頁,這個過程就叫爬行。這些新的網址會被存入資料庫等待搜尋。所以跟蹤網頁連結是搜尋引擎蜘蛛(Spider)發現新網址的最基本的方法,所以反向連結成為搜尋引擎最佳化的最基本因素之一。搜尋引擎抓取的頁面檔案與用戶瀏覽器得到的完全一樣,抓取的檔案存入資料庫。

建立索引

蜘蛛抓取的頁面檔案分解、分析,並以巨大表格的形式存入資料庫,這個過程即是索引(index)。在索引資料庫中,網頁文字內容,關鍵字出現的位置、字型、顏色、加粗、斜體等相關信息都有相應記錄。

搜尋詞處理

用戶在搜尋引擎界面輸入關鍵字,單擊“搜尋”按鈕後,搜尋引擎程式即對搜尋詞進行處理,如中文特有的分詞處理,去除停止詞,判斷是否需要啟動整合搜尋,判斷是否有拼寫錯誤或錯別字等情況。搜尋詞的處理必須十分快速。

排序

搜尋詞處理後,搜尋引擎程式便開始工作,從索引資料庫中找出所有包含搜尋詞的網頁,並且根據排名算法計算出哪些網頁應該排在前面,然後按照一定格式返回到“搜尋”頁面。再好的搜尋引擎也無法與人相比,這就是為什麼網站要進行搜尋引擎最佳化(SEO)。沒有SEO的幫助,搜尋引擎常常並不能正確的返回最相關、最權威、最有用的信息。

數據結構

倒排是搜尋引擎常用的數據結構之一,倒排索引是指用記錄的非主屬性值(也叫副鍵)來查找記錄而組織的檔案叫倒排檔案,即次索引。倒排檔案中包括了所有副鍵值,並列出了與之有關的所有記錄主鍵值,主要用於複雜查詢。 與傳統的SQL查詢不同,在搜尋引擎收集完數據的預處理階段,搜尋引擎往往需要一種高效的數據結構來對外提供檢索服務。而現行最有效的數據結構就是“倒排檔案”。倒排檔案簡單一點可以定義為用文檔的關鍵字作為索引,文檔作為索引目標的一種結構(類似於普通書籍中,索引是關鍵字,書的頁面是索引目標)。

相關詞條

熱門詞條

聯絡我們