網(wǎng)站改版、換域名在互聯(lián)網(wǎng)飛速發(fā)展的情況下是不可避免的,但處理不當(dāng),會(huì)造成重大的流量損失。改版、換域名需要考慮的第一要點(diǎn)就是如何保證老用戶不流失,當(dāng)用戶訪問(wèn)舊內(nèi)容時(shí),能引導(dǎo)用戶到新網(wǎng)站上對(duì)應(yīng)的內(nèi)容,避免出現(xiàn)用戶訪問(wèn)不到以前收藏的網(wǎng)頁(yè)的情況。
我們建議在改版或者換域名時(shí),將舊網(wǎng)頁(yè)301永久重定向到內(nèi)容對(duì)應(yīng)的新網(wǎng)頁(yè),這樣百度更容易發(fā)現(xiàn)這個(gè)轉(zhuǎn)變,并迅速的將舊網(wǎng)頁(yè)積累的權(quán)值傳遞給對(duì)應(yīng)的新網(wǎng)頁(yè)。
其他建議:
? 如非必要,不要做整站內(nèi)容的完全更換
網(wǎng)站改版或者網(wǎng)站內(nèi)重要頁(yè)面鏈接發(fā)生變動(dòng)時(shí),應(yīng)該將改版前的頁(yè)面301永久重定向到改版后的對(duì)應(yīng)的頁(yè)面
? 網(wǎng)站更換域名,應(yīng)該將舊域名的所有頁(yè)面301永久重定向到新域名上對(duì)應(yīng)的頁(yè)面
網(wǎng)站更換域名后,維持舊域名能穩(wěn)定訪問(wèn)盡可能長(zhǎng)的時(shí)間,給用戶多一些時(shí)間記憶新域名
? 網(wǎng)站改版/更換域名后,請(qǐng)把新的URL/新域名下的URL,通過(guò)sitemap提交給百度,幫助百度更快發(fā)現(xiàn)和作出調(diào)整。
合理的返回碼
百度爬蟲在進(jìn)行抓取和處理時(shí),是根據(jù)http協(xié)議規(guī)范來(lái)設(shè)置相應(yīng)的邏輯的,所以請(qǐng)站長(zhǎng)們也盡量參考http協(xié)議中關(guān)于返回碼的含義的定義來(lái)進(jìn)行設(shè)置。
百度spider對(duì)常用的http返回碼的處理邏輯是這樣的:
? 404
404返回碼的含義是“NOT FOUND”,百度會(huì)認(rèn)為網(wǎng)頁(yè)已經(jīng)失效,那么通常會(huì)從搜索結(jié)果中刪除,并且短期內(nèi)spider再次發(fā)現(xiàn)這條url也不會(huì)抓取。
? 503
503返回碼的含義是“Service Unavailable”,百度會(huì)認(rèn)為該網(wǎng)頁(yè)臨時(shí)不可訪問(wèn),通常網(wǎng)站臨時(shí)關(guān)閉,帶寬有限等會(huì)產(chǎn)生這種情況。對(duì)于網(wǎng)頁(yè)返回503,百度spider不會(huì)把這條url直接刪除,短期內(nèi)會(huì)再訪問(wèn)。屆時(shí)如果網(wǎng)頁(yè)已恢復(fù),則正常抓取;如果繼續(xù)返回503,短期內(nèi)還會(huì)反復(fù)訪問(wèn)幾次。但是如果網(wǎng)頁(yè)長(zhǎng)期返回503,那么這個(gè)url仍會(huì)被百度認(rèn)為是失效鏈接,從搜索結(jié)果中刪除。
? 403
403返回碼的含義是“Forbidden”,百度會(huì)認(rèn)為網(wǎng)頁(yè)當(dāng)前禁止訪問(wèn)。對(duì)于這種情況,如果是新發(fā)現(xiàn)的url,百度spider暫不會(huì)抓取,短期內(nèi)會(huì)再次檢查;如果是百度已收錄url,當(dāng)前也不會(huì)直接刪除,短期內(nèi)同樣會(huì)再訪問(wèn)。屆時(shí)如果網(wǎng)頁(yè)允許訪問(wèn),則正常抓?。蝗绻圆辉试S訪問(wèn),短期內(nèi)還會(huì)反復(fù)訪問(wèn)幾次。但是如果網(wǎng)頁(yè)長(zhǎng)期返回403,百度也會(huì)認(rèn)為是失效鏈接,從搜索結(jié)果中刪除。
? 301
301返回碼的含義是“Moved Permanently”,百度會(huì)認(rèn)為網(wǎng)頁(yè)當(dāng)前跳轉(zhuǎn)至新url。當(dāng)遇到站點(diǎn)遷移,域名更換、站點(diǎn)改版的情況時(shí),推薦使用301返回碼,盡量減少改版帶來(lái)的流量損失。雖然百度spider現(xiàn)在對(duì)301跳轉(zhuǎn)的響應(yīng)周期較長(zhǎng),但我們還是推薦大家這么做。
我們建議:
? 如果站點(diǎn)臨時(shí)關(guān)閉,當(dāng)網(wǎng)頁(yè)不能打開時(shí),不要立即返回404,建議使用503狀態(tài)。503可以告知百度spider該頁(yè)面臨時(shí)不可訪問(wèn),請(qǐng)過(guò)段時(shí)間再重試。
? 如果百度spider對(duì)您的站點(diǎn)抓取壓力過(guò)大,請(qǐng)盡量不要使用404,同樣建議返回503。這樣百度spider會(huì)過(guò)段時(shí)間再來(lái)嘗試抓取這個(gè)鏈接,如果那個(gè)時(shí)間站點(diǎn)空閑,那它就會(huì)被成功抓取了。
? 有一些網(wǎng)站希望百度只收錄部分內(nèi)容,例如審核后的內(nèi)容,累積一段時(shí)間的新用戶頁(yè)等等。在這種情況,建議新發(fā)內(nèi)容暫時(shí)返回403,等審核或做好處理之后,再返回正常狀態(tài)的返回碼。
? 站點(diǎn)遷移,或域名更換時(shí),請(qǐng)使用301返回。
良好排序
涵蓋網(wǎng)頁(yè)上主要內(nèi)容的title
網(wǎng)頁(yè)的title用于告訴用戶和搜索引擎這個(gè)網(wǎng)頁(yè)的主要內(nèi)容是什么,搜索引擎在判斷一個(gè)網(wǎng)頁(yè)內(nèi)容權(quán)重時(shí),title是主要參考信息之一。網(wǎng)頁(yè)title是網(wǎng)頁(yè)上主要內(nèi)容的概括,搜索引擎可以通過(guò)網(wǎng)頁(yè)標(biāo)題迅速的判斷網(wǎng)頁(yè)的主題。每個(gè)網(wǎng)頁(yè)的內(nèi)容都是不同的,每個(gè)網(wǎng)頁(yè)都應(yīng)該有獨(dú)一無(wú)二的title。
我們建議網(wǎng)頁(yè)標(biāo)題可以這樣描述:
? 首頁(yè):網(wǎng)站名稱 或者 網(wǎng)站名稱_提供服務(wù)介紹or產(chǎn)品介紹
? 頻道頁(yè):頻道名稱_網(wǎng)站名稱
? 文章頁(yè):文章title_頻道名稱_網(wǎng)站名稱
title指html文檔中的<title>標(biāo)簽,而非文章的標(biāo)題,以下面的形式放在html文檔的<head>標(biāo)簽中
推薦做法
? 每個(gè)網(wǎng)頁(yè)應(yīng)該有一個(gè)獨(dú)一無(wú)二的標(biāo)題,切忌所有的頁(yè)面都使用默認(rèn)標(biāo)題
? 標(biāo)題要主題明確,包含這個(gè)網(wǎng)頁(yè)中更重要的內(nèi)容
? 簡(jiǎn)明精練,不羅列與網(wǎng)頁(yè)內(nèi)容不相關(guān)的信息
? 用戶瀏覽通常是從左到右的,重要的內(nèi)容應(yīng)該放到title的靠前的位置
? 使用用戶所熟知的語(yǔ)言描述。如果你有中、英文兩種網(wǎng)站名稱,盡量使用用戶熟知的那一種做為標(biāo)題描述