總結一下Meta的用法及robot.txt的講解【轉載】

來源:互聯網
上載者:User
總結一下Meta的用法及robot.txt的講解Tue, 2006-05-23 02:44 — Evance

Copyrightauthorization: 

原創

做網頁做久了一些不受注意的東西的也不得不去瞭解一下了..
上網尋找了一下robots.txt的用法,卻一個不留神查到了關於meta的一些用法,覺得挺有用的,把詳細的用法寫出來了
關於Meta的用法

meta是用來在HTML文檔中類比HTTP協議的回應標頭報文。meta 標籤用於網頁的<head>與</head>中,meta 標籤的用處很多。meta 的屬性有兩種:name和http-equiv。name屬性主要用於描述網頁,對應於content(網頁內容),以便於搜尋引擎機器人尋找、分類(目前幾乎所有的搜尋引擎都使用網上機器人自動尋找meta值來給網頁分類)。這其中最重要的是description(網站在搜尋引擎上的描述)和keywords(分類關鍵詞),所以應該給每頁加一個meta值。比較常用的有以下幾個:

1.name 屬性

1、<meta name="generator" contect="">用以說明產生工具(如Microsoft FrontPage 4.0)等;

2、<meta name="keywords" contect="">向搜尋引擎說明你的網頁的關鍵詞;

3、<meta name="description" contect="">告訴搜尋引擎你的網站的主要內容;

4、<meta name="author" contect="你的姓名">告訴搜尋引擎你的網站的製作的作者;

5、<meta name="robots" contect="all|none|index|noindex|follow|nofollow">

其中的屬性說明如下:

設定為all:檔案將被檢索,且頁面上的連結可以被查詢;

設定為none:檔案將不被檢索,且頁面上的連結不可以被查詢;

設定為index:檔案將被檢索;

設定為follow:頁面上的連結可以被查詢;

設定為noindex:檔案將不被檢索,但頁面上的連結可以被查詢;

設定為nofollow:檔案將不被檢索,頁面上的連結可以被查詢。

2.http-equiv屬性

1、<meta http-equiv="Content-Type" contect="text/html";charset=gb_2312-80">

和 <meta http-equiv="Content-Language" contect="zh-CN">用以說明首頁製作所使用的文字以及語言;

又如英文是ISO-8859-1字元集,還有BIG5、utf-8、shift-Jis、Euc、Koi8-2等字元集;

2、<meta http-equiv="Refresh" contect="n;url=http://yourlink">定時讓網頁在指定的時間n內,跳轉到頁面http;//yourlink;

3、<meta http-equiv="Expires" contect="Mon,12 May 2001 00:20:00 GMT">可以用於設定網頁的到期時間,一旦到期則必須到伺服器上重新調用。需要注意的是必須使用GMT時間格式;

4、<meta http-equiv="Pragma" contect="no-cache">是用於設定禁止瀏覽器從本地機的緩衝中調閱頁面內容,設定後一旦離開網頁就無法從Cache中再調出;

5、<meta http-equiv="set-cookie" contect="Mon,12 May 2001 00:20:00 GMT">cookie設定,如果網頁到期,存檔的cookie將被刪除。需要注意的也是必須使用GMT時間格式;

6、<meta http-equiv="Pics-label" contect="">網頁等級評定,在IE的internet選項中有一項內容設定,可以防止瀏覽一些受限制的網站,而網站的限制層級就是通過meta屬性來設定的;

7、<meta http-equiv="windows-Target" contect="_top">強制頁面在當前視窗中以獨立頁面顯示,可以防止自己的網頁被別人當作一個frame頁調用;

8、<meta http-equiv="Page-Enter" contect="revealTrans(duration=10,transtion=50)">和<meta http-equiv="Page-Exit" contect="revealTrans(duration=20,transtion=6)">設定進入和離開頁面時的特殊效果,這個功能即FrontPage中的“格式/網頁過渡”,不過所加的頁面不能夠是一個frame頁面。

3.關於robots.txt的講解

1.什麼是robots.txt檔案?
搜尋引擎通過一種程式robot(又稱spider),自動訪問互連網上的網頁並擷取網頁資訊。
您可以在您的網站中建立一個純文字檔案robots.txt,在這個檔案中聲明該網站中不想被robot訪問的部分,這樣,該網站的部分或全部內容就可以不被搜尋引擎收錄了,或者指定搜尋引擎只收錄指定的內容。

2.robots.txt檔案放在哪裡?
robots.txt檔案應該放在網站根目錄下。舉例來說,當robots訪問一個網站(比如http://www.abc.com)時,首先會檢查該網站中是否存在http://www.abc.com/robots.txt這個檔案,如果機器人找到這個檔案,它就會根據這個檔案的內容,來確定它存取權限的範圍。

見樣本:

 

"robots.txt"檔案包含一條或更多的記錄,這些記錄通過空行分開(以CR,CR/NL, or NL作為結束符),每一條記錄的格式如下所示:
"<field>:<optionalspace><value><optionalspace>"。

在該檔案中可以使用#進行註解,具體使用方法和UNIX中的慣例一樣。該檔案中的記錄通常以一行或多行User-agent開始,後面加上若干Disallow行,詳細情況如下:

User-agent:
該項的值用於描述搜尋引擎robot的名字,在"robots.txt"檔案中,如果有多條User-agent記錄說明有多個robot會受到該協議的限制,對該檔案來說,至少要有一條User-agent記錄。如果該項的值設為*,則該協議對任何機器人均有效,在"robots.txt"檔案中,"User-agent:*"這樣的記錄只能有一條。

Disallow:
該項的值用於描述不希望被訪問到的一個URL,這個URL可以是一條完整的路徑,也可以是部分的,任何以Disallow開頭的URL均不會被robot訪問到。例如"Disallow:/help"對/help.html 和/help/index.html都不允許搜尋引擎訪問,而"Disallow:/help/"則允許robot訪問/help.html,而不能訪問/help/index.html。任何一條Disallow記錄為空白,說明該網站的所有部分都允許被訪問,在"/robots.txt"檔案中,至少要有一條Disallow記錄。如果"/robots.txt"是一個空檔案,則對於所有的搜尋引擎robot,該網站都是開放的。

4.robots.txt檔案用法舉例

 

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.