중간 거래 SEO 진단 Taobao 게스트 클라우드 호스트 기술 홀
구글 로봇-마법의 꿈의 보트! 그 모든 부분 우리의 영혼을 알고 있다. 어쩌면 그는 안 찾고 뭔가 독특한; 그 읽기 약 수십억 다른 사이트 (비록 우리는 또한 다른 검색 엔진 봇과 함께 우리의 데이터를 공유), 하지만 웹사이트와 구글 봇, 오늘 우리 정말 서로 알 것 이다.
난 첫 데이트에 지나치게 분석 하는 것이 좋습니다 적이 있다. 우리는 일련의 기사를 통해 Google 로봇에 대해 조금 배울 것 이다:
우리의 첫 번째 날짜 (오늘): 구글 로봇 및 파일 형식을 발견에 의해 발행 데이터 헤더 압축;에 대 한 적절 한 했다
그의 응답을 판단: 응답 코드 (301s, 302s) 그는 리디렉션을 처리 하는 방법, if-수정-이후;
다음: 링크, 그 게 (그래서 그는 그의 머리를 너무 흥분 되지 않습니다) 더 빨리 또는 더 느리게 크롤 링.
오늘 우리의 첫 번째 날짜입니다...
***************
구글 로봇: 올바르게 대답을 명령
웹사이트: 구글 로봇, 당신이 서!
구글 로봇: 예, 내가 간다!
get/http/1.1
Host:example.com
연결: 보관-살아
수락: * / *
: googlebot이 (에서) googlebot.com
사용자-에이전트: mozilla / 5.0 (호환; googlebot/2.1; + http://www.google.com/bot.html)
수락-인코딩: gzip을, 빼 다
사이트: 이러한 헤더는 멋져! 여부 또는 내 사이트는 미국, 아시아 또는 유럽에, 할 당신이 크롤 링 같은 헤더? 혹시 다른 헤더 사용한?
구글 봇: 일반적으로, 전 세계 사용 하는 헤더는 일관 된. 웹 페이지 기본 언어 및 웹사이트의 설정에서 어떻게 생겼는지 알아낼 하려고 해요. 때로는 사람들의 사용자 에이전트는 다른, 예를 들어, 애드 센스는 "Mediapartners-구글"을 사용 하 여 읽기:
사용자-에이전트: mediapartners-구글
또는 이미지 검색에 대 한:
사용자-에이전트: googlebot-이미지/1.0
구글 리더 RSS 리더 구독자 수 등 추가 정보를 포함 하는 동안 무선 읽기에 대 한 사용자 에이전트 캐리어에 따라 다릅니다.
보통 쿠키를 피하기 위해 (그래서 거기에 같은 건은 "쿠키:" 헤더) 내용에 상당한 영향을 미칠 특정 대화에 대 한 정보를 원하지 않기 때문에. 또한, 서버 대화 id를 사용 하 여 쿠키 대신 동적 URL에, 난 보통 인식 다른 대화 Id 때문에 또다시 동일한 웹 페이지를 크롤 링 하지 않아도 그렇게.
사이트: 내 구조는 매우 복잡 하다. 많은 종류의 파일 사용 하 고. 헤더는 말한다, "수락: * / *." 모든 Url, 포함 또는 당신은 자동으로 특정 파일 확장명을 필터링?
구글 로봇: 그것은 내가 찾을 하려는에 따라 달라 집니다.
만약 내가 그냥 일반 웹 검색에 대 한 검색, 링크 MP3 및 비디오 콘텐츠를 볼 때 이러한 것 들을 다운로드 수 없습니다 수 있습니다 나. 마찬가지로, 내가 JPG 파일을 볼 경우 처리 방법을 자연스럽 게 다른 HTML 이나 PDF 링크에서. 예를 들어 JPG로 변경 빈도 종종 많은 HTML, 그래서 자주 대역폭 절약 하기 위해 JPG 변경 확인 할 보다 낮은. 또한, 링크를 Google 학술 검색에 대 한 찾고, PDF 문서에 대 한 내 관심이 됩니다 JPG 파일에 대 한 관심 보다 훨씬 높다. 학자를 위한 낙서 (예: JPG), 스케이트 보드, 재생 하는 강아지에 대 한 비디오를 다운로드 하기 쉽습니다 혼란, 당신은?
웹사이트: 예, 그들은 느낄 수 있습니다 방해. 나는 당신의 전문성 감탄 감탄. 나 자신 (JPG)을 그림 낙서 처럼, 그들의 유혹을 저항 하기 어렵다.
구글 로봇: 나 같은입니다. 난 아니에요 정말 학자는 항상. 검색 이미지에 대 한 크롤링, jpg에 관심이 있을 것입니다 하 고 HTML 및 그들이 근처 이미지 뉴스를 쳤을 때 보고 모처럼 걸릴 것입니다.
또한 많은 확장, EXE, DLL, ZIP, DMG, 있으며, 그들은 둘 다 수에서 큰 검색 엔진 별로 사용.
웹 사이트: 내 URL "http://www.example.com/page1.LOL111"를 참조 하는 경우 (말) 것 이라고 당신이 종료 되지 그것 때문에 빵 알 수 없는 파일 확장명은?
구글 로봇: 웹 사이트 친구 하자 당신에 게 몇 가지 배경 정보를 제공. 파일이 다운로드 되 면 실제로, 나는 그것은 HTML, 이미지, 텍스트, 또는 다른 것에 속한다을 확인 하 콘텐츠 범주 콘텐츠 형식 헤더를 사용 합니다. 그것은 특별 한 유형의 데이터를 PDF, Word 문서 또는 Excel 워크시트, 나는 그것이에 유효한 형식과 그것에서 텍스트 콘텐츠를 추출 확인할 것 이다. 하지만 당신은 결코 확신할 수는 바이러스를 포함 하는 경우. 하지만 문서 또는 데이터 형식을 혼란 있다면, 난 아무것도 더 나은 그들 멀리 던져 보다 할.
그래서, 만약 내가 당신의 "http://www.example.com/page1.LOL111" url을 크롤 링 하 고 알 수 없는 파일 이름 확장명을 찾을, 나 먼저 그것을 다운로드할 수도 있습니다. 콘텐츠 형식 헤더에서 알아낼 수 없습니다 또는 파일에 속하는 경우는 포맷 하는 경우 (예: MP3) 검색, 다음 그냥 치워 거부할. 또한, 우리는 파일을 크롤 링을 계속 됩니다.
웹사이트: 구글 안 드 로이드, 당신의 작업 스타일 "nitpick"에 대 한 미안 해요 하지만 나타났습니다 "수락 인코딩" 헤더가 말한다:
수락-인코딩: gzip을, 빼 다
당신은 내게 말할 수 뭔가이 헤더에 대 한?
물론 구글 로봇:. 모든 주류 검색 엔진 및 웹 브라우저 gzip 압축 대역폭을 절약 하기 위해 콘텐츠를 지원 합니다. 또한 다른 형식으로 "X-gzip" ("gzip"와 동일), "폐" (이 또한 지원) 등, "정체성" (지원 되지 않음) 발생할 수 있습니다.
웹사이트: 당신은 말할 수 있는 파일 압축에 대 한 더 많은 및 "수락 인코딩: gzip, 폐"? 내 Url의 대부분 멋진 이미지, HTML 뿐 아니라 큰 플래시 파일을 포함. 더 큰 파일을 압축 하는 경우 도움이 될 당신은 더 빨리 크롤 링?
구글 로봇:이 질문에 아무 간단한 답변이입니다. 첫째, 파일 형식와 같은 SWF (플래시), JPG, PNG, GIF, 및 pdf 파일은 이미 압축 (플래시 최적화 전용).
웹사이트: 아마도 이미 내 플래시 파일을 압축, 나 모른다. 물론, 내 효율은 매우 높다.
구글 봇: 아파치 및 IIS gzip을 허용 하 고 폐의 압축 옵션을 제공 되며 물론, 대역폭 절감 비용 CPU를 더 많이 사용 합니다. 일반적으로,이 기능은 텍스트 html/css/php 등 보다 쉽게 압축 된 파일에만 적용 됩니다. 또한, 그것은 수만 사용 될 경우 사용자의 브라우저 또는 (검색 엔진 봇) 허용. 개인적으로, 나는 "폐"를 "gzip"을 선호 합니다. Gzip 코딩 과정은 지속적으로 되 고 있기 때문에 상대적으로 신뢰할 수 있는 추가 하 고 확인와 달리 완전 한 헤더를 유지 하는 "폐" 내 작품에서 추측 유지를 요구 하. 또한, 두 프로그램 모두 비슷한 압축 알고리즘 언어 있다.
있는 경우 서버에서 사용 되지 않는 CPU 리소스, 압축를 시도할 수 있습니다 (링크: 아파치, IIS). 그러나, 동적 콘텐츠를 제공 하는 경우 서버의 CPU는 이미 완전 부하 상태에서 난 것이 좋습니다 당신이 그렇게 하지.
웹사이트: 매우 긴 경험. 오늘밤 저를 보러 올 수 있는 기 뻐 요. 고맙게도, 내 robots.txt 파일 수 있습니다와 서. 이 문서는 때때로 그의 혹은 그녀의 자신의 아이 들의 과잉은 부모 처럼입니다.
구글 로봇: 그것은 당신의 부모-그것의 robots.txt에 맞게 시간 이다. 나는 미친 부모를 많이 봤어요. 이들 중 일부는 실제로 단지 HTML 오류 메시지 페이지, 유효 하지 않은 robots.txt입니다. 일부 파일 끝 없는 리디렉션 전체 그리고 완전히 관련이 없는 사이트를 가리킨 수 있습니다. 다른 부피가 큰 하 고 별도 Url, 각각은 다른의 수천을 포함. 여기는, 일반적으로 콘텐츠를 크롤링할 싶어 부작용 파일 패턴은:
사용자 에이전트: *
허용: /
그러나, 사용자의 소통량의 첨단에, 사이트는 매우 제한적인 메커니즘의 robots.txt을 이동:
# 한 동안 멀리 갈 수 있을까요? 난 다시 하 게 됩니다.
# 나중에 다시입니다. 정말, 나는 약속 한다!
사용자 에이전트: *
금지: /
위의 robots.txt 파일 전환 문제는 일단 나이 제한 robots.txt를 보고, 그것이 가능한 인덱스에 크롤링되는 사이트의 콘텐츠를 삭제 하는 것입니다. 내가이 사이트를 입력 다시 승인 했다, 난 적어도 일시적으로 503 원본 콘텐츠를 많이 통해 크롤 링 오류 해당 코드.
일반적으로, 내가 수만 재검토 robots.txt 매일 (그렇지 않으면, 많은 가상 호스트 사이트에 내가 지출 robots.txt 파일을 읽고 내 시간의 큰 부분 너무 자주 서로 다른 부모를만 나 같은 많은 날짜를 알고). 크롤링 빈도 제어 하려면 robots.txt 스위치를 통해 웹 마 스 터는 부작용, 더 나은 방법은 웹 마 스 터 도구를 사용 하는 "낮은" 크롤링 빈도 수 있을 것입니다.
구글 로봇: 웹 사이트 친구 주셔서 감사 합니다 귀하의 질문에, 당신은 좋은 일을 해 왔습니다 하지만 지금 내가 말을 해, "안녕, 내 사랑"
웹사이트: 오, 구글 로봇... (대답 끝):)
여행자의 웹사이트: http://www.1gu.org.cn