Главная страница | Добавить в избранное    
   

 

» Статьи » Запрет индексации https с помощью .htaccess

   
main1
pix
 

Запрет индексации https с помощью .htaccess

Статьи  
pix pix pix

И так, в этот раз хотел бы рассказать о небольшой проблемке, возникшей на одном из моих сайтов. А случилось следующее, Google умудрился “съесть” https-версию сайта, мало того, он выбрал основным зеркалом https-морду. Стоит ли говорить, что позиции сайта после такого нежелательного увеличения дублей (а https версия сайта была точной копией http версии, и собственно не предназначалась для поисковых ботов) просели.

Первым делом иду смотреть что посоветует сам Google… google.com/support/webmasters
 
 

Block or remove your entire website using a robots.txt file

To remove your site from search engines and prevent all robots from crawling it in the future, place the following robots.txt file in your server root:

User-agent: *	Disallow: /

To remove your site from Google only and prevent just Googlebot from crawling your site in the future, place the following robots.txt file in your server root:

User-agent: Googlebot Disallow: / 

Each port must have its own robots.txt file. In particular, if you serve content via both http and https, youll need a separate robots.txt file for each of these protocols. For example, to allow Googlebot to index all http pages but no https pages, youd use the robots.txt files below.

For your http protocol (http://yourserver.com/robots.txt):

User-agent: * Allow: /

For the https protocol (https://yourserver.com/robots.txt):

User-agent: * Disallow: /

Для каждого порта должен быть создан собственный файл robots.txt. В частности, если используются протоколы http и https, для каждого из них потребуются отдельные файлы robots.txt. Например, чтобы разрешить поисковому роботу Google индексировать все страницы http и запретить сканировать https, файлы robots.txt должны выглядеть так, как описано ниже.

Для протокола http (http://server.ru/robots.txt):

User-agent: * Allow: /

Для протокола https (https://server.ru/robots.txt):

User-agent: * Disallow: /

Но что делать если http и https-файлы сайта лежат в одной папке?

В данной ситуации на помощь придет файл .htaccess - создаем для сайта два файла robots.txt, первый файл будет содержать все необходимые для нормальной индексации сайта инструкции, а второй будет полностью запрещать индексацию - Disallow: / - как и рекомендует Google. Второй файл мы назовем robots-https.txt, а в .htaccess запишем такие строки:

RewriteEngine on

RewriteCond %{HTTPS} on
RewriteRule ^robots.txt$ robots-https.txt

Что это значит на практике? При обращении поискового робота к сайту через http паук получает стандартный файл robots.txt, а при обращении через https-порт поисковый бот получит файл robots-https.txt в котором полностью запрещена индексация сайта.




Уважаемый посетитель, Вы зашли на сайт как незарегистрированный пользователь. Мы рекомендуем Вам зарегистрироваться либо войти на сайт под своим именем.
 
Автор: hellevil | 19-11-2008, 12:22 | Просмотров: 8 834
 
pix
  Новости по теме    
pix pix pix
  • Репликация MySQL
  • MySQL Error Codes
  • Оценка производителности графов Netgraph.
  • Xen Скрипт монтирования образа системы (*.img) for Centos
  • Копирование данных с помощью rsync + ssh
  •  
     
     
    pix
     
    pix
    search
    navi
    poll
    calendar
    «    Ноябрь 2024    »
    ПнВтСрЧтПтСбВс
     123
    45678910
    11121314151617
    18192021222324
    252627282930 
    main4
    pix pix pix

    2007 © www.DesktopBSD.ru
    Все права сохранены