И даже объяснял почему так происходит. А именно потому, что за отдельные страницы принимаются страницы по ссылкам из архива и ярлыков (у них же другой адрес).
Но на самом деле, это не очень хорошо. Много страниц в индексе - это приятно, но надо понимать то, что это выходят страницы с дублированным контентом (а это поисковые машины не любят).
И, кроме этого, такая страница может попасть в выдачу выше оригинальной (вряд ли, конечно, но всяко бывает...).
Это совершенно точно - вы можете это проверить сами, зайдя в "Яндекс.вебмастер" или в "Инструменты для веб-мастеров" Google. Там будут лишние страницы именно по ссылкам из ярлыков и архива.
Гугл делит страницы сайта на главные ("main") и дополнительные ("supplemental"). Большое количество дополнительных как-бы снижают качество сайта в глазах поисковика. Кроме этого, тем страницам, которые считаются вспомогательными, сложнее попасть в выдачу!
Соответственно, надо эту ситуацию как-то исправлять. Для этого желательно действовать сразу несколькими способами.
Один из способов - сокращение похожего, повторяющегося или дублированного контента.
А именно такой контент Гугл видит по ссылкам из архива и ярлыков.
Так что надо закрыть "архив сообщений" и "ярлыки" (они же "разделы","рубрики") от индексации.
Я нашёл такой вот способ:
Вначале, как обычно, на всякий случай сохраняем свой шаблон.
Затем в редаторе HTML нашего блога сразу после тега <head> надо вставить следующий код:
<b:if cond='data:blog.pageType == "archive"'><meta content='noindex,follow' name='robots'/></b:if><b:if cond='data:blog.pageType == "index"'><b:if cond='data:blog.url != data:blog.homepageUrl'><meta content='noindex,follow' name='robots'/></b:if></b:if>
И сохранить результат. Затем, чтоб проверить как всё работает - надо открыть какой-нибудь месяц или год "архива" и нажать в браузере "просмотреть исходный код страницы" (такая опция обычно появляестя в выпадающем меню, если кликнуть по странице правой кнопкой мыши - но вы все, я думаю, это давно и прекрасно знаете =).
И там вверху после тега <head> должна быть строка:
<meta content='noindex,follow' name='robots'/>
Эта же строка должна присутствовать и тогда, когда вы проверяете какой-либо из "ярлыков". Затем, на всякий случай, откройте главную страницу блога и ещё пару других обычных страниц.
Просмотрите также исходный код на них: там не должно быть этой строки! Если она там есть, значит от индексации стал закрыт весь блог, а это очень плохо, и что-то работает не так.
Но вообще такого случиться не должно.
Скажу честно: я читал хорошие отзывы об этом способе, его уже используют немало людей. Но сам я пока тестирую его - посмотрим что будет через пару дней; хотя вообще все вроде должно быть в порядке.
Ещё раз рекомендую на всякий случай отслеживать индексацию до и после через вышеупомянутые и гугловские .
Это ещё не всё.
Чтобы на сайте было как можно меньше "дополнительных" страниц - крайне желательно ещё вот что:
- активно перелинковывать между собой внутренние страницы блога; в этом, кстати, прекрасно (и автоматически!) помогают ссылки на схожие сообщения в конце поста.
- наличие тематических ссылок с других сайтов, и не только на главную, но и на на другие разные страницы вашего блога; желательно с весомых ресурсов (ну это уж как выйдет);
- может помочь sitemap, но сказанное выше, ИМХО, действеннее.
Способ, того, как убрать из индекса дублированный контент из виджетов я взял у Maxibiz (он, впрочем, тоже признаётся что позаимствовал его). Можете почитать там комменты - возможно найдёте что-нибудь интересное по этому способу.
О supplemental-страницах и борьбе с ними также можно почитать на английском здесь.
UPD: узнать качество сайтов в отношении "дополнительных страниц" можно на сервисе supplemental-calculator.