Otimizar sua cota de rastreamento

Este guia descreve como otimizar o rastreamento do Google em sites muito grandes e atualizados com frequência.

Se o site não tem um grande número de páginas que mudam rapidamente, ou se elas parecem ser rastreadas no mesmo dia em que são publicadas, não é necessário ler este guia. No caso específico da Pesquisa Google, basta manter o sitemap atualizado e verificar o Relatório de Indexação de Páginas regularmente.

Público-alvo deste guia

Embora as recomendações aqui sejam boas práticas no geral, este é um guia avançado destinado principalmente aos seguintes casos:

  • sites grandes (mais de um milhão de páginas únicas) com conteúdo que muda com frequência moderada (uma vez por semana);
  • sites médios ou grandes (mais de 10 mil páginas únicas) com conteúdo que muda rapidamente (todos os dias);
  • sites com uma grande parte do total de URLs classificados pelo Search Console como Detectado, mas não indexado no momento.

Teoria geral do rastreamento

A web é um espaço praticamente infinito, que excede a capacidade do Google de analisar todos os URLs acessíveis publicamente. Como resultado, há limites para a quantidade de tempo e recursos que Google pode dedicar ao rastreamento de um único site. A alocação desses recursos é chamada de cota de rastreamento de um site. Nesse contexto, a infraestrutura de rastreamento do Google define um site como um nome de host exclusivo. Por exemplo, https://www.example.com/ e https://code.example.com/ são tratados como sites separados e têm cotas de rastreamento distintas. A cota de um site é determinada por dois elementos principais: limite de capacidade e demanda de rastreamento.

Limite de capacidade de rastreamento

O Google procura rastrear seu site sem sobrecarregar nossos servidores. Para isso, os rastreadores calculam um limite de capacidade de rastreamento (também conhecido como carga do host). Isso limita o tempo total que o servidor passa mantendo as conexões abertas para o Google, considerando o número de conexões paralelas e a duração delas. Assim, o Google pode cobrir todo o conteúdo importante sem sobrecarregar os servidores.

Todos os sites começam com o mesmo limite padrão e moderado de capacidade de rastreamento. Se houver demanda para rastrear mais e o site permanecer íntegro, os sistemas do Google vão ajustar automaticamente esse limite com o tempo.

O limite de capacidade de rastreamento pode aumentar ou diminuir com base em alguns fatores:

  • Integridade do rastreamento: se o site responder de forma consistente e os tempos de resposta (incluindo latência e Time to First Byte) permanecerem estáveis ou melhorarem, o limite vai aumentar, permitindo que mais conexões sejam usadas para o rastreamento. Se o site ficar lento (a latência aumentar ou os tempos de resposta ficarem mais longos) ou responder com erros de servidor (códigos de status 5xx HTTP) e indicadores de limitação de taxa (como HTTP 429), o limite vai diminuir, e o Google vai rastreá-lo menos.
  • Limites de rastreamento do Google: embora os recursos do Google sejam amplos, eles são finitos, e precisamos priorizar a alocação de recursos na web.

Demanda de rastreamento

Cada rastreador tem uma demanda própria, determinada por fatores exclusivos a ele. Por exemplo, o AdsBot geralmente tem uma demanda maior quando um site executa segmentações dinâmicas de anúncios, e o Google Shopping tem uma demanda maior por produtos nos feeds de comerciante.

Para o Googlebot, a demanda varia de acordo com o tamanho, a frequência de atualização, a qualidade das páginas e a relevância de um site em comparação com outros. Estes são os principais fatores que você pode controlar:

  • Inventário percebido: sem sua orientação, o Google tenta rastrear todos ou a maioria dos URLs identificados no site. Se muitos desses URLs forem duplicados ou se você não quiser que eles sejam rastreados por algum motivo (removido, sem importância etc.), isso desperdiça muito tempo de rastreamento do Google no site. Esse é o fator mais possível de ser controlado.
  • Popularidade: os URLs mais acessados na internet costumam ser rastreados com mais frequência para se manterem atualizados no índice.
  • Inatividade: nossos sistemas buscam rastrear documentos com frequência suficiente para captar mudanças.

Além disso, os eventos que ocorrem em todo o site, como as mudanças, podem aumentar a demanda de rastreamento para processar novamente o conteúdo com novos URLs.

Resumo

Considerando a capacidade e a demanda como um todo, o Google define a cota de rastreamento de um site como o conjunto de URLs a rastrear. Mesmo que o limite da capacidade não seja atingido, se a demanda for baixa, o Google vai rastrear o site com menos frequência.

Práticas recomendadas

Para maximizar a eficiência do rastreamento, siga estas práticas recomendadas:

  • Gerencie o inventário de URLs: use as ferramentas adequadas para informar ao Google quais páginas devem ser rastreadas. Se o Google passar muito tempo rastreando URLs sem necessidade, os rastreadores talvez não explorem o restante do site ou não aumentem a cota.
    • Consolide conteúdo duplicado. Elimine o conteúdo duplicado para focar o rastreamento em conteúdo exclusivo em vez de URLs exclusivos.
    • Bloqueie o rastreamento de URLs usando robots.txt. Algumas páginas são importantes para os usuários, mas você não precisa que elas apareçam nas plataformas do Google ou sejam reprocessadas pelos sistemas relacionados, como as de rolagem infinita que duplicam informações em páginas vinculadas ou versões da mesma página classificadas de forma diferente. Se não for possível fazer a consolidação conforme descrito no primeiro item, bloqueie o que não for importante com robots.txt. Fazer isso impede que o Google rastreie essas páginas e reduz significativamente a chance de processamento por outros dos nossos sistemas, como a indexação pela Pesquisa Google.
    • Retorne um código de status 404 ou 410 para páginas removidas permanentemente. O Google não vai esquecer um URL conhecido, mas um código de status 404 é um forte indicador para não rastrear esse URL novamente. No entanto, os URLs bloqueados vão permanecer como parte da fila de rastreamento e vão ser rastreados novamente quando o bloqueio for removido.
    • Elimine erros soft 404. As páginas de soft 404 vão continuar sendo rastreadas, desperdiçando sua cota. Verifique se há erros soft 404 no Relatório de Indexação de Páginas.
    • Mantenha os sitemaps atualizados. O Google lê o sitemap regularmente, então inclua todo o conteúdo a ser rastreado. Se o site incluir conteúdo atualizado, recomendamos incluir a tag <lastmod>.
    • Evite longas cadeias de redirecionamento, que têm um efeito negativo no rastreamento.
  • Deixe o carregamento das suas páginas mais eficiente. Se o Google conseguir carregar e renderizar as páginas mais rapidamente, poderemos ler mais conteúdo do site.
    • Melhore a velocidade de carregamento: otimize os tempos de resposta e os recursos do servidor para que as páginas carreguem mais rápido.
    • Use o armazenamento em cache HTTP: ofereça suporte aos códigos de status HTTP 304 (Not Modified). Se uma página não mudou desde o último rastreamento, retornar um código 304 informa ao Google que ele pode reutilizar a versão em cache, economizando largura de banda e recursos do servidor.
  • Depure problemas com a cota de rastreamento. Verifique se o site teve problemas de disponibilidade durante o rastreamento e procure maneiras de otimizar esse processo.

Como faço para ter mais cota de rastreamento?

Há duas maneiras de aumentar sua cota:

  • Adicione mais recursos de servidor. Caso não seja possível rastrear o site devido à capacidade do servidor (por exemplo, se você estiver recebendo a mensagem Carga do host excedida na Ferramenta de Inspeção de URL), adicione mais recursos de servidor, se isso fizer sentido para sua empresa.
  • Otimize a qualidade do conteúdo conforme o produto segmentado. Para determinar os recursos de rastreamento alocados a cada site, o Google considera elementos relevantes ao produto específico. Na Pesquisa Google, por exemplo, isso inclui fatores como popularidade, valor geral para o usuário, exclusividade do conteúdo e capacidade de veiculação.