V VComInt Seu fornecedor de informações em SEO
Agora em Crawl Depth: entenda a métrica de esforço do robô

Crawl Depth: entenda a métrica de esforço do robô

O Crawl Depth é um conceito crucial no mundo do SEO que, quando compreendido e aplicado corretamente, pode ajudar a melhorar a visibilidade do seu site nos mecanismos de busca. Neste guia, abordaremos o que é o Crawl Depth, por que ele é importante e como você pode otimizá-lo para melhorar o desempenho do seu site nos mecanismos de busca. Vamos aprofundar-nos nesse tema e garantir que você esteja bem informado sobre as melhores práticas de SEO para alcançar seu público-alvo de maneira eficiente.

A quem esse conteúdo serve


Analistas de SEO Técnico

Ao entender o Crawl Depth, o analista de SEO técnico pode melhorar a arquitetura do site e garantir que as páginas relevantes sejam facilmente acessadas pelos mecanismos de busca, otimizando assim a visibilidade do site.

Desenvolvedores Front-end

O desenvolvedor front-end pode se beneficiar deste texto ao compreender como o Crawl Depth afeta a experiência do usuário e a indexação das páginas. Com essa informação, ele pode projetar e implementar estruturas de navegação e layout mais eficientes.

Analistas de link building

Para o analista de link building, aprender sobre o Crawl Depth pode ajudá-lo a identificar oportunidades para criar links internos e externos mais eficazes, melhorando a autoridade do site e aumentando a visibilidade nos mecanismos de busca.

O que você vai encontrar aqui

O texto aborda o conceito de Crawl Depth e sua importância para o SEO. Inicia explicando o funcionamento dos user-agents e como eles rastreiam os sites. Em seguida, são apresentados conceitos como profundidade do site (site depth), custo de crawling e eficiência de crawling, com sugestões de melhores práticas.

O processo de rastreamento é detalhado, destacando a importância de uma boa arquitetura do site, sitemaps otimizados, links externos e internos. O texto também apresenta o conceito de crawl ratio e sugere estratégias para melhorá-lo, como mapeamento da arquitetura e taxonomia, cuidado com estruturas de links internos, atualização do sitemap com o argumento e estruturação da proporção de links externos.

O que é o Crawl Depth no SEO

Crawl Depth é um termo relacionado à profundidade do site (em tradução direta) o que, em linhas gerais, pode ser entendido como quão distante está um link de ser rastreado pelo user-agent do buscador. Para isso fazer sentido, vamos revisitar o que é o user-agent de um buscador e como ele funciona.

O sistema de crawl dos buscadores usa os “user-agents” – aqueles mesmos que você informa no robots.txt do seu site – para simular o comportamento de um usuário e entender o seu site. Ele entra pelo domínio (aquela URL principal, da qual as demais vão derivar) e vai “clicando” em tudo em sequência, seguindo comportamento mapeado em laboratório pelos desenvolvedores do user-agent.

Algumas coisas estarão mais acessíveis. Outras estarão menos. E é essa diferença, entre o que tá longe e o que tá perto, que marca o crawl depth de um site, e como e quanto os buscadores gastam.

Profundidade de um site (site depth)

O site depth é outro conceito importante para entender o crawl depth do site. Imagine que você estruturou o seu site de modo a levar o usuário da home para alguns artigos, de artigos para

Custo de Crawling

A noção de custo de crawleamento está relacionada aos recursos e tempo que o Googlebot dedica ao rastreamento de um site, também conhecido como crawl budget. A web possui um espaço praticamente infinito, o que impossibilita o Google de explorar e indexar todos os URLs disponíveis. Para otimizar o rastreamento, o Google leva em consideração o crawl depth, ou seja, a profundidade de rastreamento das páginas em um site, bem como a capacidade e demanda de rastreamento.

O limite de capacidade de rastreamento é calculado para garantir a cobertura do conteúdo importante sem sobrecarregar os servidores, enquanto a demanda de rastreamento é determinada pelo tamanho, frequência de atualização, qualidade das páginas e relevância do site em comparação a outros.

Eficiência de crawling

A eficiência de crawling refere-se à otimização do processo de rastreamento do Googlebot em um site. Ela se relaciona diretamente com o crawl depth, uma vez que quanto mais otimizado o seu site for para o bot, mais chances você tem de ter o conteúdo constantemente revisado pelo Google. Para maximizar a eficiência de crawling, sugerimos algumas melhores práticas de acordo com o que o próprio Google destaca como eficiência:

  • Gerencie o inventário de URLs: Informe ao Google quais páginas devem ser rastreadas, evitando o rastreamento de URLs desnecessários.
  • Consolide conteúdo duplicado: Elimine duplicações para focar no rastreamento de conteúdo único.
  • Bloqueie o rastreamento de URLs usando robots.txt: Bloqueie páginas que não são relevantes para os resultados de pesquisa.
  • Evite usar noindex: Isso desperdiça tempo de rastreamento, já que o Google solicita e descarta páginas com noindex.
  • Retorne códigos de status 404 ou 410 para páginas removidas permanentemente: Isso indica ao Google para não rastrear esses URLs novamente.
  • Elimine erros soft 404: Verifique o Relatório de cobertura do índice para identificar e corrigir erros soft 404.
  • Mantenha os sitemaps atualizados: Inclua todo o conteúdo a ser rastreado e utilize a tag para conteúdo atualizado.
  • Evite longas cadeias de redirecionamento: Elas prejudicam o rastreamento.
  • Otimize o carregamento das páginas: Isso permite ao Google carregar e renderizar páginas mais rapidamente, melhorando a eficiência do rastreamento.
  • Monitore o rastreamento do site: Verifique problemas de disponibilidade e busque maneiras de tornar o rastreamento mais eficiente.

Como um buscador realiza o crawl do site:

Um buscador, como o Google, funciona como um explorador da web, vasculhando a internet para descobrir e indexar páginas de sites. Esse processo é chamado de “crawl” ou rastreamento.

Imagine o Googlebot, o rastreador do Google, como um robô detetive que segue pistas. Ele começa com uma lista de URLs conhecidas e visita cada uma delas. Quando chega a uma página, ele analisa seu conteúdo e identifica todos os links presentes. Esses links levam a outras páginas e fornecem ao Googlebot novas pistas para seguir.

O Googlebot segue essas pistas (links) de uma página para outra, expandindo seu conhecimento sobre a web. Esse processo contínuo ajuda o buscador a encontrar páginas novas e atualizadas para adicionar ao seu índice.

No entanto, como a web é imensa e os recursos do Google são limitados, o rastreamento precisa ser eficiente. Por isso, o Googlebot utiliza estratégias inteligentes para decidir quais páginas rastrear e com que frequência. Ele prioriza páginas populares e relevantes, e também considera a velocidade e a capacidade do servidor do site, para evitar sobrecarregá-lo.

1. Arquitetura do Site

A arquitetura de um site, que engloba sua estrutura e organização, tem um impacto significativo no crawl depth. Quando a arquitetura de um site é bem organizada, com uma taxonomia clara e hierarquia lógica, os rastreadores dos buscadores, como o Googlebot, conseguem navegar e indexar as páginas de forma mais eficiente.

Uma estrutura hierárquica facilita o rastreamento, pois permite que os rastreadores sigam os links entre as páginas principais, categorias e subcategorias, alcançando assim todas as páginas relevantes do site. Isso otimiza o crawl depth, pois os rastreadores conseguem acessar e indexar as páginas importantes sem gastar tempo e recursos desnecessários em páginas não essenciais ou duplicadas.

2. Sitemap

Um sitemap otimizado desempenha um papel crucial na facilitação do trabalho dos rastreadores dos buscadores, como o Googlebot, e na otimização do crawl depth. Um sitemap bem elaborado lista todas as páginas importantes de um site em um formato estruturado e fácil de entender, funcionando como um guia para os rastreadores.

Quando os rastreadores acessam um sitemap otimizado, eles conseguem localizar e rastrear as páginas relevantes de maneira mais eficiente, pois já têm uma visão clara da estrutura do site e das páginas que precisam ser indexadas. Isso otimiza o crawl depth, já que os rastreadores podem se concentrar nas páginas essenciais sem gastar recursos e tempo em conteúdo irrelevante ou duplicado.

Além disso, um sitemap otimizado ajuda a garantir que as páginas recém-criadas ou atualizadas sejam rastreadas e indexadas mais rapidamente, pois os rastreadores são notificados sobre as mudanças assim que acessam o sitemap.

Os links externos, também conhecidos como backlinks, desempenham um papel importante no aumento da Autoridade de Página (PA) de uma URL. A PA é uma métrica que avalia a relevância e a importância de uma página na web com base na quantidade e na qualidade dos links que apontam para ela. Quando uma página tem uma PA alta, ela é considerada mais valiosa pelos algoritmos dos buscadores.

Essa maior relevância faz com que os rastreadores dos buscadores deem prioridade a essas páginas no processo de rastreamento, o que, por sua vez, afeta a hierarquia do crawl depth. Ao priorizar páginas com maior autoridade, os rastreadores conseguem indexar e exibir nos resultados de pesquisa os conteúdos mais relevantes e de qualidade.

Dessa forma, os links externos influenciam a estratégia de crawl depth ao alterar a hierarquia de rastreamento dos buscadores. Por isso, é fundamental analisar a PA das páginas do site e trabalhar na construção de backlinks de qualidade para garantir que as páginas importantes sejam rastreadas e indexadas de maneira eficiente, otimizando o crawl depth e melhorando a presença online do site.

Os links internos são conexões estabelecidas entre as páginas dentro do mesmo domínio, criando uma rede de páginas interligadas. Eles são fundamentais para ajudar o Googlebot a navegar pelo site e compreender a estrutura e o crawl depth de um domínio.

Quando o Googlebot rastreia um site, ele segue os links internos para explorar o conteúdo das páginas e identificar a hierarquia de informações do site. Isso permite que o rastreador compreenda a organização do site e determine o crawl depth de cada página. Os links internos bem estruturados garantem que todas as páginas relevantes sejam rastreadas e indexadas de maneira eficiente, melhorando a visibilidade do site nos resultados de pesquisa.

Além disso, os links internos ajudam a distribuir a autoridade do domínio entre as páginas do site, fortalecendo a relevância das páginas mais importantes e garantindo que o Googlebot priorize o rastreamento dessas páginas. Isso, por sua vez, otimiza a hierarquia do crawl depth, garantindo que as páginas de maior importância sejam rastreadas e indexadas com prioridade.

Como melhorar o crawl ratio (e o que é isso)

O crawl ratio é a porcentagem de URLs únicas na estrutura do seu site que foram rastreadas por um robô de mecanismo de pesquisa, como o Googlebot. Se o Google não estiver rastreando todo o seu conteúdo, você pode perder oportunidades de indexação e tráfego. Portanto, otimizar o crawl ratio é fundamental para o SEO.

Faça um mapeamento de arquitetura e taxonomia do site

Um mapeamento detalhado de arquitetura e taxonomia do site pode revelar problemas de navegação, links quebrados ou áreas de conteúdo não rastreadas. Ao identificar e corrigir esses problemas, você estará garantindo que o Googlebot possa navegar facilmente pelo seu site e indexar o máximo de conteúdo possível, melhorando assim o crawl ratio.

Ao mapear essa arquitetura você sabe o que deveria ser e o que efetivamente é quando o GoogleBot olha seu crawl depth. Você pode descobrir que páginas importantíssimas estavam escondidas, enquanto outras eram priorizadas pelo crawl depth. Ambos aspectos que vão tornar a sua vida consideravelmente mais difícil.

Elementos como “leia mais”, “categorias”, “tags” e similares criam repositórios de conteúdos e é natural que recebam muitos links. Eles, entretanto, criam sub-nucleos de hierarquia na sua página que acabam por complicar a vida do crawler e dão uma falsa impressão de hierarquia nas páginas.

Por exemplo, digamos que você tenha uma página para os autores dos seus artigos. O autor A escreveu apenas 5 artigos no ano, enquanto o autor B escreveu 20. Naturalmente, o autor B terá uma paginação para seus artigos (artigos-de-B/page-1 e artigos-de-B/page-2), tornando o processo para chegar nos artigos mais antigos de B mais longo do que os para os artigos mais antigos de A (todos na artigos-de-A, sem paginação).

Assim, artigos mais relevantes e/ou mais recentes de B escritos mais recentemente ficarão mais longe, na hierarquia, do que os artigos de A. Algo que ninguém quer.

Atualize o sitemap com o argumento <priority>

Incluir o argumento no sitemap ajuda a informar ao Googlebot quais páginas são mais importantes e devem ser rastreadas com prioridade. Isso otimiza o crawl ratio, garantindo que as páginas de maior importância sejam rastreadas e indexadas primeiro.

O argumento, que suporta valores de 0 a 1, ajuda a indicar páginas mais importantes. Isso é bacana quando você tem páginas com caminhos de URL de mesmo nível (por exemplo, seusite.com/artigos/artigo-1 e seusite.com/servicos/servico-1) e você quer que uma seja mais prioritária do que outra (de preferência seu serviço)

Quando começar sua campanha de link building, lembre-se que os links externos devem apontar para a mesma proporção que você gostaria que o crawl depth desse de importância para o seu site. Assim, links mais relevantes, áreas mais importantes do seu site devem receber – mais e melhores – links do que partes obscuras do seu site.

Caso essa parte obscura – uma notícia, artigo ou mesmo repositório – esteja recebendo mais cliques que o esperado, não hesite em mudá-lo de posição na hierarquia e na arquitetura para capitalizar em cima dessa nova e otimizada página para o crawl depth.

Cuidado com gargalos de no-index

O uso de no-index é encorajado para melhorar a capacidade de indexação e o crawl depth do seu site, poupando o Googlebot de mergulhar onde não deve. Porém, nas trocas entre desenvolvedores, conteudistas e profissionais de SEO, uma página pode sair no-index, mas estar com links internos chave para a navegação.

Isso não será problema para o usuário, mas será para o Googlebot, que não saberá fazer aquele caminho ao traçar o crawl depth do site e, consequentemente, vai colocar tudo depois do no-index no fim da fila ou fazendo um caminho mais longo do que o usuário efetivamente está fazendo.