O Crawl Depth é um conceito crucial no mundo do SEO que, quando compreendido e aplicado corretamente, pode ajudar a melhorar a visibilidade do seu site nos mecanismos de busca. Neste guia, abordaremos o que é o Crawl Depth, por que ele é importante e como você pode otimizá-lo para melhorar o desempenho do seu site nos mecanismos de busca. Vamos aprofundar-nos nesse tema e garantir que você esteja bem informado sobre as melhores práticas de SEO para alcançar seu público-alvo de maneira eficiente.
A quem esse conteúdo serve
Analistas de SEO Técnico
Ao entender o Crawl Depth, o analista de SEO técnico pode melhorar a arquitetura do site e garantir que as páginas relevantes sejam facilmente acessadas pelos mecanismos de busca, otimizando assim a visibilidade do site.
Desenvolvedores Front-end
O desenvolvedor front-end pode se beneficiar deste texto ao compreender como o Crawl Depth afeta a experiência do usuário e a indexação das páginas. Com essa informação, ele pode projetar e implementar estruturas de navegação e layout mais eficientes.
Analistas de link building
Para o analista de link building, aprender sobre o Crawl Depth pode ajudá-lo a identificar oportunidades para criar links internos e externos mais eficazes, melhorando a autoridade do site e aumentando a visibilidade nos mecanismos de busca.
O que você vai encontrar aqui
O texto aborda o conceito de Crawl Depth e sua importância para o SEO. Inicia explicando o funcionamento dos user-agents e como eles rastreiam os sites. Em seguida, são apresentados conceitos como profundidade do site (site depth), custo de crawling e eficiência de crawling, com sugestões de melhores práticas.
O processo de rastreamento é detalhado, destacando a importância de uma boa arquitetura do site, sitemaps otimizados, links externos e internos. O texto também apresenta o conceito de crawl ratio e sugere estratégias para melhorá-lo, como mapeamento da arquitetura e taxonomia, cuidado com estruturas de links internos, atualização do sitemap com o argumento e estruturação da proporção de links externos.
O que é o Crawl Depth no SEO
Crawl Depth é um termo relacionado à profundidade do site (em tradução direta) o que, em linhas gerais, pode ser entendido como quão distante está um link de ser rastreado pelo user-agent do buscador. Para isso fazer sentido, vamos revisitar o que é o user-agent de um buscador e como ele funciona.
O sistema de crawl dos buscadores usa os “user-agents” – aqueles mesmos que você informa no robots.txt do seu site – para simular o comportamento de um usuário e entender o seu site. Ele entra pelo domínio (aquela URL principal, da qual as demais vão derivar) e vai “clicando” em tudo em sequência, seguindo comportamento mapeado em laboratório pelos desenvolvedores do user-agent.
Algumas coisas estarão mais acessíveis. Outras estarão menos. E é essa diferença, entre o que tá longe e o que tá perto, que marca o crawl depth de um site, e como e quanto os buscadores gastam.
Profundidade de um site (site depth)
O site depth é outro conceito importante para entender o crawl depth do site. Imagine que você estruturou o seu site de modo a levar o usuário da home para alguns artigos, de artigos para
Custo de Crawling
A noção de custo de crawleamento está relacionada aos recursos e tempo que o Googlebot dedica ao rastreamento de um site, também conhecido como crawl budget. A web possui um espaço praticamente infinito, o que impossibilita o Google de explorar e indexar todos os URLs disponíveis. Para otimizar o rastreamento, o Google leva em consideração o crawl depth, ou seja, a profundidade de rastreamento das páginas em um site, bem como a capacidade e demanda de rastreamento.
O limite de capacidade de rastreamento é calculado para garantir a cobertura do conteúdo importante sem sobrecarregar os servidores, enquanto a demanda de rastreamento é determinada pelo tamanho, frequência de atualização, qualidade das páginas e relevância do site em comparação a outros.
Eficiência de crawling
A eficiência de crawling refere-se à otimização do processo de rastreamento do Googlebot em um site. Ela se relaciona diretamente com o crawl depth, uma vez que quanto mais otimizado o seu site for para o bot, mais chances você tem de ter o conteúdo constantemente revisado pelo Google. Para maximizar a eficiência de crawling, sugerimos algumas melhores práticas de acordo com o que o próprio Google destaca como eficiência:
- Gerencie o inventário de URLs: Informe ao Google quais páginas devem ser rastreadas, evitando o rastreamento de URLs desnecessários.
- Consolide conteúdo duplicado: Elimine duplicações para focar no rastreamento de conteúdo único.
- Bloqueie o rastreamento de URLs usando robots.txt: Bloqueie páginas que não são relevantes para os resultados de pesquisa.
- Evite usar noindex: Isso desperdiça tempo de rastreamento, já que o Google solicita e descarta páginas com noindex.
- Retorne códigos de status 404 ou 410 para páginas removidas permanentemente: Isso indica ao Google para não rastrear esses URLs novamente.
- Elimine erros soft 404: Verifique o Relatório de cobertura do índice para identificar e corrigir erros soft 404.
- Mantenha os sitemaps atualizados: Inclua todo o conteúdo a ser rastreado e utilize a tag para conteúdo atualizado.
- Evite longas cadeias de redirecionamento: Elas prejudicam o rastreamento.
- Otimize o carregamento das páginas: Isso permite ao Google carregar e renderizar páginas mais rapidamente, melhorando a eficiência do rastreamento.
- Monitore o rastreamento do site: Verifique problemas de disponibilidade e busque maneiras de tornar o rastreamento mais eficiente.
Como um buscador realiza o crawl do site:
Um buscador, como o Google, funciona como um explorador da web, vasculhando a internet para descobrir e indexar páginas de sites. Esse processo é chamado de “crawl” ou rastreamento.
Imagine o Googlebot, o rastreador do Google, como um robô detetive que segue pistas. Ele começa com uma lista de URLs conhecidas e visita cada uma delas. Quando chega a uma página, ele analisa seu conteúdo e identifica todos os links presentes. Esses links levam a outras páginas e fornecem ao Googlebot novas pistas para seguir.
O Googlebot segue essas pistas (links) de uma página para outra, expandindo seu conhecimento sobre a web. Esse processo contínuo ajuda o buscador a encontrar páginas novas e atualizadas para adicionar ao seu índice.
No entanto, como a web é imensa e os recursos do Google são limitados, o rastreamento precisa ser eficiente. Por isso, o Googlebot utiliza estratégias inteligentes para decidir quais páginas rastrear e com que frequência. Ele prioriza páginas populares e relevantes, e também considera a velocidade e a capacidade do servidor do site, para evitar sobrecarregá-lo.
1. Arquitetura do Site
A arquitetura de um site, que engloba sua estrutura e organização, tem um impacto significativo no crawl depth. Quando a arquitetura de um site é bem organizada, com uma taxonomia clara e hierarquia lógica, os rastreadores dos buscadores, como o Googlebot, conseguem navegar e indexar as páginas de forma mais eficiente.
Uma estrutura hierárquica facilita o rastreamento, pois permite que os rastreadores sigam os links entre as páginas principais, categorias e subcategorias, alcançando assim todas as páginas relevantes do site. Isso otimiza o crawl depth, pois os rastreadores conseguem acessar e indexar as páginas importantes sem gastar tempo e recursos desnecessários em páginas não essenciais ou duplicadas.
2. Sitemap
Um sitemap otimizado desempenha um papel crucial na facilitação do trabalho dos rastreadores dos buscadores, como o Googlebot, e na otimização do crawl depth. Um sitemap bem elaborado lista todas as páginas importantes de um site em um formato estruturado e fácil de entender, funcionando como um guia para os rastreadores.
Quando os rastreadores acessam um sitemap otimizado, eles conseguem localizar e rastrear as páginas relevantes de maneira mais eficiente, pois já têm uma visão clara da estrutura do site e das páginas que precisam ser indexadas. Isso otimiza o crawl depth, já que os rastreadores podem se concentrar nas páginas essenciais sem gastar recursos e tempo em conteúdo irrelevante ou duplicado.
Além disso, um sitemap otimizado ajuda a garantir que as páginas recém-criadas ou atualizadas sejam rastreadas e indexadas mais rapidamente, pois os rastreadores são notificados sobre as mudanças assim que acessam o sitemap.
3. Links externos
Os links externos, também conhecidos como backlinks, desempenham um papel importante no aumento da Autoridade de Página (PA) de uma URL. A PA é uma métrica que avalia a relevância e a importância de uma página na web com base na quantidade e na qualidade dos links que apontam para ela. Quando uma página tem uma PA alta, ela é considerada mais valiosa pelos algoritmos dos buscadores.
Essa maior relevância faz com que os rastreadores dos buscadores deem prioridade a essas páginas no processo de rastreamento, o que, por sua vez, afeta a hierarquia do crawl depth. Ao priorizar páginas com maior autoridade, os rastreadores conseguem indexar e exibir nos resultados de pesquisa os conteúdos mais relevantes e de qualidade.
Dessa forma, os links externos influenciam a estratégia de crawl depth ao alterar a hierarquia de rastreamento dos buscadores. Por isso, é fundamental analisar a PA das páginas do site e trabalhar na construção de backlinks de qualidade para garantir que as páginas importantes sejam rastreadas e indexadas de maneira eficiente, otimizando o crawl depth e melhorando a presença online do site.
4. Links Internos
Os links internos são conexões estabelecidas entre as páginas dentro do mesmo domínio, criando uma rede de páginas interligadas. Eles são fundamentais para ajudar o Googlebot a navegar pelo site e compreender a estrutura e o crawl depth de um domínio.
Quando o Googlebot rastreia um site, ele segue os links internos para explorar o conteúdo das páginas e identificar a hierarquia de informações do site. Isso permite que o rastreador compreenda a organização do site e determine o crawl depth de cada página. Os links internos bem estruturados garantem que todas as páginas relevantes sejam rastreadas e indexadas de maneira eficiente, melhorando a visibilidade do site nos resultados de pesquisa.
Além disso, os links internos ajudam a distribuir a autoridade do domínio entre as páginas do site, fortalecendo a relevância das páginas mais importantes e garantindo que o Googlebot priorize o rastreamento dessas páginas. Isso, por sua vez, otimiza a hierarquia do crawl depth, garantindo que as páginas de maior importância sejam rastreadas e indexadas com prioridade.
Como melhorar o crawl ratio (e o que é isso)
O crawl ratio é a porcentagem de URLs únicas na estrutura do seu site que foram rastreadas por um robô de mecanismo de pesquisa, como o Googlebot. Se o Google não estiver rastreando todo o seu conteúdo, você pode perder oportunidades de indexação e tráfego. Portanto, otimizar o crawl ratio é fundamental para o SEO.
Faça um mapeamento de arquitetura e taxonomia do site
Um mapeamento detalhado de arquitetura e taxonomia do site pode revelar problemas de navegação, links quebrados ou áreas de conteúdo não rastreadas. Ao identificar e corrigir esses problemas, você estará garantindo que o Googlebot possa navegar facilmente pelo seu site e indexar o máximo de conteúdo possível, melhorando assim o crawl ratio.
Ao mapear essa arquitetura você sabe o que deveria ser e o que efetivamente é quando o GoogleBot olha seu crawl depth. Você pode descobrir que páginas importantíssimas estavam escondidas, enquanto outras eram priorizadas pelo crawl depth. Ambos aspectos que vão tornar a sua vida consideravelmente mais difícil.
Cuidado com estruturas de links internos
Elementos como “leia mais”, “categorias”, “tags” e similares criam repositórios de conteúdos e é natural que recebam muitos links. Eles, entretanto, criam sub-nucleos de hierarquia na sua página que acabam por complicar a vida do crawler e dão uma falsa impressão de hierarquia nas páginas.
Por exemplo, digamos que você tenha uma página para os autores dos seus artigos. O autor A escreveu apenas 5 artigos no ano, enquanto o autor B escreveu 20. Naturalmente, o autor B terá uma paginação para seus artigos (artigos-de-B/page-1 e artigos-de-B/page-2), tornando o processo para chegar nos artigos mais antigos de B mais longo do que os para os artigos mais antigos de A (todos na artigos-de-A, sem paginação).
Assim, artigos mais relevantes e/ou mais recentes de B escritos mais recentemente ficarão mais longe, na hierarquia, do que os artigos de A. Algo que ninguém quer.
Atualize o sitemap com o argumento <priority>
Incluir o argumento no sitemap ajuda a informar ao Googlebot quais páginas são mais importantes e devem ser rastreadas com prioridade. Isso otimiza o crawl ratio, garantindo que as páginas de maior importância sejam rastreadas e indexadas primeiro.
O argumento, que suporta valores de 0 a 1, ajuda a indicar páginas mais importantes. Isso é bacana quando você tem páginas com caminhos de URL de mesmo nível (por exemplo, seusite.com/artigos/artigo-1 e seusite.com/servicos/servico-1) e você quer que uma seja mais prioritária do que outra (de preferência seu serviço)
Estruture a proporção de links externos do seu site
Quando começar sua campanha de link building, lembre-se que os links externos devem apontar para a mesma proporção que você gostaria que o crawl depth desse de importância para o seu site. Assim, links mais relevantes, áreas mais importantes do seu site devem receber – mais e melhores – links do que partes obscuras do seu site.
Caso essa parte obscura – uma notícia, artigo ou mesmo repositório – esteja recebendo mais cliques que o esperado, não hesite em mudá-lo de posição na hierarquia e na arquitetura para capitalizar em cima dessa nova e otimizada página para o crawl depth.
Cuidado com gargalos de no-index
O uso de no-index é encorajado para melhorar a capacidade de indexação e o crawl depth do seu site, poupando o Googlebot de mergulhar onde não deve. Porém, nas trocas entre desenvolvedores, conteudistas e profissionais de SEO, uma página pode sair no-index, mas estar com links internos chave para a navegação.
Isso não será problema para o usuário, mas será para o Googlebot, que não saberá fazer aquele caminho ao traçar o crawl depth do site e, consequentemente, vai colocar tudo depois do no-index no fim da fila ou fazendo um caminho mais longo do que o usuário efetivamente está fazendo.