Como encontrar páginas que o Google não está indexando
Página publicada que não está no índice do Google é página que não existe para busca orgânica. Ela não recebe impressão, não recebe clique, não converte — e, do lado do relatório, some da conversa sobre performance. Este guia é o procedimento para transformar "acho que tem páginas fora do índice" em uma lista concreta de URLs, com o motivo de cada uma e o caminho de correção.
O escopo aqui é estritamente detectar, diagnosticar e reindexar páginas ausentes do índice. Não é auditoria técnica geral, nem revisão de robots.txt, nem checklist de SEO técnico — quando um desses temas encostar, você verá uma menção curta como ponte, sem virar tópico.
---
Sinais de que há páginas fora do índice
Antes de abrir ferramenta, reconheça os sintomas. Eles se sobrepõem, mas cada um aponta para um subconjunto diferente do problema:
site:seudominio.com.br/url-especificaretorna vazio. O operadorsite:é o teste mais rápido para uma URL isolada. Vazio = não está no índice naquele momento.- Google Search Console (GSC) marca "URL não está no Google" na Inspeção de URL. É a fonte de verdade — o operador
site:pode variar por data center, o GSC não. - Queda de impressões no relatório de Desempenho sem mudança de conteúdo ou de estratégia. Se o total de páginas com impressão despencou, provavelmente parte do inventário saiu do índice.
- Páginas com zero cliques e zero impressões há semanas, mesmo publicadas há tempo suficiente para o Google ter descoberto. Suspeita imediata de não indexação.
- Descompasso entre o número de URLs no sitemap e o número de "Páginas indexadas" no relatório de Indexação. Se você enviou 800 URLs no sitemap e o GSC mostra 320 indexadas, a diferença precisa ser explicada.
Nenhum sinal isolado prova o problema. A confirmação vem do GSC.
---
Passo 1 — Levantar a lista no Google Search Console
Toda investigação começa aqui. O GSC é a única ferramenta que mostra o que o Google decidiu sobre suas páginas — nenhum crawler externo tem essa informação.
- Abra o Google Search Console e selecione a propriedade do site.
- No menu lateral, vá em Indexação → Páginas.
- O relatório abre com duas grandes contagens no topo: Páginas indexadas e Páginas não indexadas. Clique na segunda.
- A tela lista os motivos agrupados. Cada linha é uma categoria como Rastreada, no momento não indexada, Descoberta, no momento não indexada, Excluída pela tag "noindex", Página alternativa com tag canônica adequada, Não encontrada (404), Erro do servidor (5xx), Bloqueada pelo robots.txt, Redirecionamento, entre outros.
- Clique em cada motivo para ver a lista de URLs afetadas.
Esse agrupamento por motivo é o coração do diagnóstico. Cada motivo aponta para uma causa raiz diferente e demanda uma correção diferente — misturar tudo numa planilha só faz você perder tempo.
Exportar para trabalhar em planilha
Em cada motivo, use o botão Exportar (canto superior direito) → Google Sheets ou CSV. Faça isso para todos os motivos relevantes. Junte tudo em uma planilha mestre com quatro colunas mínimas:
| URL | Motivo GSC | Causa raiz (a preencher) | Ação (a preencher) |
O GSC exporta no máximo 1.000 URLs por motivo. Se seu site é maior que isso e você suspeita de haver muito mais URLs afetadas, precisará complementar com a URL Inspection API ou com o cruzamento contra o sitemap descrito no Passo 2.
---
Passo 2 — Cruzar sitemap.xml com páginas indexadas
O GSC mostra o que o Google já processou. Ele não lista bem o que ele nunca chegou a descobrir. Para pegar o buraco entre "o que eu publiquei" e "o que o Google conhece", cruze o sitemap com o índice:
- Extraia as URLs do seu sitemap. Baixe
seudominio.com.br/sitemap.xml(e sub-sitemaps, se houver). Cole a lista em uma coluna A da planilha. - Extraia a lista de páginas indexadas exportando o relatório de Páginas indexadas do GSC (mesma tela do Passo 1, aba "Indexadas"). Cole em uma coluna B.
- Compare com
PROCV/VLOOKUPouCOUNTIFpara marcar cada URL da coluna A com "indexada" ou "faltando". - A lista de "faltando" é o seu conjunto de páginas que deveriam estar no índice e não estão — mesmo que o GSC ainda não as tenha categorizado sob um motivo específico.
Para sites grandes, use a URL Inspection API do GSC para consultar em lote o estado de indexação de cada URL do sitemap. A API retorna, por URL, o indexStatusResult.verdict (PASS, PARTIAL, FAIL, NEUTRAL) e o coverageState (o texto do motivo), o que dá pra escrever direto na planilha.
---
Passo 3 — Inspecionar URLs representativas
Com a planilha em mãos, escolha uma amostra por motivo — não precisa inspecionar as 400 URLs de "Rastreada, no momento não indexada" para entender o padrão. Pegue de 5 a 10 URLs de cada motivo e rode a Inspeção de URL do GSC:
- Cole a URL na barra superior do GSC.
- Aguarde o retorno. Anote:
- Cobertura: "URL está no Google" ou "URL não está no Google" + motivo.
- Rastreamento: última data de rastreamento, resposta HTTP, se o Googlebot conseguiu buscar.
- Indexação: canônica declarada pelo usuário vs. canônica selecionada pelo Google.
- Melhorias: sinais de mobile, dados estruturados.
- Clique em Testar URL ao vivo para ver o estado atual (o relatório principal reflete o último rastreamento, que pode ser antigo).
- No teste ao vivo, abra HTML renderizado e Screenshot para conferir se o Googlebot vê o conteúdo — problemas de renderização por JavaScript aparecem aqui.
A amostra permite generalizar: se 8 de 10 URLs "Descoberta, no momento não indexada" apontam para o mesmo problema (por exemplo, ausência de links internos), você trata o padrão, não caso a caso.
---
Passo 4 — Mapear cada URL à causa raiz
Este é o passo em que a planilha ganha a coluna "Causa raiz". Cada motivo do GSC corresponde tipicamente a uma ou mais causas técnicas. Use a tabela abaixo como mapa de diagnóstico:
| Motivo no GSC | Causas raiz mais comuns | |---|---| | Bloqueada pelo robots.txt | Diretiva Disallow cobrindo o caminho da URL. | | Excluída pela tag "noindex" | Meta <meta name="robots" content="noindex"> no HTML ou header X-Robots-Tag: noindex. | | Página alternativa com tag canônica adequada | <link rel="canonical"> da URL aponta para outra URL. Comportamento correto se intencional; problema se a canônica foi mal configurada. | | URL enviada não selecionada como canônica | Google escolheu outra URL como canônica (geralmente por conteúdo duplicado ou sinais mais fortes na outra versão). | | Duplicata sem canônica selecionada pelo usuário | Google achou a página duplicada de outra e escolheu a outra; sua página não tem canônica clara. | | Rastreada, no momento não indexada | Google leu a página mas decidiu não indexar. Costuma indicar: conteúdo thin, baixa qualidade percebida, valor duplicado com outras páginas do próprio site, sinais fracos de autoridade. | | Descoberta, no momento não indexada | Google conhece a URL (achou em link ou sitemap) mas ainda não rastreou. Sinal de crawl budget insuficiente, ou de página órfã com sinais fracos. | | Não encontrada (404) | Servidor retorna 404 para uma URL que foi enviada como válida. | | Erro do servidor (5xx) | Servidor retornou erro no momento do rastreamento. Pode ser intermitente. | | Página com redirecionamento | URL redireciona para outra; Google indexa o destino, não a origem. | | Soft 404 | Servidor retorna 200, mas o conteúdo parece uma página de erro (vazio, "não encontrado", carrinho vazio, etc). |
Para páginas que apareceram no cruzamento com o sitemap (Passo 2) mas não estão em nenhum motivo do GSC, o mais provável é página órfã: existe no sitemap, mas nenhum link interno do site aponta para ela, e o Google ainda não priorizou o rastreamento. Confirme rodando um crawl a partir da home e vendo se o caminho de links leva até a URL.
Renderização JavaScript merece nota à parte: se a página só monta conteúdo no client-side e o HTML inicial vem vazio, o Googlebot pode ver uma casca sem valor e classificar como thin ou soft 404. O "HTML renderizado" da Inspeção de URL do GSC é o teste definitivo.
---
Passo 5 — Aplicar a correção correspondente
A cada causa, uma ação. Faça isso na planilha antes de mexer no site — assim você trabalha em lote por tipo de correção, não URL por URL.
- Bloqueio no robots.txt → remover ou ajustar a diretiva
Disallowque cobre o padrão. Publicar orobots.txtcorrigido. - Meta noindex indevido → remover a tag do template ou da URL específica. Confirmar com
curl -Ique o headerX-Robots-Tagtambém não traznoindex. - Canonical errado → ajustar
<link rel="canonical">para apontar para a própria URL (self-canonical) quando ela deve ser a versão principal. - Conteúdo duplicado → decidir qual é a canônica, apontar as duplicatas para ela via canonical (ou consolidar via 301). Não deixe duas páginas competindo pelo mesmo conteúdo se você quer uma delas indexada.
- Página órfã → adicionar links internos apontando para a URL a partir de páginas relevantes (categoria, hub, artigos correlatos, menu, footer conforme fizer sentido). Sem links internos, o Google trata a URL como periférica.
- Conteúdo thin → expandir com informação real (não filler). Cobrir a intenção de busca de verdade. Sem isso, o "Rastreada, no momento não indexada" não se resolve.
- Erro 4xx → restaurar a página, redirecionar 301 para a nova localização, ou aceitar que ela morreu (nesse caso, remover do sitemap).
- Erro 5xx → investigar o servidor. Se for intermitente, o próprio Google costuma tentar de novo; se for consistente, é bug de aplicação/infra.
- Redirect → decidir se você quer indexar a origem (então remover o redirect) ou o destino (então tudo certo, a origem sair do índice é o esperado).
- Renderização JS → habilitar SSR, pré-renderização ou dynamic rendering para o conteúdo principal estar no HTML inicial.
Não misture correções: aplique um tipo, verifique, e só depois passe pro próximo. Isso é o que permite atribuir causa ao efeito quando os números começarem a se mover.
---
Passo 6 — Solicitar reindexação
Corrigir não basta. O Google não reprocessa a página no minuto seguinte — ele reprocessa quando cabe no orçamento de rastreamento dele. Você tem três formas de acelerar esse ciclo, do menor para o maior volume:
6a. Uma URL de cada vez — Inspeção de URL do GSC
Para correções pontuais (até algumas dezenas de URLs):
- Abra o Google Search Console → selecione a propriedade.
- Cole a URL corrigida na barra de Inspeção de URL no topo.
- Aguarde a análise. Clique em Testar URL ao vivo para forçar o Googlebot a buscar a versão atual.
- Se o teste ao vivo mostrar que a URL pode ser indexada agora (nenhum bloqueio, sem noindex, canônica ok), clique em Solicitar indexação.
- O GSC coloca a URL numa fila prioritária. Repita para cada URL.
Limitações: há uma cota diária (não publicada oficialmente, mas na prática algo em torno de 10 a 20 solicitações por dia por propriedade). Solicitar indexação não garante que a URL será indexada — apenas prioriza o rastreamento. Se a página tiver problema de qualidade que causou o "Rastreada, no momento não indexada", clicar em "Solicitar indexação" não resolve; o problema é o conteúdo, não a fila.
6b. Volume médio — reenviar o sitemap.xml
Para dezenas ou centenas de URLs corrigidas de uma vez:
- Garanta que o
sitemap.xml(e sub-sitemaps) contém apenas as URLs canônicas que você quer indexadas — sem 404, sem redirects, sem noindex, sem duplicatas. - Atualize a data
<lastmod>de cada URL corrigida para a data da correção. O Google usa<lastmod>como sinal de que vale a pena revisitar. - Publique o sitemap atualizado.
- No GSC, vá em Indexação → Sitemaps. Se o sitemap já está listado, clique nele e depois em Reenviar sitemap. Se ainda não estiver, adicione a URL do sitemap e envie.
- Confira que o status volta a "Sucesso" e que o número de URLs descobertas bate com o esperado.
Reenviar sitemap é a forma mais escalável de dizer "olha, tem coisa nova ou atualizada aqui" sem precisar clicar URL por URL.
6c. Volume alto e uso específico — Indexing API
A Indexing API do Google permite notificar programaticamente sobre criação e remoção de URLs. Uso oficialmente suportado: páginas de ofertas de emprego (JobPosting) e vídeos ao vivo (BroadcastEvent). Fora desses casos, o Google não garante que a API vai processar suas chamadas.
Se seu site cai em um dos casos suportados:
- Ative a Indexing API no Google Cloud Console e crie uma service account.
- Autorize a service account como proprietária do site no GSC.
- Faça chamadas
POSTparahttps://indexing.googleapis.com/v3/urlNotifications:publishcom o payload:
``json { "url": "https://seudominio.com.br/pagina", "type": "URL_UPDATED" } ``
- O tipo pode ser
URL_UPDATED(novo conteúdo ou atualização) ouURL_DELETED(remoção).
Para sites que não são de vaga/vídeo ao vivo, fique com o sitemap + Inspeção de URL. Usar a Indexing API fora do escopo suportado não é proibido, mas não há promessa de que resulte em indexação mais rápida.
6d. Sinais adicionais que ajudam o reprocessamento
Além de solicitar diretamente, alguns sinais externos aceleram o Google a voltar na página:
- Novos links internos de páginas já bem rastreadas (home, hub principal, artigos com tráfego).
- Menção/link externo em site que o Googlebot rastreia com frequência.
- Atualização visível do conteúdo (não apenas mudar o
<lastmod>no sitemap sem tocar na página — o Google detecta essa dissonância).
---
Passo 7 — Verificar que a correção surtiu efeito
Correção sem verificação não é correção — é esperança. Depois de aplicar as ações e solicitar reindexação, aguarde de 3 a 14 dias (a janela varia por site e por autoridade percebida) e valide:
- Reinspecionar as URLs corrigidas com a Inspeção de URL do GSC. O status deve ter mudado de "URL não está no Google" para "URL está no Google". Se continuar fora, releia a última data de rastreamento — se o Google ainda não voltou, aguarde mais; se voltou e ainda excluiu, a causa raiz não foi a que você atacou.
- Rodar
site:seudominio.com.br/url-especificapara uma verificação rápida. Retornar a URL significa que ela está no índice naquele data center. - Monitorar "Páginas indexadas" no relatório de Indexação do GSC. A curva de páginas indexadas deve subir na proporção do lote corrigido. Se o gráfico ficou plano, algo não passou.
- Acompanhar o relatório de Desempenho com filtro pelas URLs corrigidas. O sinal econômico de sucesso é impressão voltando — o clique é consequência.
- Marcar na planilha cada URL como "resolvida", "ainda fora" ou "outra causa detectada". As linhas "ainda fora" viram o próximo ciclo de investigação: possivelmente a causa raiz identificada estava incompleta e há um segundo motivo empilhado (ex: você removeu o
noindexmas a página continua thin).
Este ciclo — detectar → diagnosticar → corrigir → solicitar → verificar → refinar — é o loop operacional. Rodá-lo com regularidade (mensal ou trimestral, conforme volume de publicação) mantém o gap entre "URLs publicadas" e "URLs indexadas" pequeno e conhecido, em vez de virar uma surpresa desagradável no próximo relatório.