Li o robots.txt de 200 Grandes Sites Brasileiros: Só 30 Restringem os Robôs de IA

Baixei em 21/09/2026 o robots.txt dos 200 domínios .br mais acessados. 30 restringem algum robô de IA, 10 citam os robôs só para liberar, e 26 já publicam llms.txt.

29 de setembro de 2026·10 min read·Jacqueline Blanco
Li o robots.txt de 200 Grandes Sites Brasileiros: Só 30 Restringem os Robôs de IA

Baixei em 21 de setembro de 2026 o arquivo robots.txt dos 200 domínios .br mais bem colocados numa lista pública de tráfego e procurei, em cada um, os nomes dos 26 robôs que as empresas de IA usam para ler a web. Dos 145 sites que publicam o arquivo, 30 restringem pelo menos um robô de IA. Outros 10 citam os robôs pelo nome para fazer o contrário: liberar a entrada. E 105 não dizem nada, o que na prática é porta aberta.

O achado que eu não esperava está nos portais de notícia. UOL e Folha bloqueiam mais de 20 robôs de IA e poupam justamente o da OpenAI. A planilha com as 220 linhas da coleta está no fim do post.

Número de grandes sites brasileiros que bloqueiam cada robô de IA no robots.txt, verificado em 21 de setembro de 2026

Como fiz a coleta

A base é a lista Tranco, um ranking de domínios mantido por pesquisadores que combina várias fontes de tráfego e é usado em estudos acadêmicos de segurança. Baixei a lista de 21/09/2026 (identificador 64X5X), filtrei os domínios terminados em .br e fiquei com os 200 primeiros, tirando sites adultos. O primeiro da fila é o uol.com.br, na posição 561 do ranking mundial.

Para cada domínio, pedi o /robots.txt com e sem www. Onde a primeira tentativa falhou, repeti com outro cliente HTTP. Depois pedi o /llms.txt, o arquivo que alguns sites passaram a publicar para orientar modelos de linguagem. Em paralelo, fiz o mesmo em 20 endereços de veículos de notícia, porque vários deles moram em subdomínio, como g1.globo.com e folha.uol.com.br, e têm robots.txt próprio.

Em cada arquivo procurei 26 nomes de robô: GPTBot, ChatGPT-User e OAI-SearchBot da OpenAI, ClaudeBot e os outros quatro da Anthropic, Google-Extended, CCBot do Common Crawl, PerplexityBot, Bytespider da ByteDance, Applebot-Extended, Amazonbot, meta-externalagent e mais uma dúzia. Classifiquei cada citação em três tipos: bloqueio total (Disallow: /), bloqueio parcial (algumas pastas) ou liberação explícita (Allow: / ou Disallow: vazio).

Uma ressalva que vale para o post inteiro: robots.txt é um pedido, não uma trava. O robô bem-comportado obedece. Bloqueio de verdade acontece no firewall, e isso a leitura de um arquivo público não enxerga.

O retrato geral

SituaçãoSitesPercentual dos 145
Publicam robots.txt legível145 de 200
Não citam nenhum robô de IA10572,4%
Citam algum robô de IA4027,6%
Restringem pelo menos um (total ou parcial)3020,7%
Bloqueio total de pelo menos um2114,5%
Citam só para liberar106,9%
Bloqueiam todos os robôs, inclusive buscadores32,1%

Dados verificados em 21/09/2026, top 200 de domínios .br da lista Tranco.

Os 55 que ficaram fora se dividem assim: 21 não responderam, quase todos domínios de infraestrutura que não têm site, como CDNs e servidores de DNS. Doze devolveram 404, ou seja, não têm o arquivo. Onze responderam 200 com outra coisa no lugar, em geral a página inicial, e vários são portais do governo e universidades. Nove recusaram a leitura com 403 ou 401.

Sete em cada dez grandes sites brasileiros não têm posição declarada sobre IA. Não é permissão consciente. É arquivo escrito antes de o assunto existir.

Quem barra, robô por robô

RobôDe quem éBloqueio totalBloqueio parcialLiberado pelo nome
GPTBotOpenAI, treino1478
ClaudeBotAnthropic, treino1257
CCBotCommon Crawl1607
Google-ExtendedGoogle, treino do Gemini10414
PerplexityBotPerplexity8610
ChatGPT-UserOpenAI, navegação a pedido do usuário6511
OAI-SearchBotOpenAI, busca465
BytespiderByteDance901

Contagem entre os 145 sites com robots.txt, verificada em 21/09/2026.

O CCBot é o mais bloqueado em termos absolutos, e faz sentido: o Common Crawl é a base aberta que alimentou o treino de boa parte dos modelos. O GPTBot vem logo atrás quando se soma o bloqueio parcial.

Repare na última coluna. O Google-Extended é liberado pelo nome em 14 sites e bloqueado em 10. O ChatGPT-User é liberado em 11 e bloqueado em 6. Existe um grupo de sites que escreveu regra de IA para garantir que vai aparecer nas respostas, não para sumir delas.

Quem bloqueia tudo o que cita: uol.com.br com 23 robôs, amazon.com.br com 21, olhardigital.com.br com 16, glassdoor.com.br com 14 e jusbrasil.com.br com 13. Na outra ponta, a Lojas Renner cita 22 robôs e libera 21.

Por setor, a diferença é grande

SetorSites com robots.txtCitam IARestringemPublicam llms.txt
Varejo e marketplace31171111
Notícia e mídia271199
Educação e pesquisa16221
Governo e Judiciário15000
Banco e finanças11222
Telecom, hospedagem e tecnologia9002
Outros36861

Classificação de setor feita por mim, a partir do domínio. Dados de 21/09/2026.

Nenhum dos 15 sites de governo e Judiciário com robots.txt cita robô de IA. Nenhuma empresa de telecom ou hospedagem também. Os dois setores que tomaram posição são os que vivem de conteúdo e de catálogo: mídia e varejo.

No varejo, a posição se divide ao meio. Amazon, Mercado Livre e Americanas bloqueiam. Netshoes, Dafiti, Drogaria São Paulo e Drogarias Pacheco liberam pelo nome. Quem vende produto tem um motivo concreto para querer ser lido: quando alguém pede a um assistente de IA uma recomendação de tênis, o catálogo que o robô conseguiu ler é o que entra na resposta.

Os portais de notícia não concordam entre si

Nos 20 endereços de notícia, 19 têm robots.txt, 11 citam robôs de IA e 7 bloqueiam.

VeículoPosição no robots.txt
O Globo, ValorBloqueio total de 19 e de 15 robôs, OpenAI incluída
EstadãoBloqueio total de 8 robôs, OpenAI incluída
Gazeta do Povo, Olhar DigitalBloqueio total
UOL, UOL NotíciasBloqueio total de 23 robôs, sem citar o GPTBot
FolhaBloqueio total de 21 robôs, com GPTBot, ChatGPT-User e OAI-SearchBot liberados pelo nome
Exame, R7, Correio Braziliense, CanaltechCitam robôs de IA só para liberar
g1, Veja, CNN Brasil, Metrópoles, InfoMoney, Poder360, Estado de Minas, O TempoNenhuma menção a IA

Leitura de 21/09/2026.

Duas coisas chamam atenção. A primeira é o grupo Globo: O Globo bloqueia 19 robôs e o Valor 15, e o g1, do mesmo grupo e com audiência muito maior, não cita nenhum. A segunda é o par UOL e Folha. Os dois bloqueiam Anthropic, Google-Extended, Perplexity, Meta, Amazon, Apple e mais uma fila, e deixam a OpenAI de fora. Na Folha, a liberação é explícita: User-agent: GPTBot seguido de Allow: /. O arquivo não explica o motivo e eu não vou adivinhar. O que dá para afirmar é que não foi esquecimento, porque alguém escreveu a regra.

O llms.txt já apareceu em 26 sites

O llms.txt é uma proposta recente: um arquivo em Markdown na raiz do site que resume, para um modelo de linguagem, o que o site é e onde está o conteúdo que importa. Não é padrão oficial e nenhuma grande empresa de IA confirmou que usa. Mesmo assim, 26 dos 200 domínios já publicam um, 13% da amostra.

A lista tem nomes grandes: Itaú, Bradesco, Magazine Luiza, Americanas, Lojas Renner, Claro, KaBuM, O Boticário, MadeiraMadeira, Azul, Catho, RD Station, Alura e Jusbrasil. O do Itaú tem 39 KB e abre declarando o objetivo: ajudar sistemas de IA e agentes a identificar a área correta do ecossistema do banco. O da Renner tem 56 KB.

Três sites fazem as duas coisas ao mesmo tempo: Jusbrasil, Americanas e Gazeta do Povo bloqueiam robôs de IA no robots.txt e publicam llms.txt para orientá-los. Não é necessariamente contradição. A Americanas bloqueia o GPTBot, que coleta para treino, e libera o ChatGPT-User e o OAI-SearchBot, que buscam a pedido de um usuário. A mensagem é: não treine com o meu catálogo, mas me cite quando alguém perguntar.

Um único site dos 220, o Chaves na Mão, usa a diretiva Content-Signal, que declara o uso permitido em vez de nomear robôs: ai-train=no, search=yes, ai-input=yes.

O que isso muda para o site de um negócio pequeno

Se você tem um site de serviço local, de loja, de escritório, a conta é diferente da de um jornal. O jornal vende o texto. Você quer que o texto seja lido por qualquer coisa que possa mandar cliente. Bloquear robô de IA num site institucional tira o seu negócio das respostas de quem pergunta para o ChatGPT quem presta aquele serviço na sua cidade.

Se mesmo assim quiser separar treino de busca, o modelo da Americanas é o mais fino que vi na coleta:

User-agent: GPTBot
User-agent: CCBot
Disallow: /

User-agent: ChatGPT-User
User-agent: OAI-SearchBot
Allow: /

Para conferir o seu, abra seusite.com.br/robots.txt no navegador. Se der 404, você está no grupo dos 12 que não têm arquivo, e nenhum robô está barrado. Se o arquivo tiver User-agent: * com Disallow: /, você está barrando o Google junto, que foi o que encontrei em três dos 145.

O custo de usar esses modelos, para quem está do outro lado e quer consumir IA em vez de alimentá-la, está em chat, agente ou API: o que você está pagando na IA.

Limitações desta coleta

A lista Tranco mede domínio, não site. Por isso entram endereços de CDN e de DNS, que explicam boa parte dos 21 sem resposta. Subdomínios com robots.txt próprio só entraram no recorte de notícia. A classificação por setor é minha e tem uma gaveta grande de "outros". E a leitura é de um dia: robots.txt muda sem aviso.

De onde saiu cada número

A planilha da coleta

São 220 linhas com grupo, posição na lista Tranco, domínio, setor, se o robots.txt foi lido, o status HTTP, quantos robôs de IA o arquivo cita, a classificação de cada um dos 26 robôs, se usa Content-Signal e se publica llms.txt.

Baixar a planilha do robots.txt (.csv)

Estes números valem para 21 de setembro de 2026. O próximo passo prático leva dois minutos: abra o robots.txt do seu site, veja se ele existe e se foi escrito por alguém ou gerado pela plataforma. Se você nunca tomou essa decisão, ela está tomada por omissão, do mesmo jeito que em 105 dos maiores sites do país.

📩 Gostou deste artigo?

Receba conteúdo como este toda semana, direto no seu email.

#robots.txt ia#bloquear gptbot#llms.txt#como bloquear chatgpt do site#robôs de ia sites brasileiros
JB

Escrito por

Jacqueline Blanco

Especialista em automações e Inteligência Artificial, fundadora do Modo Fluxo. Ajuda negócios a aplicar IA na prática, sem enrolação. Saiba mais →

Leia também