Pesquisa atualizada em 2026-07-09.
Resumo brutalmente honesto
Anubis é uma boa solução, especialmente para small web, indieweb, sites pessoais, instâncias federadas, documentação pública e serviços que sofrem com crawler agressivo. Mas não existe bala de prata. Quem promete “bloquear IA de vez” está vendendo fantasia.
A proteção real precisa ser em camadas:
- robots.txt / ai.txt para bots que respeitam regras.
- bloqueio por CDN/WAF para bots conhecidos e tráfego óbvio.
- challenge / proof-of-work para aumentar custo de scraping.
- rate limit e fingerprinting para pegar comportamento suspeito.
- tarpits / labyrinths para desperdiçar tempo de crawlers ruins.
- poisoning/cloaking para imagens e conteúdo criativo, com muita cautela.
Minha recomendação técnica, sem enrolação: para seus projetos pequenos/médios, use Cloudflare Free + robots.txt atualizado + Anubis em rotas sensíveis + rate limit no Nginx/Caddy + logs. Use tarpit/poisoning só onde você realmente quer briga com crawler, porque pode ferrar indexação, performance e diagnóstico.
O que é o Anubis
Anubis é um “Web AI Firewall Utility” open-source que coloca desafios na frente de requisições HTTP para impedir ou encarecer scraping automatizado. O mecanismo mais conhecido é o proof-of-work, ou seja, o visitante precisa resolver um pequeno desafio computacional antes de acessar o backend.
- Projeto: https://github.com/TecharoHQ/anubis
- Licença: MIT
- Linguagem: Go
- Modelo: reverse proxy / camada intermediária
- Foco: proteger sites pequenos contra crawlers agressivos, especialmente crawlers de IA
- Ponto forte: simples, gratuito, self-hosted
- Ponto fraco: pode atrapalhar usuários reais, indexadores legítimos e acessibilidade se mal configurado
O próprio projeto diz que muita gente talvez consiga resolver com Cloudflare, mas que Anubis existe para quem não quer ou não pode depender de Cloudflare.
Quando Anubis faz sentido
Use Anubis quando:
- seu site recebe crawler pesado;
- você quer self-hosted;
- você não quer depender só de Cloudflare;
- você hospeda small web/indieweb/fediverso/docs;
- você quer proteger endpoints caros, como busca, feeds dinâmicos, páginas de arquivo, APIs públicas e páginas muito linkadas.
Quando Anubis pode ser má ideia
Evite jogar Anubis no site inteiro se:
- SEO é crítico;
- você depende de previews de redes sociais;
- precisa ser extremamente acessível sem JS;
- tem muitos usuários com browser velho;
- o site é basicamente conteúdo público que você quer indexar.
O erro comum é transformar o site todo em fortaleza e depois reclamar que Google, leitores RSS, Mastodon previews, bots bons e ferramentas de arquivamento pararam de funcionar.
Lista de soluções
1. Anubis
Categoria: proof-of-work / challenge / anti-crawler
Custo: grátis
Self-hosted: sim
Maturidade: alta para o nicho small web
Link: https://github.com/TecharoHQ/anubis
O que faz
Coloca uma barreira antes do backend. O navegador legítimo resolve um desafio; crawlers em massa pagam custo computacional repetidamente.
Vantagens
- Open-source.
- Sem depender de empresa externa.
- Bom para VPS própria.
- Combina bem com Nginx, Caddy, Traefik e apps pequenos.
- O custo imposto ao crawler escala contra scraping massivo.
Desvantagens
- Pode quebrar indexação.
- Pode afetar bots legítimos.
- Não para scraping feito por browsers reais distribuídos.
- Não substitui WAF, rate limit ou monitoramento.
Melhor uso
Coloque em rotas caras:
/search/archive/tag/*/api/*pública- páginas de listagem profunda
- endpoints que geram carga no banco
Não colocaria cegamente em /, /feed.xml, /robots.txt, /sitemap.xml, assets estáticos e páginas que você quer que sejam descobertas.
2. Cloudflare AI Crawl Control / AI Scrapers and Crawlers
Categoria: CDN/WAF gerenciado / bloqueio de bots de IA
Custo: tem recursos gratuitos; recursos avançados podem variar por plano
Self-hosted: não
Link: https://developers.cloudflare.com/ai-crawl-control/
O que faz
A Cloudflare oferece controles para identificar, analisar e bloquear crawlers de IA. Também tem opção de bloquear AI Scrapers and Crawlers no painel, inclusive para contas gratuitas segundo anúncios da própria Cloudflare.
Vantagens
- Muito fácil de ativar.
- Boa base de inteligência de tráfego.
- Funciona antes de chegar na sua VPS.
- Ajuda contra bots que ignoram robots.txt.
- Excelente primeira camada para sites pequenos.
Desvantagens
- Dependência da Cloudflare.
- Menos controle fino que solução própria.
- Pode bloquear coisas demais se você ligar tudo sem analisar.
- Centraliza seu tráfego numa empresa externa.
Melhor uso
Primeira camada para praticamente qualquer domínio público seu. Para projetos seus, eu usaria como base e não como solução única.
3. Cloudflare Turnstile
Categoria: desafio humano/bot invisível ou quase invisível
Custo: gratuito em muitos usos
Self-hosted: não
Link: https://developers.cloudflare.com/turnstile/
O que faz
É uma alternativa ao CAPTCHA. O widget gera um token no navegador e seu servidor valida com a Cloudflare. É mais útil para formulários, login, comentários, cadastro e ações sensíveis do que para proteger páginas estáticas.
Vantagens
- Melhor experiência que CAPTCHA tradicional.
- Bom contra spam de formulário.
- Pode ser usado sem passar todo o site pela Cloudflare.
- Fácil de integrar em sistemas próprios.
Desvantagens
- Não é proteção geral contra crawler lendo páginas públicas.
- Depende de Cloudflare.
- Precisa integração no backend.
Melhor uso
Use em:
- login;
- formulário de contato;
- comentários;
- cadastro;
- reset de senha;
- endpoints de POST.
Não é substituto do Anubis.
4. go-away
Categoria: reverse proxy anti-abuso / challenge seletivo
Custo: grátis
Self-hosted: sim
Link: https://github.com/WeebDataHoarder/go-away
O que faz
Fica entre a internet e seu site. Permite selecionar requisições por regras e aplicar ações ou desafios. A filosofia é menos nuclear que simplesmente bloquear tudo.
Vantagens
- Flexível.
- Bom para aplicar desafios só em rotas suspeitas.
- Mais cirúrgico que um bloqueio bruto.
- Boa alternativa ao Anubis se você quer regras mais customizadas.
Desvantagens
- Menos famoso que Anubis.
- Exige mais atenção em configuração.
- Pode virar uma gambiarra complexa se você inventar regra demais.
Melhor uso
Quando você quer uma camada anti-abuso mais customizada, com regras por caminho, user-agent, IP, headers e comportamento.
5. pow-bot-deterrent
Categoria: proof-of-work anti-bot
Custo: grátis
Self-hosted: sim
Link: https://github.com/sequentialread/pow-bot-deterrent
O que faz
Implementa um fluxo de proof-of-work: o app gera desafios, o cliente resolve via JavaScript e o servidor valida.
Vantagens
- Ideia simples e transparente.
- Bom para integrar em app próprio.
- Útil se você quer entender e controlar o mecanismo.
Desvantagens
- Menos pronto “plug and play”.
- Você provavelmente precisará integrar no app ou proxy.
- Menos ecossistema que Anubis.
Melhor uso
Projetos próprios onde você quer embutir proof-of-work diretamente, não só jogar um proxy pronto na frente.
6. Caddy Bot Barrier Plugin
Categoria: challenge computacional para Caddy
Custo: grátis
Self-hosted: sim
Link: https://github.com/steffenbusch/caddy-bot-barrier
O que faz
Plugin do Caddy que exige um desafio computacional baseado no navegador antes de liberar acesso a recursos HTTP.
Vantagens
- Excelente se você usa Caddy.
- Integra direto na camada do servidor web.
- Evita colocar mais um serviço separado.
Desvantagens
- Específico para Caddy.
- Menor comunidade que Anubis.
- Você precisa compilar/usar Caddy com plugin.
Melhor uso
Sites servidos por Caddy onde você quer uma proteção estilo Anubis sem adicionar outro reverse proxy.
7. OpenCloudflareCDN
Categoria: reverse proxy com JavaScript challenge
Custo: grátis
Self-hosted: sim
Link: https://github.com/Sn0wo2/OpenCloudflareCDN
O que faz
Reverse proxy inspirado na Cloudflare com JavaScript Challenge para bloquear bots, crawlers e ataques de camada HTTP.
Vantagens
- Ideia interessante.
- Self-hosted.
- Pode servir como laboratório para entender challenge/proxy.
Desvantagens
- Projeto menor.
- Menos testado em produção real.
- Eu não colocaria em serviço importante sem testar bastante.
Melhor uso
Laboratório, projeto pequeno, ambiente controlado. Não seria minha primeira escolha em produção séria.
8. ai.robots.txt
Categoria: lista de user-agents de IA para robots.txt / ai.txt
Custo: grátis
Self-hosted: sim
Link: https://github.com/ai-robots-txt/ai.robots.txt
O que faz
Mantém uma lista de crawlers/agentes de IA para bloquear via robots.txt e ai.txt.
Vantagens
- Simples.
- Gratuito.
- Fácil de automatizar.
- Bom como primeira declaração de política.
Desvantagens
- Só funciona com crawler que obedece.
- Não bloqueia IP.
- Não impede scraping disfarçado.
Melhor uso
Use sempre, mas não se iluda. É camada declarativa, não barreira real.
Exemplo conceitual:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
O ideal é gerar isso a partir de uma lista atualizada, não manter na mão para sempre.
9. Known Agents / Dark Visitors
Categoria: monitoramento/lista de crawlers/robots.txt
Custo: há opções gratuitas e pagas dependendo do uso
Self-hosted: parcialmente; plugins e integrações variam
Links:
- https://knownagents.com/
- https://wordpress.org/plugins/dark-visitors/
- https://github.com/mauricerenck/dark-visitors
O que faz
Ajuda a rastrear agentes, crawlers, scrapers e bots de IA, além de gerar robots.txt atualizado. Há plugin para WordPress e integrações para CMS como Kirby.
Vantagens
- Poupa trabalho de manter lista de bots.
- Bom para WordPress.
- Ajuda a enxergar quem está acessando.
Desvantagens
- Ainda depende muito de robots.txt.
- Não substitui WAF/challenge.
- Algumas funções podem depender de serviço externo.
Melhor uso
Sites de conteúdo, blogs e WordPress onde você quer uma gestão simples de crawlers sem ficar caçando user-agent novo toda semana.
10. CrowdSec + Nginx/OpenResty bouncer
Categoria: IPS comunitário / reputação / bloqueio por comportamento
Custo: grátis/open-source, com serviços pagos opcionais
Self-hosted: sim
Links:
O que faz
CrowdSec analisa logs e comportamento, toma decisões de bloqueio, e o bouncer aplica essas decisões no Nginx/OpenResty. É mais segurança geral do que anti-IA puro.
Vantagens
- Excelente para servidores seus.
- Ajuda contra abuso real: brute force, scan, bots ruins, ataques comuns.
- Integra com Nginx.
- Boa camada para VPS.
Desvantagens
- Não é especializado em “AI crawler”.
- Precisa alimentar com logs corretos.
- Requer manutenção.
Melhor uso
Base de proteção para servidores que hospedam vários serviços. Eu colocaria em VPS com muitos domínios.
11. OWASP ModSecurity CRS / Coraza CRS
Categoria: WAF open-source
Custo: grátis
Self-hosted: sim
Links:
O que faz
Conjunto de regras para WAFs compatíveis com ModSecurity/Coraza. Protege contra ataques comuns como SQL injection, XSS, LFI/RFI e outras classes do OWASP Top 10.
Vantagens
- Maduro.
- Open-source.
- Bom para segurança geral.
- Protege apps de ataques reais, não só crawler.
Desvantagens
- Pode gerar falso positivo.
- Não é feito especificamente para bloquear crawler de IA.
- Requer tuning.
Melhor uso
Aplicações web públicas com login, painel, formulários e endpoints sensíveis. Combine com Anubis/CrowdSec, não substitua.
12. Rate limit no Nginx/Caddy/Traefik
Categoria: controle de taxa
Custo: grátis
Self-hosted: sim
O que faz
Limita quantas requisições um IP/cliente pode fazer por janela de tempo.
Vantagens
- Simples.
- Extremamente eficaz contra crawler burro.
- Não depende de JS.
- Reduz carga no backend.
Desvantagens
- IP compartilhado pode gerar falso positivo.
- Crawler distribuído contorna.
- Não identifica intenção.
Melhor uso
Sempre use em endpoints caros:
- busca;
- login;
- API;
- feeds dinâmicos;
- páginas de arquivo;
- endpoints de exportação;
- páginas com query pesada.
Tarpits, labyrinths e armadilhas
Aqui começa a parte mais agressiva. Tarpit não é só “bloquear”: é prender crawler em um labirinto de páginas inúteis. Isso pode ser útil, mas também pode ser uma péssima ideia se você não souber separar bot ruim de bot bom.
13. Nepenthes
Categoria: tarpit anti-AI crawler / fake pages / Markov babble
Custo: grátis
Self-hosted: sim
Links:
O que faz
Gera um labirinto infinito de páginas falsas com links para mais páginas falsas. A ideia é prender crawlers que ignoram regras e fazê-los consumir lixo.
Vantagens
- Conceito poderoso contra crawler agressivo.
- Pode desperdiçar recurso do scraper.
- Pode poluir coleta de dados ruim.
Desvantagens
- Pode atingir bot legítimo se mal roteado.
- Pode consumir recursos seus também.
- Pode criar caos nos logs.
- Pode prejudicar indexação se exposto de forma errada.
- Pode ser visto como medida hostil.
Melhor uso
Não coloque link visível para usuário. Use como destino para bots suspeitos detectados pelo proxy, por robots trap, por user-agent ruim ou por rotas-isca.
14. Iocaine
Categoria: tarpit / garbage generator / engine de regras para crawlers
Custo: grátis
Self-hosted: sim
Links:
- https://github.com/readycool/iocaine
- https://git.madhouse-project.org/iocaine/iocaine/src/branch/iocaine-3.x
O que faz
Começou como gerador de lixo/tarpit para onde o reverse proxy mandava visitantes indesejados. Evoluiu para uma ferramenta mais ambiciosa, com engine de scripts para decidir como tratar cada request.
Vantagens
- Muito alinhado com small web e defesa contra crawlers ruins.
- Mais flexível que um tarpit simples.
- Pode servir conteúdo real para visitantes bons e labirinto para crawlers.
Desvantagens
- Mais complexo que Nepenthes.
- Instalação/operação pode ser mais trabalhosa.
- Projeto mais nichado.
Melhor uso
Para quem quer brincar pesado: reverse proxy identifica tráfego ruim e manda para Iocaine. Para sites de produção simples, talvez seja exagero.
15. spidertrap-rs / spider_trap
Categoria: crawler trap simples
Custo: grátis
Self-hosted: sim
Links:
O que faz
Servidores simples que geram páginas com links infinitos ou quase infinitos para prender crawlers.
Vantagens
- Simples.
- Bom laboratório.
- Fácil de entender.
Desvantagens
- Não tem inteligência anti-bot sofisticada.
- Pode ser tosco em produção.
- Precisa ser muito bem isolado.
Melhor uso
Experimento, honeypot leve, aprendizado, armadilha isolada.
16. Cloudflare AI Labyrinth
Categoria: tarpit/honeypot gerenciado para bots de IA
Custo: anunciado como gratuito/opt-in na Cloudflare
Self-hosted: não
Referência: Cloudflare anunciou ferramenta que redireciona bots suspeitos para páginas isca geradas por IA.
O que faz
Em vez de só bloquear bots, a Cloudflare pode encaminhá-los para um labirinto de conteúdo falso, desperdiçando tempo e ajudando a detectar/fingerprintfar tráfego malicioso.
Vantagens
- Fácil se você já usa Cloudflare.
- Não roda na sua VPS.
- Usa inteligência da Cloudflare.
Desvantagens
- Caixa preta.
- Dependência total da Cloudflare.
- Pode não estar disponível/igual em todos os planos/regiões.
Melhor uso
Domínios já protegidos pela Cloudflare onde você quer uma resposta mais agressiva que simples bloqueio.
AI poisoning / cloaking / proteção de conteúdo criativo
Agora a parte que precisa de cuidado. “Poisoning” pode significar coisas diferentes:
- Cloaking de imagem: altera a imagem para atrapalhar imitação de estilo.
- Poisoning de treinamento: faz o modelo aprender associação errada se treinar nos dados.
- Tarpit com lixo textual: tenta contaminar scraping com conteúdo inútil.
- Resposta errada para scraper: entrega imagem/conteúdo diferente para bot detectado.
Essas técnicas são defensivas quando aplicadas ao seu próprio conteúdo e ao seu próprio site. Mas não devem ser tratadas como magia. Muitas podem ser contornadas por pré-processamento, upscaling, compressão, screenshots, recorte, OCR ou scraping humano-assistido.
17. Glaze
Categoria: cloaking contra imitação de estilo artístico
Custo: grátis
Self-hosted/local: app local / projeto acadêmico
Links:
- https://glaze.cs.uchicago.edu/
- https://sandlab.cs.uchicago.edu/glaze/index.html
- https://arxiv.org/abs/2302.04222
O que faz
Aplica perturbações quase imperceptíveis em imagens para dificultar que modelos de imagem aprendam e imitem o estilo do artista.
Vantagens
- Gratuito.
- Focado em artistas.
- Pesquisa séria da University of Chicago.
- Boa opção antes de publicar arte original online.
Desvantagens
- Não protege texto.
- Não impede download da imagem.
- Pode degradar a imagem dependendo da configuração.
- Pesquisas posteriores apontam que defesas adversariais podem ser contornadas por técnicas simples em alguns cenários.
Melhor uso
Portfólio artístico, ilustrações, imagens autorais, wallpapers, capas e artes que você não quer que virem dataset cru.
18. Nightshade
Categoria: data poisoning para modelos text-to-image
Custo: grátis
Self-hosted/local: app local / projeto acadêmico
Links:
O que faz
Nightshade tenta inserir alterações em imagens para que, se forem usadas no treinamento, prejudiquem associações aprendidas pelo modelo. É mais agressivo que Glaze: Glaze tenta proteger estilo; Nightshade tenta envenenar o aprendizado.
Vantagens
- Defesa ativa para artistas.
- Pode ser combinado conceitualmente com Glaze.
- Pesquisa técnica relevante.
Desvantagens
- Só afeta modelos futuros treinados com aquelas imagens.
- Não muda modelos já treinados.
- Eficácia no mundo real depende de volume, pipeline de treinamento e pré-processamento.
- Pode gerar debate ético/legal dependendo do uso.
Melhor uso
Imagens autorais antes de publicar em portfólio aberto. Não use esperando “derrubar IA”; use como camada defensiva.
19. WebGlaze / ETCH
Categoria: versão web/browser de proteção estilo Glaze
Custo: anunciado como gratuito para artistas
Self-hosted: não necessariamente
Links:
O que faz
Permite aplicar proteção em imagens direto pelo navegador, sem depender de máquina local forte.
Vantagens
- Mais acessível.
- Útil para artistas sem GPU boa.
- Complementa Glaze/Nightshade.
Desvantagens
- Dependência de serviço externo.
- Pode ter fila/limites.
- Não resolve scraping textual.
Melhor uso
Publicação ocasional de imagens autorais quando você não quer instalar ferramenta local.
20. Kudurru / Spawning
Categoria: detecção, bloqueio e poisoning de scraping de imagens
Custo: descrito como ferramenta gratuita/beta para artistas em reportagens; disponibilidade prática deve ser conferida no momento de uso
Self-hosted: parcialmente/integrado via plugin/ecossistema
Referências:
- https://www.wired.com/story/kudurru-ai-scraping-block-poisoning-spawning/
- https://cacm.acm.org/news/poisoning-data-to-protect-it/
O que faz
A proposta do Kudurru é identificar scraping de imagens em rede e permitir bloquear ou responder ao scraper com imagem diferente da solicitada.
Vantagens
- Ideia forte para artistas.
- Defesa coletiva: quanto mais sites participam, melhor a lista.
- Pode bloquear ou “poisonar” a coleta.
Desvantagens
- Não é solução permanente.
- Escopo pode ser limitado por plataforma/plugin.
- Scrapers podem mudar IP e método.
- Depende de detecção correta.
Melhor uso
Sites de artistas/fotógrafos/portfólios, especialmente WordPress, quando disponível e funcionando.
Medidas complementares simples e gratuitas
21. Bloqueio por User-Agent no Nginx
Categoria: regra simples de servidor
Custo: grátis
Self-hosted: sim
O que faz
Bloqueia user-agents conhecidos de crawlers de IA.
Vantagens
- Fácil.
- Sem dependência externa.
- Bom contra bot honesto que se identifica.
Desvantagens
- User-Agent é fácil de falsificar.
- Pode virar lista infinita.
- Não detecta scraping disfarçado.
Melhor uso
Camada básica junto com robots.txt e logs.
22. Rotas-isca / canary tokens
Categoria: detecção/honeypot
Custo: grátis
Self-hosted: sim
O que faz
Você cria links invisíveis para humanos ou páginas com tokens únicos. Se um bot acessa ou se o token aparece depois em resposta de modelo, você tem evidência de scraping/treinamento.
Vantagens
- Ajuda a identificar abuso.
- Não precisa bloquear tudo.
- Bom para pesquisa e auditoria.
Desvantagens
- Não impede scraping diretamente.
- Exige análise de logs.
- Pode gerar falso positivo se mal feito.
Melhor uso
Sites com conteúdo próprio, documentação, artigos, páginas institucionais. Especialmente útil para saber quem ignora regras.
23. Feeds e páginas com cache estático
Categoria: redução de dano
Custo: grátis
Self-hosted: sim
O que faz
Transforma páginas caras em HTML/JSON/RSS estático cacheado, reduzindo o estrago de crawler agressivo.
Vantagens
- Às vezes melhor que bloquear.
- Reduz carga brutalmente.
- Não prejudica usuários legítimos.
- Ajuda SEO e RSS.
Desvantagens
- Não impede coleta.
- Precisa arquitetura/cache.
Melhor uso
Blogs, feeds RSS, arquivos, páginas de curso, listagens, documentação e small web.
Ranking prático por cenário
Para site pequeno/indieweb/blog
- Cloudflare Free com bloqueio de AI bots ativado.
- robots.txt/ai.txt com lista atualizada.
- Cache agressivo de páginas públicas.
- Anubis apenas em rotas caras/suspeitas.
- Rate limit no servidor.
- Tarpit isolado só para bot claramente ruim.
Para instância fediverso / GoToSocial / Mastodon pequeno
- Cloudflare ou proxy com rate limit.
- Não bloquear ActivityPub legítimo sem pensar.
- Anubis com allowlist muito cuidadosa.
- Bloqueio de crawlers de IA por user-agent/IP quando confiável.
- Logs e análise antes de regras agressivas.
Aqui é fácil fazer besteira: se você bloquear demais, quebra federação, previews, feeds e descoberta.
Para documentação técnica
- Cache estático.
- Cloudflare AI Crawl Control.
- robots.txt/ai.txt.
- Anubis em busca e endpoints caros.
- Canary tokens para detectar scraping.
Para portfólio de imagens/arte
- Glaze antes de publicar.
- Nightshade quando fizer sentido.
- Watermark discreta.
- Imagens em resolução controlada.
- Cloudflare/bloqueio de hotlink e scraping.
- Kudurru/WebGlaze se disponível.
Para servidor com vários domínios seus
- CrowdSec no host.
- Nginx/OpenResty bouncer ou Cloudflare bouncer.
- Rate limit por domínio/rota.
- Anubis em apps mais atacados.
- robots.txt centralizado/gerado.
- Logs com GoAccess/Grafana/Loki.
Stack gratuita sugerida
Stack conservadora, boa e sem maluquice
- Cloudflare Free
- robots.txt/ai.txt gerado por ai.robots.txt ou Known Agents
- Nginx/Caddy rate limit
- Cache estático
- Turnstile em formulários
- CrowdSec no servidor
Essa é a stack que eu usaria como base. Ela resolve 80% sem transformar seu site num laboratório radioativo.
Stack mais agressiva
- Cloudflare Free com AI bots bloqueados
- Anubis em rotas sensíveis
- go-away para regras customizadas
- Nepenthes/Iocaine em rota-isca
- Canary tokens
- Logs centralizados
Essa stack é boa se você realmente está sendo raspado com força ou quer proteger projetos small web mais ideológicos.
Stack para artistas/imagens
- Glaze
- Nightshade
- WebGlaze/ETCH quando não tiver GPU
- Kudurru/Spawning se estiver disponível para seu CMS
- Bloqueio de hotlink
- Cloudflare AI blocking
- Imagens em resolução menor para preview público
O que eu não faria
- Não colocaria Anubis no site inteiro sem allowlist.
- Não confiaria só em robots.txt.
- Não usaria tarpit em domínio principal sem isolamento.
- Não bloquearia Googlebot/Bingbot sem pensar no impacto de SEO.
- Não quebraria RSS, ActivityPub, preview de links e sitemap em nome de “anti-IA”.
- Não usaria poisoning achando que isso resolve modelos já treinados.
- Não criaria um labirinto infinito que consome mais recurso seu do que do crawler.
Arquitetura recomendada para seus projetos
Para seus servidores/domínios, eu montaria assim:
Internet
↓
Cloudflare Free
- AI Scrapers and Crawlers: ON
- WAF básico
- cache para estáticos
- regras por país/IP se necessário
↓
Nginx/Caddy/Traefik na VPS
- rate limit
- bloqueio de user-agents ruins
- logs separados por domínio
- allowlist para bots bons
↓
Anubis/go-away em rotas específicas
- /search
- /archive
- /api pesada
- /admin se fizer sentido
↓
Aplicação real
Para rotas suspeitas:
Bot suspeito claro
↓
Tarpit isolado: Nepenthes ou Iocaine
Para imagens autorais:
Imagem original
↓
Glaze/Nightshade
↓
versão otimizada para web
↓
publicação com cache + proteção anti-hotlink + AI crawler block
Veredito
Anubis é bom, sim. Mas ele é uma peça, não a estratégia inteira.
A melhor proteção gratuita hoje é uma combinação de Cloudflare Free + robots.txt/ai.txt atualizado + rate limit + cache + Anubis seletivo + CrowdSec. Para conteúdo visual autoral, acrescente Glaze/Nightshade/WebGlaze. Para defesa agressiva contra crawler ruim, experimente Nepenthes ou Iocaine, mas isolados e com cuidado.
A abordagem mais inteligente não é “bloquear tudo”. É separar:
- bot bom;
- usuário humano;
- crawler honesto;
- crawler abusivo;
- tráfego caro;
- tráfego barato;
- conteúdo que você quer indexar;
- conteúdo que você quer proteger.
Quem não separa isso acaba fazendo firewall emocional: parece forte, mas quebra o próprio site.
Fontes principais
- Anubis GitHub: https://github.com/TecharoHQ/anubis
- Anubis fork/README histórico: https://github.com/RayfromUSTC/anubis
- pow-bot-deterrent: https://github.com/sequentialread/pow-bot-deterrent
- go-away: https://github.com/WeebDataHoarder/go-away
- Caddy Bot Barrier: https://github.com/steffenbusch/caddy-bot-barrier
- OpenCloudflareCDN: https://github.com/Sn0wo2/OpenCloudflareCDN
- ai.robots.txt: https://github.com/ai-robots-txt/ai.robots.txt
- Known Agents / Dark Visitors: https://knownagents.com/
- Dark Visitors WordPress plugin: https://wordpress.org/plugins/dark-visitors/
- CrowdSec Nginx bouncer docs: https://docs.crowdsec.net/u/bouncers/nginx/
- CrowdSec Nginx bouncer GitHub: https://github.com/crowdsecurity/cs-nginx-bouncer
- OWASP CRS docs: https://coreruleset.org/docs/
- OWASP CRS GitHub: https://github.com/coreruleset/coreruleset
- Cloudflare AI Crawl Control: https://developers.cloudflare.com/ai-crawl-control/
- Cloudflare Turnstile: https://developers.cloudflare.com/turnstile/
- Cloudflare one-click AI crawler blocking announcement: https://blog.cloudflare.com/declaring-your-aindependence-block-ai-bots-scrapers-and-crawlers-with-a-single-click/
- Nepenthes Python: https://github.com/NEPENTHESWEB/nepenthes-py
- Nepenthes page: https://zadzmo.org/code/nepenthes/
- Iocaine GitHub mirror: https://github.com/readycool/iocaine
- Iocaine upstream: https://git.madhouse-project.org/iocaine/iocaine/src/branch/iocaine-3.x
- spidertrap-rs: https://github.com/acuciureanu/spidertrap-rs
- spider_trap: https://github.com/ultros/spider_trap
- Glaze official: https://glaze.cs.uchicago.edu/
- Glaze SAND Lab: https://sandlab.cs.uchicago.edu/glaze/index.html
- Glaze paper: https://arxiv.org/abs/2302.04222
- Nightshade official: https://nightshade.cs.uchicago.edu/whatis.html
- Nightshade paper: https://arxiv.org/abs/2310.13828
- Glaze Project about: https://glaze.cs.uchicago.edu/aboutus.html
- ETCH/WebGlaze: https://www.etch-humanity.org/for-artists
- Kudurru / Spawning coverage: https://www.wired.com/story/kudurru-ai-scraping-block-poisoning-spawning/
- CACM on poisoning data: https://cacm.acm.org/news/poisoning-data-to-protect-it/
- Critique of adversarial perturbations: https://arxiv.org/abs/2406.12027
- Study: scrapers selectively respect robots.txt: https://arxiv.org/abs/2505.21733
- Study: identifying AI scrapers with canary tokens: https://arxiv.org/abs/2605.13706
- Study: LLM web agents and fingerprinting: https://arxiv.org/abs/2606.30119
Did this resonate?
Related documents
- 001
- 002
- 003
- 004
- 005