Murad Library
Murad LibraryREF-0402MD

Soluções anti-scraping/anti-crawler de IA estilo Anubis + AI poisoning

Catalogued
Reading
21 min read

Pesquisa atualizada em 2026-07-09.

Resumo brutalmente honesto

Anubis é uma boa solução, especialmente para small web, indieweb, sites pessoais, instâncias federadas, documentação pública e serviços que sofrem com crawler agressivo. Mas não existe bala de prata. Quem promete “bloquear IA de vez” está vendendo fantasia.

A proteção real precisa ser em camadas:

  1. robots.txt / ai.txt para bots que respeitam regras.
  2. bloqueio por CDN/WAF para bots conhecidos e tráfego óbvio.
  3. challenge / proof-of-work para aumentar custo de scraping.
  4. rate limit e fingerprinting para pegar comportamento suspeito.
  5. tarpits / labyrinths para desperdiçar tempo de crawlers ruins.
  6. poisoning/cloaking para imagens e conteúdo criativo, com muita cautela.

Minha recomendação técnica, sem enrolação: para seus projetos pequenos/médios, use Cloudflare Free + robots.txt atualizado + Anubis em rotas sensíveis + rate limit no Nginx/Caddy + logs. Use tarpit/poisoning só onde você realmente quer briga com crawler, porque pode ferrar indexação, performance e diagnóstico.


O que é o Anubis

Anubis é um “Web AI Firewall Utility” open-source que coloca desafios na frente de requisições HTTP para impedir ou encarecer scraping automatizado. O mecanismo mais conhecido é o proof-of-work, ou seja, o visitante precisa resolver um pequeno desafio computacional antes de acessar o backend.

  • Projeto: https://github.com/TecharoHQ/anubis
  • Licença: MIT
  • Linguagem: Go
  • Modelo: reverse proxy / camada intermediária
  • Foco: proteger sites pequenos contra crawlers agressivos, especialmente crawlers de IA
  • Ponto forte: simples, gratuito, self-hosted
  • Ponto fraco: pode atrapalhar usuários reais, indexadores legítimos e acessibilidade se mal configurado

O próprio projeto diz que muita gente talvez consiga resolver com Cloudflare, mas que Anubis existe para quem não quer ou não pode depender de Cloudflare.

Quando Anubis faz sentido

Use Anubis quando:

  • seu site recebe crawler pesado;
  • você quer self-hosted;
  • você não quer depender só de Cloudflare;
  • você hospeda small web/indieweb/fediverso/docs;
  • você quer proteger endpoints caros, como busca, feeds dinâmicos, páginas de arquivo, APIs públicas e páginas muito linkadas.

Quando Anubis pode ser má ideia

Evite jogar Anubis no site inteiro se:

  • SEO é crítico;
  • você depende de previews de redes sociais;
  • precisa ser extremamente acessível sem JS;
  • tem muitos usuários com browser velho;
  • o site é basicamente conteúdo público que você quer indexar.

O erro comum é transformar o site todo em fortaleza e depois reclamar que Google, leitores RSS, Mastodon previews, bots bons e ferramentas de arquivamento pararam de funcionar.


Lista de soluções

1. Anubis

Categoria: proof-of-work / challenge / anti-crawler
Custo: grátis
Self-hosted: sim
Maturidade: alta para o nicho small web
Link: https://github.com/TecharoHQ/anubis

O que faz

Coloca uma barreira antes do backend. O navegador legítimo resolve um desafio; crawlers em massa pagam custo computacional repetidamente.

Vantagens

  • Open-source.
  • Sem depender de empresa externa.
  • Bom para VPS própria.
  • Combina bem com Nginx, Caddy, Traefik e apps pequenos.
  • O custo imposto ao crawler escala contra scraping massivo.

Desvantagens

  • Pode quebrar indexação.
  • Pode afetar bots legítimos.
  • Não para scraping feito por browsers reais distribuídos.
  • Não substitui WAF, rate limit ou monitoramento.

Melhor uso

Coloque em rotas caras:

  • /search
  • /archive
  • /tag/*
  • /api/* pública
  • páginas de listagem profunda
  • endpoints que geram carga no banco

Não colocaria cegamente em /, /feed.xml, /robots.txt, /sitemap.xml, assets estáticos e páginas que você quer que sejam descobertas.


2. Cloudflare AI Crawl Control / AI Scrapers and Crawlers

Categoria: CDN/WAF gerenciado / bloqueio de bots de IA
Custo: tem recursos gratuitos; recursos avançados podem variar por plano
Self-hosted: não
Link: https://developers.cloudflare.com/ai-crawl-control/

O que faz

A Cloudflare oferece controles para identificar, analisar e bloquear crawlers de IA. Também tem opção de bloquear AI Scrapers and Crawlers no painel, inclusive para contas gratuitas segundo anúncios da própria Cloudflare.

Vantagens

  • Muito fácil de ativar.
  • Boa base de inteligência de tráfego.
  • Funciona antes de chegar na sua VPS.
  • Ajuda contra bots que ignoram robots.txt.
  • Excelente primeira camada para sites pequenos.

Desvantagens

  • Dependência da Cloudflare.
  • Menos controle fino que solução própria.
  • Pode bloquear coisas demais se você ligar tudo sem analisar.
  • Centraliza seu tráfego numa empresa externa.

Melhor uso

Primeira camada para praticamente qualquer domínio público seu. Para projetos seus, eu usaria como base e não como solução única.


3. Cloudflare Turnstile

Categoria: desafio humano/bot invisível ou quase invisível
Custo: gratuito em muitos usos
Self-hosted: não
Link: https://developers.cloudflare.com/turnstile/

O que faz

É uma alternativa ao CAPTCHA. O widget gera um token no navegador e seu servidor valida com a Cloudflare. É mais útil para formulários, login, comentários, cadastro e ações sensíveis do que para proteger páginas estáticas.

Vantagens

  • Melhor experiência que CAPTCHA tradicional.
  • Bom contra spam de formulário.
  • Pode ser usado sem passar todo o site pela Cloudflare.
  • Fácil de integrar em sistemas próprios.

Desvantagens

  • Não é proteção geral contra crawler lendo páginas públicas.
  • Depende de Cloudflare.
  • Precisa integração no backend.

Melhor uso

Use em:

  • login;
  • formulário de contato;
  • comentários;
  • cadastro;
  • reset de senha;
  • endpoints de POST.

Não é substituto do Anubis.


4. go-away

Categoria: reverse proxy anti-abuso / challenge seletivo
Custo: grátis
Self-hosted: sim
Link: https://github.com/WeebDataHoarder/go-away

O que faz

Fica entre a internet e seu site. Permite selecionar requisições por regras e aplicar ações ou desafios. A filosofia é menos nuclear que simplesmente bloquear tudo.

Vantagens

  • Flexível.
  • Bom para aplicar desafios só em rotas suspeitas.
  • Mais cirúrgico que um bloqueio bruto.
  • Boa alternativa ao Anubis se você quer regras mais customizadas.

Desvantagens

  • Menos famoso que Anubis.
  • Exige mais atenção em configuração.
  • Pode virar uma gambiarra complexa se você inventar regra demais.

Melhor uso

Quando você quer uma camada anti-abuso mais customizada, com regras por caminho, user-agent, IP, headers e comportamento.


5. pow-bot-deterrent

Categoria: proof-of-work anti-bot
Custo: grátis
Self-hosted: sim
Link: https://github.com/sequentialread/pow-bot-deterrent

O que faz

Implementa um fluxo de proof-of-work: o app gera desafios, o cliente resolve via JavaScript e o servidor valida.

Vantagens

  • Ideia simples e transparente.
  • Bom para integrar em app próprio.
  • Útil se você quer entender e controlar o mecanismo.

Desvantagens

  • Menos pronto “plug and play”.
  • Você provavelmente precisará integrar no app ou proxy.
  • Menos ecossistema que Anubis.

Melhor uso

Projetos próprios onde você quer embutir proof-of-work diretamente, não só jogar um proxy pronto na frente.


6. Caddy Bot Barrier Plugin

Categoria: challenge computacional para Caddy
Custo: grátis
Self-hosted: sim
Link: https://github.com/steffenbusch/caddy-bot-barrier

O que faz

Plugin do Caddy que exige um desafio computacional baseado no navegador antes de liberar acesso a recursos HTTP.

Vantagens

  • Excelente se você usa Caddy.
  • Integra direto na camada do servidor web.
  • Evita colocar mais um serviço separado.

Desvantagens

  • Específico para Caddy.
  • Menor comunidade que Anubis.
  • Você precisa compilar/usar Caddy com plugin.

Melhor uso

Sites servidos por Caddy onde você quer uma proteção estilo Anubis sem adicionar outro reverse proxy.


7. OpenCloudflareCDN

Categoria: reverse proxy com JavaScript challenge
Custo: grátis
Self-hosted: sim
Link: https://github.com/Sn0wo2/OpenCloudflareCDN

O que faz

Reverse proxy inspirado na Cloudflare com JavaScript Challenge para bloquear bots, crawlers e ataques de camada HTTP.

Vantagens

  • Ideia interessante.
  • Self-hosted.
  • Pode servir como laboratório para entender challenge/proxy.

Desvantagens

  • Projeto menor.
  • Menos testado em produção real.
  • Eu não colocaria em serviço importante sem testar bastante.

Melhor uso

Laboratório, projeto pequeno, ambiente controlado. Não seria minha primeira escolha em produção séria.


8. ai.robots.txt

Categoria: lista de user-agents de IA para robots.txt / ai.txt
Custo: grátis
Self-hosted: sim
Link: https://github.com/ai-robots-txt/ai.robots.txt

O que faz

Mantém uma lista de crawlers/agentes de IA para bloquear via robots.txt e ai.txt.

Vantagens

  • Simples.
  • Gratuito.
  • Fácil de automatizar.
  • Bom como primeira declaração de política.

Desvantagens

  • Só funciona com crawler que obedece.
  • Não bloqueia IP.
  • Não impede scraping disfarçado.

Melhor uso

Use sempre, mas não se iluda. É camada declarativa, não barreira real.

Exemplo conceitual:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

O ideal é gerar isso a partir de uma lista atualizada, não manter na mão para sempre.


9. Known Agents / Dark Visitors

Categoria: monitoramento/lista de crawlers/robots.txt
Custo: há opções gratuitas e pagas dependendo do uso
Self-hosted: parcialmente; plugins e integrações variam
Links:

O que faz

Ajuda a rastrear agentes, crawlers, scrapers e bots de IA, além de gerar robots.txt atualizado. Há plugin para WordPress e integrações para CMS como Kirby.

Vantagens

  • Poupa trabalho de manter lista de bots.
  • Bom para WordPress.
  • Ajuda a enxergar quem está acessando.

Desvantagens

  • Ainda depende muito de robots.txt.
  • Não substitui WAF/challenge.
  • Algumas funções podem depender de serviço externo.

Melhor uso

Sites de conteúdo, blogs e WordPress onde você quer uma gestão simples de crawlers sem ficar caçando user-agent novo toda semana.


10. CrowdSec + Nginx/OpenResty bouncer

Categoria: IPS comunitário / reputação / bloqueio por comportamento
Custo: grátis/open-source, com serviços pagos opcionais
Self-hosted: sim
Links:

O que faz

CrowdSec analisa logs e comportamento, toma decisões de bloqueio, e o bouncer aplica essas decisões no Nginx/OpenResty. É mais segurança geral do que anti-IA puro.

Vantagens

  • Excelente para servidores seus.
  • Ajuda contra abuso real: brute force, scan, bots ruins, ataques comuns.
  • Integra com Nginx.
  • Boa camada para VPS.

Desvantagens

  • Não é especializado em “AI crawler”.
  • Precisa alimentar com logs corretos.
  • Requer manutenção.

Melhor uso

Base de proteção para servidores que hospedam vários serviços. Eu colocaria em VPS com muitos domínios.


11. OWASP ModSecurity CRS / Coraza CRS

Categoria: WAF open-source
Custo: grátis
Self-hosted: sim
Links:

O que faz

Conjunto de regras para WAFs compatíveis com ModSecurity/Coraza. Protege contra ataques comuns como SQL injection, XSS, LFI/RFI e outras classes do OWASP Top 10.

Vantagens

  • Maduro.
  • Open-source.
  • Bom para segurança geral.
  • Protege apps de ataques reais, não só crawler.

Desvantagens

  • Pode gerar falso positivo.
  • Não é feito especificamente para bloquear crawler de IA.
  • Requer tuning.

Melhor uso

Aplicações web públicas com login, painel, formulários e endpoints sensíveis. Combine com Anubis/CrowdSec, não substitua.


12. Rate limit no Nginx/Caddy/Traefik

Categoria: controle de taxa
Custo: grátis
Self-hosted: sim

O que faz

Limita quantas requisições um IP/cliente pode fazer por janela de tempo.

Vantagens

  • Simples.
  • Extremamente eficaz contra crawler burro.
  • Não depende de JS.
  • Reduz carga no backend.

Desvantagens

  • IP compartilhado pode gerar falso positivo.
  • Crawler distribuído contorna.
  • Não identifica intenção.

Melhor uso

Sempre use em endpoints caros:

  • busca;
  • login;
  • API;
  • feeds dinâmicos;
  • páginas de arquivo;
  • endpoints de exportação;
  • páginas com query pesada.

Tarpits, labyrinths e armadilhas

Aqui começa a parte mais agressiva. Tarpit não é só “bloquear”: é prender crawler em um labirinto de páginas inúteis. Isso pode ser útil, mas também pode ser uma péssima ideia se você não souber separar bot ruim de bot bom.

13. Nepenthes

Categoria: tarpit anti-AI crawler / fake pages / Markov babble
Custo: grátis
Self-hosted: sim
Links:

O que faz

Gera um labirinto infinito de páginas falsas com links para mais páginas falsas. A ideia é prender crawlers que ignoram regras e fazê-los consumir lixo.

Vantagens

  • Conceito poderoso contra crawler agressivo.
  • Pode desperdiçar recurso do scraper.
  • Pode poluir coleta de dados ruim.

Desvantagens

  • Pode atingir bot legítimo se mal roteado.
  • Pode consumir recursos seus também.
  • Pode criar caos nos logs.
  • Pode prejudicar indexação se exposto de forma errada.
  • Pode ser visto como medida hostil.

Melhor uso

Não coloque link visível para usuário. Use como destino para bots suspeitos detectados pelo proxy, por robots trap, por user-agent ruim ou por rotas-isca.


14. Iocaine

Categoria: tarpit / garbage generator / engine de regras para crawlers
Custo: grátis
Self-hosted: sim
Links:

O que faz

Começou como gerador de lixo/tarpit para onde o reverse proxy mandava visitantes indesejados. Evoluiu para uma ferramenta mais ambiciosa, com engine de scripts para decidir como tratar cada request.

Vantagens

  • Muito alinhado com small web e defesa contra crawlers ruins.
  • Mais flexível que um tarpit simples.
  • Pode servir conteúdo real para visitantes bons e labirinto para crawlers.

Desvantagens

  • Mais complexo que Nepenthes.
  • Instalação/operação pode ser mais trabalhosa.
  • Projeto mais nichado.

Melhor uso

Para quem quer brincar pesado: reverse proxy identifica tráfego ruim e manda para Iocaine. Para sites de produção simples, talvez seja exagero.


15. spidertrap-rs / spider_trap

Categoria: crawler trap simples
Custo: grátis
Self-hosted: sim
Links:

O que faz

Servidores simples que geram páginas com links infinitos ou quase infinitos para prender crawlers.

Vantagens

  • Simples.
  • Bom laboratório.
  • Fácil de entender.

Desvantagens

  • Não tem inteligência anti-bot sofisticada.
  • Pode ser tosco em produção.
  • Precisa ser muito bem isolado.

Melhor uso

Experimento, honeypot leve, aprendizado, armadilha isolada.


16. Cloudflare AI Labyrinth

Categoria: tarpit/honeypot gerenciado para bots de IA
Custo: anunciado como gratuito/opt-in na Cloudflare
Self-hosted: não
Referência: Cloudflare anunciou ferramenta que redireciona bots suspeitos para páginas isca geradas por IA.

O que faz

Em vez de só bloquear bots, a Cloudflare pode encaminhá-los para um labirinto de conteúdo falso, desperdiçando tempo e ajudando a detectar/fingerprintfar tráfego malicioso.

Vantagens

  • Fácil se você já usa Cloudflare.
  • Não roda na sua VPS.
  • Usa inteligência da Cloudflare.

Desvantagens

  • Caixa preta.
  • Dependência total da Cloudflare.
  • Pode não estar disponível/igual em todos os planos/regiões.

Melhor uso

Domínios já protegidos pela Cloudflare onde você quer uma resposta mais agressiva que simples bloqueio.


AI poisoning / cloaking / proteção de conteúdo criativo

Agora a parte que precisa de cuidado. “Poisoning” pode significar coisas diferentes:

  1. Cloaking de imagem: altera a imagem para atrapalhar imitação de estilo.
  2. Poisoning de treinamento: faz o modelo aprender associação errada se treinar nos dados.
  3. Tarpit com lixo textual: tenta contaminar scraping com conteúdo inútil.
  4. Resposta errada para scraper: entrega imagem/conteúdo diferente para bot detectado.

Essas técnicas são defensivas quando aplicadas ao seu próprio conteúdo e ao seu próprio site. Mas não devem ser tratadas como magia. Muitas podem ser contornadas por pré-processamento, upscaling, compressão, screenshots, recorte, OCR ou scraping humano-assistido.

17. Glaze

Categoria: cloaking contra imitação de estilo artístico
Custo: grátis
Self-hosted/local: app local / projeto acadêmico
Links:

O que faz

Aplica perturbações quase imperceptíveis em imagens para dificultar que modelos de imagem aprendam e imitem o estilo do artista.

Vantagens

  • Gratuito.
  • Focado em artistas.
  • Pesquisa séria da University of Chicago.
  • Boa opção antes de publicar arte original online.

Desvantagens

  • Não protege texto.
  • Não impede download da imagem.
  • Pode degradar a imagem dependendo da configuração.
  • Pesquisas posteriores apontam que defesas adversariais podem ser contornadas por técnicas simples em alguns cenários.

Melhor uso

Portfólio artístico, ilustrações, imagens autorais, wallpapers, capas e artes que você não quer que virem dataset cru.


18. Nightshade

Categoria: data poisoning para modelos text-to-image
Custo: grátis
Self-hosted/local: app local / projeto acadêmico
Links:

O que faz

Nightshade tenta inserir alterações em imagens para que, se forem usadas no treinamento, prejudiquem associações aprendidas pelo modelo. É mais agressivo que Glaze: Glaze tenta proteger estilo; Nightshade tenta envenenar o aprendizado.

Vantagens

  • Defesa ativa para artistas.
  • Pode ser combinado conceitualmente com Glaze.
  • Pesquisa técnica relevante.

Desvantagens

  • Só afeta modelos futuros treinados com aquelas imagens.
  • Não muda modelos já treinados.
  • Eficácia no mundo real depende de volume, pipeline de treinamento e pré-processamento.
  • Pode gerar debate ético/legal dependendo do uso.

Melhor uso

Imagens autorais antes de publicar em portfólio aberto. Não use esperando “derrubar IA”; use como camada defensiva.


19. WebGlaze / ETCH

Categoria: versão web/browser de proteção estilo Glaze
Custo: anunciado como gratuito para artistas
Self-hosted: não necessariamente
Links:

O que faz

Permite aplicar proteção em imagens direto pelo navegador, sem depender de máquina local forte.

Vantagens

  • Mais acessível.
  • Útil para artistas sem GPU boa.
  • Complementa Glaze/Nightshade.

Desvantagens

  • Dependência de serviço externo.
  • Pode ter fila/limites.
  • Não resolve scraping textual.

Melhor uso

Publicação ocasional de imagens autorais quando você não quer instalar ferramenta local.


20. Kudurru / Spawning

Categoria: detecção, bloqueio e poisoning de scraping de imagens
Custo: descrito como ferramenta gratuita/beta para artistas em reportagens; disponibilidade prática deve ser conferida no momento de uso
Self-hosted: parcialmente/integrado via plugin/ecossistema
Referências:

O que faz

A proposta do Kudurru é identificar scraping de imagens em rede e permitir bloquear ou responder ao scraper com imagem diferente da solicitada.

Vantagens

  • Ideia forte para artistas.
  • Defesa coletiva: quanto mais sites participam, melhor a lista.
  • Pode bloquear ou “poisonar” a coleta.

Desvantagens

  • Não é solução permanente.
  • Escopo pode ser limitado por plataforma/plugin.
  • Scrapers podem mudar IP e método.
  • Depende de detecção correta.

Melhor uso

Sites de artistas/fotógrafos/portfólios, especialmente WordPress, quando disponível e funcionando.


Medidas complementares simples e gratuitas

21. Bloqueio por User-Agent no Nginx

Categoria: regra simples de servidor
Custo: grátis
Self-hosted: sim

O que faz

Bloqueia user-agents conhecidos de crawlers de IA.

Vantagens

  • Fácil.
  • Sem dependência externa.
  • Bom contra bot honesto que se identifica.

Desvantagens

  • User-Agent é fácil de falsificar.
  • Pode virar lista infinita.
  • Não detecta scraping disfarçado.

Melhor uso

Camada básica junto com robots.txt e logs.


22. Rotas-isca / canary tokens

Categoria: detecção/honeypot
Custo: grátis
Self-hosted: sim

O que faz

Você cria links invisíveis para humanos ou páginas com tokens únicos. Se um bot acessa ou se o token aparece depois em resposta de modelo, você tem evidência de scraping/treinamento.

Vantagens

  • Ajuda a identificar abuso.
  • Não precisa bloquear tudo.
  • Bom para pesquisa e auditoria.

Desvantagens

  • Não impede scraping diretamente.
  • Exige análise de logs.
  • Pode gerar falso positivo se mal feito.

Melhor uso

Sites com conteúdo próprio, documentação, artigos, páginas institucionais. Especialmente útil para saber quem ignora regras.


23. Feeds e páginas com cache estático

Categoria: redução de dano
Custo: grátis
Self-hosted: sim

O que faz

Transforma páginas caras em HTML/JSON/RSS estático cacheado, reduzindo o estrago de crawler agressivo.

Vantagens

  • Às vezes melhor que bloquear.
  • Reduz carga brutalmente.
  • Não prejudica usuários legítimos.
  • Ajuda SEO e RSS.

Desvantagens

  • Não impede coleta.
  • Precisa arquitetura/cache.

Melhor uso

Blogs, feeds RSS, arquivos, páginas de curso, listagens, documentação e small web.


Ranking prático por cenário

Para site pequeno/indieweb/blog

  1. Cloudflare Free com bloqueio de AI bots ativado.
  2. robots.txt/ai.txt com lista atualizada.
  3. Cache agressivo de páginas públicas.
  4. Anubis apenas em rotas caras/suspeitas.
  5. Rate limit no servidor.
  6. Tarpit isolado só para bot claramente ruim.

Para instância fediverso / GoToSocial / Mastodon pequeno

  1. Cloudflare ou proxy com rate limit.
  2. Não bloquear ActivityPub legítimo sem pensar.
  3. Anubis com allowlist muito cuidadosa.
  4. Bloqueio de crawlers de IA por user-agent/IP quando confiável.
  5. Logs e análise antes de regras agressivas.

Aqui é fácil fazer besteira: se você bloquear demais, quebra federação, previews, feeds e descoberta.

Para documentação técnica

  1. Cache estático.
  2. Cloudflare AI Crawl Control.
  3. robots.txt/ai.txt.
  4. Anubis em busca e endpoints caros.
  5. Canary tokens para detectar scraping.

Para portfólio de imagens/arte

  1. Glaze antes de publicar.
  2. Nightshade quando fizer sentido.
  3. Watermark discreta.
  4. Imagens em resolução controlada.
  5. Cloudflare/bloqueio de hotlink e scraping.
  6. Kudurru/WebGlaze se disponível.

Para servidor com vários domínios seus

  1. CrowdSec no host.
  2. Nginx/OpenResty bouncer ou Cloudflare bouncer.
  3. Rate limit por domínio/rota.
  4. Anubis em apps mais atacados.
  5. robots.txt centralizado/gerado.
  6. Logs com GoAccess/Grafana/Loki.

Stack gratuita sugerida

Stack conservadora, boa e sem maluquice

  • Cloudflare Free
  • robots.txt/ai.txt gerado por ai.robots.txt ou Known Agents
  • Nginx/Caddy rate limit
  • Cache estático
  • Turnstile em formulários
  • CrowdSec no servidor

Essa é a stack que eu usaria como base. Ela resolve 80% sem transformar seu site num laboratório radioativo.

Stack mais agressiva

  • Cloudflare Free com AI bots bloqueados
  • Anubis em rotas sensíveis
  • go-away para regras customizadas
  • Nepenthes/Iocaine em rota-isca
  • Canary tokens
  • Logs centralizados

Essa stack é boa se você realmente está sendo raspado com força ou quer proteger projetos small web mais ideológicos.

Stack para artistas/imagens

  • Glaze
  • Nightshade
  • WebGlaze/ETCH quando não tiver GPU
  • Kudurru/Spawning se estiver disponível para seu CMS
  • Bloqueio de hotlink
  • Cloudflare AI blocking
  • Imagens em resolução menor para preview público

O que eu não faria

  • Não colocaria Anubis no site inteiro sem allowlist.
  • Não confiaria só em robots.txt.
  • Não usaria tarpit em domínio principal sem isolamento.
  • Não bloquearia Googlebot/Bingbot sem pensar no impacto de SEO.
  • Não quebraria RSS, ActivityPub, preview de links e sitemap em nome de “anti-IA”.
  • Não usaria poisoning achando que isso resolve modelos já treinados.
  • Não criaria um labirinto infinito que consome mais recurso seu do que do crawler.

Arquitetura recomendada para seus projetos

Para seus servidores/domínios, eu montaria assim:

Internet
  ↓
Cloudflare Free
  - AI Scrapers and Crawlers: ON
  - WAF básico
  - cache para estáticos
  - regras por país/IP se necessário
  ↓
Nginx/Caddy/Traefik na VPS
  - rate limit
  - bloqueio de user-agents ruins
  - logs separados por domínio
  - allowlist para bots bons
  ↓
Anubis/go-away em rotas específicas
  - /search
  - /archive
  - /api pesada
  - /admin se fizer sentido
  ↓
Aplicação real

Para rotas suspeitas:

Bot suspeito claro
  ↓
Tarpit isolado: Nepenthes ou Iocaine

Para imagens autorais:

Imagem original
  ↓
Glaze/Nightshade
  ↓
versão otimizada para web
  ↓
publicação com cache + proteção anti-hotlink + AI crawler block

Veredito

Anubis é bom, sim. Mas ele é uma peça, não a estratégia inteira.

A melhor proteção gratuita hoje é uma combinação de Cloudflare Free + robots.txt/ai.txt atualizado + rate limit + cache + Anubis seletivo + CrowdSec. Para conteúdo visual autoral, acrescente Glaze/Nightshade/WebGlaze. Para defesa agressiva contra crawler ruim, experimente Nepenthes ou Iocaine, mas isolados e com cuidado.

A abordagem mais inteligente não é “bloquear tudo”. É separar:

  • bot bom;
  • usuário humano;
  • crawler honesto;
  • crawler abusivo;
  • tráfego caro;
  • tráfego barato;
  • conteúdo que você quer indexar;
  • conteúdo que você quer proteger.

Quem não separa isso acaba fazendo firewall emocional: parece forte, mas quebra o próprio site.


Fontes principais

Did this resonate?

Related documents