Proxy para coleta de dados: limites, riscos e boas práticas

Equipe Proxy Brazil · Publicado em · Atualizado em · 7 min de leitura

Resumo

Como usar proxy na coleta de dados públicos de forma responsável: termos de uso, robots.txt, LGPD, respostas 429 e 503, ritmo de requisições e escolha do tipo de IP.

Coletar dados de sites de forma automatizada é rotina em monitoramento de preços, pesquisa de mercado, agregação de notícias e testes de sites. Junto com essa rotina vêm as dúvidas: quando faz sentido usar proxy, quanto se pode acessar um site e o que fazer quando ele responde com erro ou pede para desacelerar.

Este guia trata de coleta de dados públicos feita de forma responsável: o que o proxy acrescenta, quais são os limites técnicos e legais e como montar uma coleta que não sobrecarregue quem está do outro lado.

Resposta rápida

Um proxy muda o IP de onde saem as requisições. Isso é útil para ver o conteúdo como ele aparece no Brasil em rede móvel, para separar o tráfego da coleta da sua rede principal e para testar por região. O proxy não dá permissão para coletar nada. Antes de começar, verifique se há uma API oficial, leia os termos de uso e o robots.txt do site, colete só o que precisa, respeite os limites de requisição e pare ou desacelere quando o site responder com 429 ou 503.

O que o proxy faz, e o que não faz, numa coleta

O que ele faz:

  • Mostra o conteúdo como é servido para um IP brasileiro de rede móvel, útil para preços, anúncios e páginas que mudam por região.
  • Separa o tráfego da coleta do IP do seu escritório ou servidor.
  • Permite trocar de IP quando necessário pelo link de rotação, em vez de depender de um único endereço.

O que ele não faz:

  • Não autoriza a coleta. Termos de uso, direitos sobre o conteúdo e a legislação de dados continuam valendo.
  • Não serve para ultrapassar o limite de requisições que o site definiu. Se o site pede para desacelerar, a resposta correta é desacelerar.

Antes de coletar: permissões e regras

API oficial primeiro. Muitos serviços oferecem API com limites documentados e dados estruturados. É mais estável que ler HTML e deixa claro o que é permitido. Sobre o papel do IP em integrações com APIs, veja proxy e APIs: por que o IP é fator crítico.

Termos de uso. Leia o que o site diz sobre acesso automatizado. Se proíbe, o proxy não muda isso.

robots.txt. É o arquivo em que o site indica o que robôs podem acessar. O protocolo está padronizado na RFC 9309, que fica na raiz do site (por exemplo, exemplo.com.br/robots.txt) e define como identificar o grupo de regras do seu robô. A própria RFC lembra que essas regras não são uma forma de autorização de acesso: seguir o robots.txt é o mínimo de boa conduta, não uma licença para tudo o que não está bloqueado. A RFC também orienta não usar uma cópia em cache por mais de 24 horas, exceto quando o arquivo está inacessível.

Dados pessoais. Se a coleta envolve dados de pessoas, a LGPD se aplica. O artigo 7º da Lei 13.709 estabelece que o tratamento de dados pessoais de acesso público deve considerar a finalidade, a boa-fé e o interesse público que justificaram sua disponibilização. Dado público não é dado livre de regras. Na dúvida, consulte um advogado.

Como montar uma coleta responsável

Ritmo. Comece devagar e aumente só se o site responder bem. Não existe um intervalo universal seguro; depende do tamanho do site e do que ele informa. Evite paralelizar muitas conexões contra o mesmo domínio.

Respeite o 429 e o Retry-After. O código 429 Too Many Requests indica que o cliente enviou requisições demais em pouco tempo. A MDN explica que o servidor pode incluir o cabeçalho Retry-After dizendo quanto tempo esperar. O 503 Service Unavailable indica que o servidor não está pronto para atender, por manutenção ou sobrecarga, e também pode vir com Retry-After. Programe o seu coletor para obedecer: pausar, esperar o tempo indicado e reduzir o ritmo. Trocar de IP para continuar no mesmo ritmo é contornar o limite, não respeitá-lo.

Identifique o seu robô. Use um User-Agent que diga o que é a ferramenta e como contatar o responsável. Isso permite que o administrador do site fale com você em vez de simplesmente bloquear.

Colete só o necessário. Menos páginas, menos campos e cache local do que já foi baixado reduzem a carga para o site e o custo para você.

Prefira horários e volumes previsíveis. Uma coleta diária em volume estável é mais fácil de acompanhar e ajustar do que picos.

Se a sua coleta faz parte de um fluxo maior de automação, veja também Proxy para automações: quando usar e quando evitar.

Tipos de proxy para coleta de dados

Tipo Origem do IP Quando faz sentido
Datacenter Servidores e nuvem Coletas de baixo volume em sites que permitem, testes internos
Residencial Provedores de internet fixa Ver conteúdo como um usuário doméstico de determinada região
Móvel 4G Operadoras de celular Ver conteúdo como ele aparece em rede móvel no Brasil, testes de páginas e anúncios mobile

A escolha deve partir do que você precisa observar, não da tentativa de evitar bloqueios. A comparação completa está em proxy residencial, móvel ou datacenter.

Rotação de IP: quando usar

Trocar de IP tem usos legítimos: renovar a conexão quando ela fica instável, testar como o conteúdo aparece para IPs diferentes ou separar tarefas. Não deve ser usada para multiplicar o volume que um site já disse que não aceita de um único cliente. Quando trocar e quando manter está em Rotação de IP: quando trocar, quando manter.

O que o proxy não resolve

Nenhum proxy substitui seguir os termos de uso, o robots.txt e a legislação. Se um site bloqueou o seu acesso, isso é uma informação: o volume, o tipo de dado ou a forma de acesso não estão de acordo com o que ele aceita. O caminho é rever a coleta, procurar a API oficial ou falar com o site, e não trocar de IP para insistir.

Erros comuns

  1. Começar a coleta sem ler os termos de uso e o robots.txt.
  2. Ignorar respostas 429 e 503 e continuar no mesmo ritmo.
  3. Fazer dezenas de conexões simultâneas contra um site pequeno.
  4. Coletar dados pessoais sem avaliar a LGPD.
  5. Baixar de novo páginas que não mudaram, em vez de usar cache.
  6. Configurar o proxy errado no script. A diferença entre as portas está em Proxy HTTP ou SOCKS5.

Perguntas frequentes

Web scraping é ilegal? Não existe uma resposta única. Depende do site, dos termos de uso, do tipo de dado e de como ele será usado. Dados pessoais estão sujeitos à LGPD. Para projetos comerciais, vale uma análise jurídica.

Quantas requisições posso fazer por dia? Não há número fixo. Quem define é o site, pelos termos, pelo robots.txt e pelas respostas do servidor. Se receber 429, você passou do limite.

Por que recebo erro 403 mesmo usando proxy? O 403 indica que o servidor recusou o acesso. Pode ser uma política do site para acesso automatizado. O mais sensato é verificar se a coleta é permitida e se existe uma API.

Qual porta usar no script? Na Proxy Brazil, cada proxy tem porta HTTP e porta SOCKS5, com usuário e senha, além de um link de rotação de IP no painel. Para a maioria das bibliotecas de coleta, a porta HTTP é a mais simples de configurar.

Conclusão

Proxy é uma ferramenta de rede, útil para ver o conteúdo como ele aparece no Brasil em rede móvel e para organizar a coleta. A parte que decide se a coleta é sustentável está fora dele: permissão, ritmo, respeito aos limites e cuidado com dados pessoais.

Na Proxy Brazil, cada cliente tem acesso a um proxy móvel 4G dedicado, com IP de rede da Claro, TIM ou Vivo, porta HTTP, porta SOCKS5, link de rotação de IP no painel e suporte 24/7.

Se você precisa de IP móvel brasileiro para coleta de dados públicos e testes por região, conheça os planos de proxy móvel 4G da Proxy Brazil.