Proxy para coleta de dados: limites, riscos e boas práticas
Equipe Proxy Brazil · Publicado em · Atualizado em · 7 min de leitura
Resumo
Como usar proxy na coleta de dados públicos de forma responsável: termos de uso, robots.txt, LGPD, respostas 429 e 503, ritmo de requisições e escolha do tipo de IP.
Coletar dados de sites de forma automatizada é rotina em monitoramento de preços, pesquisa de mercado, agregação de notícias e testes de sites. Junto com essa rotina vêm as dúvidas: quando faz sentido usar proxy, quanto se pode acessar um site e o que fazer quando ele responde com erro ou pede para desacelerar.
Este guia trata de coleta de dados públicos feita de forma responsável: o que o proxy acrescenta, quais são os limites técnicos e legais e como montar uma coleta que não sobrecarregue quem está do outro lado.
Resposta rápida
Um proxy muda o IP de onde saem as requisições. Isso é útil para ver o conteúdo como ele aparece no Brasil em rede móvel, para separar o tráfego da coleta da sua rede principal e para testar por região. O proxy não dá permissão para coletar nada. Antes de começar, verifique se há uma API oficial, leia os termos de uso e o robots.txt do site, colete só o que precisa, respeite os limites de requisição e pare ou desacelere quando o site responder com 429 ou 503.
O que o proxy faz, e o que não faz, numa coleta
O que ele faz:
- Mostra o conteúdo como é servido para um IP brasileiro de rede móvel, útil para preços, anúncios e páginas que mudam por região.
- Separa o tráfego da coleta do IP do seu escritório ou servidor.
- Permite trocar de IP quando necessário pelo link de rotação, em vez de depender de um único endereço.
O que ele não faz:
- Não autoriza a coleta. Termos de uso, direitos sobre o conteúdo e a legislação de dados continuam valendo.
- Não serve para ultrapassar o limite de requisições que o site definiu. Se o site pede para desacelerar, a resposta correta é desacelerar.
Antes de coletar: permissões e regras
API oficial primeiro. Muitos serviços oferecem API com limites documentados e dados estruturados. É mais estável que ler HTML e deixa claro o que é permitido. Sobre o papel do IP em integrações com APIs, veja proxy e APIs: por que o IP é fator crítico.
Termos de uso. Leia o que o site diz sobre acesso automatizado. Se proíbe, o proxy não muda isso.
robots.txt. É o arquivo em que o site indica o que robôs podem acessar. O protocolo está padronizado na RFC 9309, que fica na raiz do site (por exemplo, exemplo.com.br/robots.txt) e define como identificar o grupo de regras do seu robô. A própria RFC lembra que essas regras não são uma forma de autorização de acesso: seguir o robots.txt é o mínimo de boa conduta, não uma licença para tudo o que não está bloqueado. A RFC também orienta não usar uma cópia em cache por mais de 24 horas, exceto quando o arquivo está inacessível.
Dados pessoais. Se a coleta envolve dados de pessoas, a LGPD se aplica. O artigo 7º da Lei 13.709 estabelece que o tratamento de dados pessoais de acesso público deve considerar a finalidade, a boa-fé e o interesse público que justificaram sua disponibilização. Dado público não é dado livre de regras. Na dúvida, consulte um advogado.
Como montar uma coleta responsável
Ritmo. Comece devagar e aumente só se o site responder bem. Não existe um intervalo universal seguro; depende do tamanho do site e do que ele informa. Evite paralelizar muitas conexões contra o mesmo domínio.
Respeite o 429 e o Retry-After. O código 429 Too Many Requests indica que o cliente enviou requisições demais em pouco tempo. A MDN explica que o servidor pode incluir o cabeçalho Retry-After dizendo quanto tempo esperar. O 503 Service Unavailable indica que o servidor não está pronto para atender, por manutenção ou sobrecarga, e também pode vir com Retry-After. Programe o seu coletor para obedecer: pausar, esperar o tempo indicado e reduzir o ritmo. Trocar de IP para continuar no mesmo ritmo é contornar o limite, não respeitá-lo.
Identifique o seu robô. Use um User-Agent que diga o que é a ferramenta e como contatar o responsável. Isso permite que o administrador do site fale com você em vez de simplesmente bloquear.
Colete só o necessário. Menos páginas, menos campos e cache local do que já foi baixado reduzem a carga para o site e o custo para você.
Prefira horários e volumes previsíveis. Uma coleta diária em volume estável é mais fácil de acompanhar e ajustar do que picos.
Se a sua coleta faz parte de um fluxo maior de automação, veja também Proxy para automações: quando usar e quando evitar.
Tipos de proxy para coleta de dados
| Tipo | Origem do IP | Quando faz sentido |
|---|---|---|
| Datacenter | Servidores e nuvem | Coletas de baixo volume em sites que permitem, testes internos |
| Residencial | Provedores de internet fixa | Ver conteúdo como um usuário doméstico de determinada região |
| Móvel 4G | Operadoras de celular | Ver conteúdo como ele aparece em rede móvel no Brasil, testes de páginas e anúncios mobile |
A escolha deve partir do que você precisa observar, não da tentativa de evitar bloqueios. A comparação completa está em proxy residencial, móvel ou datacenter.
Rotação de IP: quando usar
Trocar de IP tem usos legítimos: renovar a conexão quando ela fica instável, testar como o conteúdo aparece para IPs diferentes ou separar tarefas. Não deve ser usada para multiplicar o volume que um site já disse que não aceita de um único cliente. Quando trocar e quando manter está em Rotação de IP: quando trocar, quando manter.
O que o proxy não resolve
Nenhum proxy substitui seguir os termos de uso, o robots.txt e a legislação. Se um site bloqueou o seu acesso, isso é uma informação: o volume, o tipo de dado ou a forma de acesso não estão de acordo com o que ele aceita. O caminho é rever a coleta, procurar a API oficial ou falar com o site, e não trocar de IP para insistir.
Erros comuns
- Começar a coleta sem ler os termos de uso e o robots.txt.
- Ignorar respostas 429 e 503 e continuar no mesmo ritmo.
- Fazer dezenas de conexões simultâneas contra um site pequeno.
- Coletar dados pessoais sem avaliar a LGPD.
- Baixar de novo páginas que não mudaram, em vez de usar cache.
- Configurar o proxy errado no script. A diferença entre as portas está em Proxy HTTP ou SOCKS5.
Perguntas frequentes
Web scraping é ilegal? Não existe uma resposta única. Depende do site, dos termos de uso, do tipo de dado e de como ele será usado. Dados pessoais estão sujeitos à LGPD. Para projetos comerciais, vale uma análise jurídica.
Quantas requisições posso fazer por dia? Não há número fixo. Quem define é o site, pelos termos, pelo robots.txt e pelas respostas do servidor. Se receber 429, você passou do limite.
Por que recebo erro 403 mesmo usando proxy? O 403 indica que o servidor recusou o acesso. Pode ser uma política do site para acesso automatizado. O mais sensato é verificar se a coleta é permitida e se existe uma API.
Qual porta usar no script? Na Proxy Brazil, cada proxy tem porta HTTP e porta SOCKS5, com usuário e senha, além de um link de rotação de IP no painel. Para a maioria das bibliotecas de coleta, a porta HTTP é a mais simples de configurar.
Conclusão
Proxy é uma ferramenta de rede, útil para ver o conteúdo como ele aparece no Brasil em rede móvel e para organizar a coleta. A parte que decide se a coleta é sustentável está fora dele: permissão, ritmo, respeito aos limites e cuidado com dados pessoais.
Na Proxy Brazil, cada cliente tem acesso a um proxy móvel 4G dedicado, com IP de rede da Claro, TIM ou Vivo, porta HTTP, porta SOCKS5, link de rotação de IP no painel e suporte 24/7.
Se você precisa de IP móvel brasileiro para coleta de dados públicos e testes por região, conheça os planos de proxy móvel 4G da Proxy Brazil.