Почему прокси решают эту задачу
Любой веб-скрапер рано или поздно упирается в баны по IP. Сайты отслеживают частоту запросов на IP и блокируют всё, что выглядит автоматизированным. Пул резидентных прокси даёт вам свежий IP от реального провайдера на каждый запрос - целевой сервер видит обычного пользователя, а не бота.
Проблемы без прокси
Баны по IP после 50–100 запросов
Большинство e-commerce и новостных сайтов блокируют один IP, обнаружив паттерны скрапинга. Ротационные прокси распределяют запросы по тысячам IP, так что ни один не упирается в порог.
CAPTCHA на ценных страницах
Дата-центровые IP вызывают CAPTCHA, потому что их ASN известны. Резидентные IP от реальных провайдеров имеют более высокое доверие и редко видят челлендж CAPTCHA.
Блокировки при JavaScript-рендеринге
Некоторые сайты отдают полный контент только браузерам. Сочетайте прокси с headless Chrome (Puppeteer/Playwright) - настраивайте прокси на уровне браузера, а не запроса.
Гео-заблокированные данные
Цены, поисковая выдача и контент различаются по странам. Используйте таргетинг до города, чтобы вытянуть данные из любого конкретного рынка.
Как это решает SotaProxy
Резидентные прокси SotaProxy ротируются автоматически на каждый запрос или держат sticky-сессию до 30 минут, когда нужно скрапить постраничный контент. Пул покрывает 220+ стран с таргетингом до города. Успешность держится выше 99% для большинства целей.
Настройка за 4 шага
Выберите тип прокси
Резидентные - для сайтов, агрессивно блокирующих скраперы. Дата-центровые - для высокообъёмных, малорисковых целей, где скорость важнее скрытности.
Задайте режим ротации
Ротационная сессия: новый IP на каждый запрос. Sticky-сессия: тот же IP на 1–30 минут. Используйте sticky для многошаговых скрапов (вход → навигация → извлечение).
Настройте скрапер
Задайте эндпоинт прокси в вашем HTTP-клиенте (requests, httpx, Scrapy, Playwright). Используйте HTTP CONNECT для HTTPS-целей.
Добавьте гео-таргетинг
Добавьте код страны или города в параметр имени пользователя. Тяните данные конкретного рынка без VPN.
Сколько на самом деле стоит миллион страниц
Выбор прокси это сначала арифметика и только потом техника. Вот одна и та же задача, посчитанная двумя способами по нашим ценам, где страница весит 80 КБ сжатого HTML:
Датацентр выигрывает по цене везде, где цель его пропускает, и разрыв растёт с объёмом. Резидентка отрабатывает свою цену на сайтах, которые режут хостинговые диапазоны, и там выбор идёт не между $27 и $76, а между $76 и отсутствием данных.
Конфигурация, которая переживает встречу с живым сайтом
Начинайте на датацентре, измеряйте долю блокировок и переносите только те цели, что упали. Резидентке с ротацией номер сессии не нужен вовсе, отсюда и дешевизна:
Python: пул датацентра с откатом на резидентку
import requests
from itertools import cycle
# Датацентровый пул: ротируем сами
pool = cycle([
"http://login:password@198.51.100.20:50100",
"http://login:password@198.51.100.21:50100",
])
# Резидентка про запас: без номера сессии новый IP на запрос
RESI = "http://login_c_US:password@proxy.sotaproxy.com:10000"
headers = {"Accept-Encoding": "gzip"}
def fetch(url, use_resi=False):
proxy = RESI if use_resi else next(pool)
r = requests.get(url, proxies={"http": proxy, "https": proxy},
headers=headers, timeout=30)
if r.status_code == 403 and not use_resi:
return fetch(url, use_resi=True)
return r- Просите gzip. Он режет HTML в три-четыре раза, и на резидентке это разница между $76 и $250 за один и тот же прогон.
- Блокируйте картинки, шрифты и видео в headless-браузере. Они дают основной вес и ноль нужных данных.
- Таймаут тридцать секунд. Резидентный маршрут строится дольше датацентрового, и пять секунд выбрасывают запросы, которые бы прошли.
- Размазывайте нагрузку по адресам, а не ускоряйте один. Один IP, ведущий себя как пятьдесят пользователей, это и есть шаблон, который ловят лимитеры.
Четыре способа сжечь здесь деньги
Ретраить 403 на датацентре бесконечно
Если сайт режет хостинговые диапазоны, каждый повтор стоит трафика и ничего не меняет. Распознайте шаблон один раз и уведите этот домен на резидентку.
Гонять весь обход через резидентку
Большинство сайтов в типовом обходе репутацию адреса не проверяют вообще. Платить за них по гигабайтам это пожертвование.
Качать то, что вы не разбираете
Карточка товара это 80 КБ HTML и 300 КБ картинок. Считается и то, и другое.
Один адрес и максимум потоков
Вы упрётесь в 429 задолго до наших лимитов. Ограничения на параллельные соединения у нас нет, поэтому берите больше адресов.
Часто задаваемые вопросы
Какой тип прокси лучший для веб-скрапинга?
Резидентные прокси - для сайтов с антибот-защитой (e-commerce, соцсети, тревел). Дата-центровые - для высокообъёмного скрапинга целей, которые не блокируют облачные IP активно.
Работают ли ротационные прокси со Scrapy?
Да. Используйте middleware ротации прокси или задайте прокси прямо в DOWNLOADER_MIDDLEWARES. Задайте эндпоинт один раз - ротация происходит на стороне сервера.
Как скрапить страницы с JavaScript-рендерингом?
Используйте Playwright или Puppeteer с настройкой прокси на уровне запуска браузера. Задайте --proxy-server=ваш-эндпоинт при запуске браузера.
Какую успешность ожидать?
Для большинства e-commerce и новостных сайтов: 95–99%. Для Google, Amazon и LinkedIn: 90–95% с резидентными прокси. Ниже с дата-центровыми IP против этих конкретных целей.
Законен ли веб-скрапинг?
Скрапинг общедоступных данных в целом законен в большинстве юрисдикций. Всегда проверяйте robots.txt и Условия использования сайта на предмет ограничений.
Похожие сценарии
Готовы начать?
Создайте аккаунт, пополните баланс и получите доступ к прокси за несколько минут. Без звонков. Без минимального платежа.
Создать аккаунт