Реферальная программа →
ГлавнаяГлоссарийВеб-скрапинг
Глоссарий

Веб-скрапинг

Автоматизированное извлечение данных с сайтов путём отправки запросов и разбора полученного HTML или ответов API.

Веб-скрапинг - это автоматизированный сбор данных с сайтов. Скрапер отправляет HTTP-запросы к целевым страницам, получает HTML (или JSON из API) и извлекает нужные данные - цены, характеристики товаров, отзывы, объявления, результаты поиска. Он автоматизирует то, что человек мог бы делать руками, но в масштабе, недоступном человеку.

Процесс состоит из трёх этапов: fetch (запросить страницу), parse (извлечь структурированные данные из ответа) и store (сохранить в базу или файл). Инструменты - от простых HTTP-библиотек вроде Python requests до полноценных headless-браузеров вроде Playwright, которые рендерят страницы с тяжёлым JavaScript перед скрапингом.

Прокси необходимы для скрапинга в масштабе. Тысячи запросов с одного IP быстро приводят к rate-limit или бану этого IP. Ротация запросов по большому пулу резидентных прокси распределяет их так, что ни один IP не упирается в лимит, а гео-таргетированные прокси позволяют видеть локализованный контент, который получают реальные пользователи в каждой стране.

Типичные применения: мониторинг цен, маркетинговые исследования, отслеживание позиций в SEO, генерация лидов, верификация рекламы и сбор данных для обучения моделей. Скрапинг общедоступных данных широко практикуется, но законность зависит от юрисдикции, условий сайта и того, какие данные собираются - см. «законен ли веб-скрапинг» для нюансов.

Автоматизация того, что делает браузер

Веб-скрапинг это программное получение страниц и извлечение из них структурированных данных. Половина с получением это обычный HTTP. Половина с извлечением это разбор, и сложность обеих колоссально зависит от цели.

Сайты, отрисовывающие на сервере, отдают данные прямо в HTML. Сайты, отрисовывающие в браузере, требуют либо выполнять JavaScript, а это headless-браузер и куда больше трафика, либо найти API, к которому обращается сама страница, что обычно быстрее и дешевле.

Прокси появляются в этой картине из-за объёма. Один адрес, делающий тысячи запросов, упирается в лимиты частоты и проверки репутации. Размазывание того же объёма по многим адресам и превращает скрапер из всплеска, который заблокируют, в работу, которая держится.

Выбор типа адреса по тому, что проверяет цель

Разница в стоимости между подходами велика, поэтому это решение стоит принимать осознанно:

Маршрутизация по цели

Public pages, no filtering    -> datacenter, from $1.15/mo, unmetered
Hosting ranges blocked        -> residential, $1.00 per GB
Login required                -> ISP or mobile, one address per account

1M pages at 80 KB gzipped = 76 GB = $76 on residential
                            or 20 datacenter addresses at $27
  • Ищите нижележащий API прежде, чем отрисовывать страницы. Точка с JSON часто это десятая часть трафика и ноль мучений с разбором.
  • Просите gzip и отсекайте картинки. На тарифицируемых продуктах это разница между разумным счётом и нелепым.
  • Размазывайте по адресам, а не поднимайте число потоков на одном. Лимиты частоты считаются на адрес.
  • Записывайте, какой адрес отдал какой ответ. Отладка без этого превращается в гадание.

Заблуждения о скрапинге

Прокси не побеждает снятие отпечатков

Адрес это один признак. Рукопожатие TLS из Python объявляет себя независимо от выхода.

Резидентка это не ответ по умолчанию

Большинство страниц в типичном обходе вообще ничего не проверяют. Платить за них по гигабайтам это обычная потеря.

Больше потоков не значит больше данных

За пределом терпимости цели лишняя параллельность даёт 429, а не страницы.

Ответ 200 это не доказательство хороших данных

Мягкие блокировки возвращают урезанное содержимое с успешным кодом.

Готов использовать веб-скрапинг?

SotaProxy даёт доступ к ротирующим резидентским, мобильным, дата-центр и ISP прокси. Без минимальных платежей.

Начать