集成 · 中级

通过下载器中间件在 Scrapy 中使用轮换与粘性代理

Scrapy 已经能够连接需要身份验证的 HTTP 代理。一个二十行左右的中间件即可将 ProxShift 用户名语法转化为按请求轮换和按条目保持的粘性会话。

阅读约需 2 分钟 4 个章节 更新于 发布于

最简单的版本#

Scrapy 内置的 HttpProxyMiddleware 会读取 request.meta[\"proxy\"],并处理嵌入 URL 的凭据。在爬虫中设置此项后,每个请求都会在网关上轮换出口。

spider.py
import scrapy

PROXY = "http://USER-cc-us:[email protected]:9000"

class PricesSpider(scrapy.Spider):
    name = "prices"
    start_urls = ["https://example.com/catalog"]

    def start_requests(self):
        for url in self.start_urls:
            yield scrapy.Request(url, meta={"proxy": PROXY})

    def parse(self, response):
        for href in response.css("a.product::attr(href)").getall():
            yield response.follow(href, callback=self.parse_product, meta={"proxy": PROXY})

    def parse_product(self, response):
        yield {"url": response.url, "price": response.css(".price::text").get()}

为每个条目提供粘性会话的中间件#

middlewares.py
import hashlib

class ProxShiftMiddleware:
    GATEWAY = "res.proxshift.com:9000"

    def __init__(self, user, password, country):
        self.user, self.password, self.country = user, password, country

    @classmethod
    def from_crawler(cls, crawler):
        s = crawler.settings
        return cls(s.get("PROXSHIFT_USER"), s.get("PROXSHIFT_PASS"), s.get("PROXSHIFT_COUNTRY", "us"))

    def process_request(self, request, spider):
        # 请求携带会话键时使用粘性会话(例如每个商品流程一个),否则进行轮换
        key = request.meta.get("session_key")
        user = f"{self.user}-cc-{self.country}"
        if key:
            sid = hashlib.sha1(key.encode()).hexdigest()[:12]
            user += f"-sid-{sid}-ttl-10m"
        request.meta["proxy"] = f"http://{user}:{self.password}@{self.GATEWAY}"
settings.py
DOWNLOADER_MIDDLEWARES = {
    "myproject.middlewares.ProxShiftMiddleware": 350,   # 位于 HttpProxyMiddleware (750) 之前
}
PROXSHIFT_USER = "USER"
PROXSHIFT_PASS = "PASS"
PROXSHIFT_COUNTRY = "de"

CONCURRENT_REQUESTS = 32
CONCURRENT_REQUESTS_PER_DOMAIN = 8
AUTOTHROTTLE_ENABLED = True
AUTOTHROTTLE_TARGET_CONCURRENCY = 4.0
DOWNLOAD_TIMEOUT = 45
RETRY_ENABLED = True
RETRY_TIMES = 2
RETRY_HTTP_CODES = [403, 429, 500, 502, 503, 504, 522, 524]
COMPRESSION_ENABLED = True

重试的请求会再次经过中间件:没有会话键时,它会从新出口发出,这正是遇到 403 或 429 后所需要的行为;带有会话键时,它会继续使用同一出口,以满足多步骤流程的需要。

控制费用#

  • Scrapy 不加载图片或脚本,只获取 HTML 和 JSON,因此单个页面的成本就是其 HTML 大小。
  • 启用压缩(默认已启用);除非数据确实需要,否则避免使用 Splash 或浏览器渲染。
  • 开发期间使用 HTTPCACHE_ENABLED = True 开启缓存,以免在调试选择器时为重复获取同一页面付费。

按域名控制访问频率#

代理池的用途是模拟多位遵守规则的访问者,而不是制造一位肆无忌惮的访问者。CONCURRENT_REQUESTS_PER_DOMAIN 和 AutoThrottle 会让每个出口以符合真人行为的频率访问各个目标;可接受使用政策禁止任何类似攻击的行为。

大家常问的问题#

我需要 scrapy-rotating-proxies 吗?

使用网关时不需要:每次建立新连接时,轮换都在 ProxShift 端完成。该软件包用于管理静态代理列表;使用 res.proxshift.com 时只需配置一个代理。

如何让每个请求使用不同的国家/地区?

在爬虫中设置 request.meta["country"],再由中间件读取它来构建 -cc- 参数;为简化示例,本文只使用一项全局设置。

准备好即可开始

立即投入实际使用。

创建账户,充值 $20,然后将本指南中的端点粘贴到您的工具中。您购买的流量永不过期。