# 通过下载器中间件在 Scrapy 中使用轮换与粘性代理

Scrapy 已经能够连接需要身份验证的 HTTP 代理。一个二十行左右的中间件即可将 ProxShift 用户名语法转化为按请求轮换和按条目保持的粘性会话。


## 最简单的版本

Scrapy 内置的 `HttpProxyMiddleware` 会读取 `request.meta[\"proxy\"]`，并处理嵌入 URL 的凭据。在爬虫中设置此项后，每个请求都会在网关上轮换出口。

```python
import scrapy

PROXY = "http://USER-cc-us:PASS@res.proxshift.com:9000"

class PricesSpider(scrapy.Spider):
    name = "prices"
    start_urls = ["https://example.com/catalog"]

    def start_requests(self):
        for url in self.start_urls:
            yield scrapy.Request(url, meta={"proxy": PROXY})

    def parse(self, response):
        for href in response.css("a.product::attr(href)").getall():
            yield response.follow(href, callback=self.parse_product, meta={"proxy": PROXY})

    def parse_product(self, response):
        yield {"url": response.url, "price": response.css(".price::text").get()}
```


## 为每个条目提供粘性会话的中间件

```python
import hashlib

class ProxShiftMiddleware:
    GATEWAY = "res.proxshift.com:9000"

    def __init__(self, user, password, country):
        self.user, self.password, self.country = user, password, country

    @classmethod
    def from_crawler(cls, crawler):
        s = crawler.settings
        return cls(s.get("PROXSHIFT_USER"), s.get("PROXSHIFT_PASS"), s.get("PROXSHIFT_COUNTRY", "us"))

    def process_request(self, request, spider):
        # 请求携带会话键时使用粘性会话（例如每个商品流程一个），否则进行轮换
        key = request.meta.get("session_key")
        user = f"{self.user}-cc-{self.country}"
        if key:
            sid = hashlib.sha1(key.encode()).hexdigest()[:12]
            user += f"-sid-{sid}-ttl-10m"
        request.meta["proxy"] = f"http://{user}:{self.password}@{self.GATEWAY}"
```

```python
DOWNLOADER_MIDDLEWARES = {
    "myproject.middlewares.ProxShiftMiddleware": 350,   # 位于 HttpProxyMiddleware (750) 之前
}
PROXSHIFT_USER = "USER"
PROXSHIFT_PASS = "PASS"
PROXSHIFT_COUNTRY = "de"

CONCURRENT_REQUESTS = 32
CONCURRENT_REQUESTS_PER_DOMAIN = 8
AUTOTHROTTLE_ENABLED = True
AUTOTHROTTLE_TARGET_CONCURRENCY = 4.0
DOWNLOAD_TIMEOUT = 45
RETRY_ENABLED = True
RETRY_TIMES = 2
RETRY_HTTP_CODES = [403, 429, 500, 502, 503, 504, 522, 524]
COMPRESSION_ENABLED = True
```

重试的请求会再次经过中间件：没有会话键时，它会从新出口发出，这正是遇到 403 或 429 后所需要的行为；带有会话键时，它会继续使用同一出口，以满足多步骤流程的需要。


## 控制费用

- Scrapy 不加载图片或脚本，只获取 HTML 和 JSON，因此单个页面的成本就是其 HTML 大小。
- 启用压缩（默认已启用）；除非数据确实需要，否则避免使用 `Splash` 或浏览器渲染。
- 开发期间使用 `HTTPCACHE_ENABLED = True` 开启缓存，以免在调试选择器时为重复获取同一页面付费。


## 按域名控制访问频率

代理池的用途是模拟多位遵守规则的访问者，而不是制造一位肆无忌惮的访问者。`CONCURRENT_REQUESTS_PER_DOMAIN` 和 AutoThrottle 会让每个出口以符合真人行为的频率访问各个目标；[可接受使用政策](https://proxshift.com/zh/legal/acceptable-use)禁止任何类似攻击的行为。


## 问题

**我需要 scrapy-rotating-proxies 吗？**

使用网关时不需要：每次建立新连接时，轮换都在 ProxShift 端完成。该软件包用于管理静态代理列表；使用 res.proxshift.com 时只需配置一个代理。

**如何让每个请求使用不同的国家/地区？**

在爬虫中设置 request.meta["country"]，再由中间件读取它来构建 -cc- 参数；为简化示例，本文只使用一项全局设置。

来源：https://proxshift.com/zh/guides/scrapy-rotating-proxies
