最简单的版本#
Scrapy 内置的 HttpProxyMiddleware 会读取 request.meta[\"proxy\"],并处理嵌入 URL 的凭据。在爬虫中设置此项后,每个请求都会在网关上轮换出口。
import scrapy
PROXY = "http://USER-cc-us:[email protected]:9000"
class PricesSpider(scrapy.Spider):
name = "prices"
start_urls = ["https://example.com/catalog"]
def start_requests(self):
for url in self.start_urls:
yield scrapy.Request(url, meta={"proxy": PROXY})
def parse(self, response):
for href in response.css("a.product::attr(href)").getall():
yield response.follow(href, callback=self.parse_product, meta={"proxy": PROXY})
def parse_product(self, response):
yield {"url": response.url, "price": response.css(".price::text").get()}为每个条目提供粘性会话的中间件#
import hashlib
class ProxShiftMiddleware:
GATEWAY = "res.proxshift.com:9000"
def __init__(self, user, password, country):
self.user, self.password, self.country = user, password, country
@classmethod
def from_crawler(cls, crawler):
s = crawler.settings
return cls(s.get("PROXSHIFT_USER"), s.get("PROXSHIFT_PASS"), s.get("PROXSHIFT_COUNTRY", "us"))
def process_request(self, request, spider):
# 请求携带会话键时使用粘性会话(例如每个商品流程一个),否则进行轮换
key = request.meta.get("session_key")
user = f"{self.user}-cc-{self.country}"
if key:
sid = hashlib.sha1(key.encode()).hexdigest()[:12]
user += f"-sid-{sid}-ttl-10m"
request.meta["proxy"] = f"http://{user}:{self.password}@{self.GATEWAY}"DOWNLOADER_MIDDLEWARES = {
"myproject.middlewares.ProxShiftMiddleware": 350, # 位于 HttpProxyMiddleware (750) 之前
}
PROXSHIFT_USER = "USER"
PROXSHIFT_PASS = "PASS"
PROXSHIFT_COUNTRY = "de"
CONCURRENT_REQUESTS = 32
CONCURRENT_REQUESTS_PER_DOMAIN = 8
AUTOTHROTTLE_ENABLED = True
AUTOTHROTTLE_TARGET_CONCURRENCY = 4.0
DOWNLOAD_TIMEOUT = 45
RETRY_ENABLED = True
RETRY_TIMES = 2
RETRY_HTTP_CODES = [403, 429, 500, 502, 503, 504, 522, 524]
COMPRESSION_ENABLED = True重试的请求会再次经过中间件:没有会话键时,它会从新出口发出,这正是遇到 403 或 429 后所需要的行为;带有会话键时,它会继续使用同一出口,以满足多步骤流程的需要。
控制费用#
- Scrapy 不加载图片或脚本,只获取 HTML 和 JSON,因此单个页面的成本就是其 HTML 大小。
- 启用压缩(默认已启用);除非数据确实需要,否则避免使用
Splash或浏览器渲染。 - 开发期间使用
HTTPCACHE_ENABLED = True开启缓存,以免在调试选择器时为重复获取同一页面付费。
按域名控制访问频率#
代理池的用途是模拟多位遵守规则的访问者,而不是制造一位肆无忌惮的访问者。CONCURRENT_REQUESTS_PER_DOMAIN 和 AutoThrottle 会让每个出口以符合真人行为的频率访问各个目标;可接受使用政策禁止任何类似攻击的行为。
大家常问的问题#
我需要 scrapy-rotating-proxies 吗?
使用网关时不需要:每次建立新连接时,轮换都在 ProxShift 端完成。该软件包用于管理静态代理列表;使用 res.proxshift.com 时只需配置一个代理。
如何让每个请求使用不同的国家/地区?
在爬虫中设置 request.meta["country"],再由中间件读取它来构建 -cc- 参数;为简化示例,本文只使用一项全局设置。