文章详情页
python - Scrapy如何得到原始的start_url
浏览:275日期:2022-06-27 15:45:21
问题描述
Scrapy爬虫时,由于重定向或是其他原因,会导致原始的start_url发生改变,怎样才能得到原始的start_url?
def start_requests(self): start_url = ’your_scrapy_start_url’ yield Request(start_url, self.parse) def parse(self, response): item = YourItem() item[’start_url’] = 原始请求的start_url yield item
问题解答
回答1:参考文章:Scrapy爬虫常见问题总结
利用Request中的meta参数传递信息
def start_requests(self): start_url = ’your_scrapy_start_url’ yield Request(start_url, self.parse, meta={’start_url’:start_url}) def parse(self, response): item = YourItem() item[’start_url’] = response.meta[’start_url’] yield item
相关文章:
1. docker api 开发的端口怎么获取?2. 关于docker下的nginx压力测试3. java - 为什么第一个线程已经释放了锁,第二个线程却不行?4. 在windows下安装docker Toolbox 启动Docker Quickstart Terminal 失败!5. dockerfile - [docker build image失败- npm install]6. docker-machine添加一个已有的docker主机问题7. 如何解决Centos下Docker服务启动无响应,且输入docker命令无响应?8. 如何解决docker宿主机无法访问容器中的服务?9. html5 - 请问一下写H5的时候 你们都是兼容那些手机10. macos - mac下docker如何设置代理
排行榜

网公网安备