文章详情页
python - Scrapy ItemLoader数据清洗疑问
浏览:213日期:2022-06-30 08:28:51
问题描述
在使用scrapy抓取数据时,利用itemloader这个类,使用selector取出的值为空时,进入scrapy.Field()里调用filter(),selector取值不为空的确返回'有值',如果selector取出[]或'',那么value进入filter()之后,并不会返回'无值'
def filter(value): if value:return '有值' else:return '无值' # 下面就简写了,熟悉的应该能看的懂 scrapy.Field(filter())
有什么办法将抓取为空的值,经过filyer()之后变成'无值'
问题解答
回答1:谢邀~不太了解Scrapy,所以题主这个我不太好说我用PHP自己写的爬虫大体思路是:1.先是根据正则和一些循环,把要收集的页面放到队列里,按类别分类,例如分页的列表页一个队列,列表里的数据内容页一个队列。2.然后利用xpath来爬取相关内容页的数据,爬取的过程中对一些爬取到的数据进行如题主所需的那样进行处理。3.组装数据,按照自己所需的标准保存数据。
大体就是这样,我绝对大部分爬虫框架也大概都是这种思路吧,无非是在此基础上增加了,反爬机制,多线程,多进程,增量爬取等等功能。所以,题主找到你这个框架的爬取数据那里进行处理或组装数据的地方进行处理都行。
相关文章:
1. 为什么span的color非要内联样式才起作用?2. docker - 如何修改运行中容器的配置3. 请问一下各位老鸟 我一直在学习独孤九贱 现在是在tp5 今天发现 这个系列视频没有实战4. 手机开发 - Android蓝牙模块连接后怎么接收数据?求助5. 在cmd下进入mysql数据库,可以输入中文,但是查看表信息,不显示中文,是怎么回事,怎新手,请老师6. html5 - H5做的手机分享页微信更新后,分享出去不再默认显示第一个图 作为缩略图7. 老师,请问我打开browsersync出现这个问题怎么解决啊?8. css - div设置float:left后高度设置自动会无效 ?9. 求救一下,用新版的phpstudy,数据库过段时间会消失是什么情况?10. docker start -a dockername 老是卡住,什么情况?
排行榜

网公网安备