selenium - 请教一下 Python 爬虫工具
问题描述
1)我要抓的是 Instagram 某明星的粉丝2)Instagram pc 站使用了大量的 js 渲染3)没写过爬虫,老板明天就要数据
我目前使用的是BeautifulSoup, selenium 和phantomjs
代码 demo 大概是
driver = webdriver.PhantomJS(self.browser)driver.get(self.url)driver.implicitly_wait(3)element = driver.find_element_by_class_name('_s53mj')element.click()html = driver.page_sourcesoup = BeautifulSoup(html)
问题是:1) 我不知道click 有没有执行成功, click 的元素对不对, driver 好像没有返回值给我参考2) 即使 click 成功了, 但是他是不是只调了 js里的 click() 方法,并没有触发 target 怎么办3)我不知道是先渲染page_source, 还是 应该先 click, 假设执行成功了 click, 是不是也不会再 source 里返回了
啊, 谢各位爬虫大佬了
问题解答
回答1:说的是什么意思?百思不得其解啊。。。
selenium自动化,click能模仿用户点击,就跟你自己在页面上点击一样,一切都在虚拟浏览器驱动中进行。
看你的业务逻辑啊。。。比如有些数据要点击后才有,那就先click再获取源代码。
相关文章:
1. javascript - 一排三个框,各个框的间距是15px,距离外面的白框间距也是15px,这个css怎么写?2. javascript - 如何利用vue组件 动态生成router-link3. html5 - javascript写业务有用到什么编程范式没?4. html5 - vue-cli 装好了 新建项目的好了,找不到项目是怎么回事?5. javascript - immutable配合react提升性能?6. javascript - vue 手机端项目在进入主页后 在进入子页面,直接按返回出现空白情况7. css3 - 微信前端页面遇到的transition过渡动画的bug8. javascript - jQuery post()方法,里面的请求串可以转换为GBK编码么?可以的话怎样转换?9. python3.x - python 中的maketrans在utf-8文件中该怎么使用10. mysql - C#连接数据库时一直这一句出问题int i = cmd.ExecuteNonQuery();

网公网安备