linux - python 抓取公众号文章遇到验证问题
问题描述
linux 下抓取微信公众号文章遇到验证问题!!!!!!!!
这是我要抓取的人民日报链接:http://mp.weixin.qq.com/profile?src=3×tamp=1492739045&ver=1&signature=bSSQMK1LY77M4O22qTi37cbhjhwNV7C9V4aor9HLhAvbGc2ybWX*qg3WqxntZ7iq0kvYe87oPpcSJKFdmGMx5g==1:首先浏览器上访问是正常的。2:linux下访问提示需要验证,以下是简单的代码
url = http://mp.weixin.qq.com/profile?src=3×tamp=1492738883&ver=1&signature=bSSQMK1LY77M4O22qTi37cbhjhwNV7C9V4aor9HLhAvbGc2ybWX*qg3WqxntZ7iq2xTLUTfxAMzK79UGvalY1A==response = urllib2.urlopen(url)print response.read()
访问的结果如下:
补充说明下公众号链接的获取方式:1:先访问链接:http://weixin.sogou.com/weixi...2:再获取人民日报公众号的链接进行跳转。
问题解答
回答1:都不模拟header请求头的,就能抓取吗,建议先模拟request header再试一下
回答2:# coding: utf-8import requestsheaders = {}headers[’User-Agent’] = ’Mozilla/5.0 (Windows NT 10.0; WOW64; rv:52.0) Gecko/20100101 Firefox/52.0’url = ’http://mp.weixin.qq.com/profile?src=3×tamp=1492739045&ver=1&signature=bSSQMK1LY77M4O22qTi37cbhjhwNV7C9V4aor9HLhAvbGc2ybWX*qg3WqxntZ7iq0kvYe87oPpcSJKFdmGMx5g==’r = requests.get(url, headers=headers)print r.text回答3:

现在在请求中加了header后,返回的错误是这样的。请各位大神麻烦再支下招
回答4:用request可以,本地环境Mac OSX , python3.6.1import requestsheaders = {’user-agent’ : ’Mozilla/5.0’}respon = requests.get(’http://mp.weixin.qq.com/profile?src=3×tamp=1492831080&ver=1&signature=bSSQMK1LY77M4O22qTi37cbhjhwNV7C9V4aor9HLhAvbGc2ybWX*qg3WqxntZ7iqB7vsPUlOS3zhl-8n5FUODg==’, headers = headers)respon.encoding = ’utf-8’print(respon.text)内容在红色框那一行


相关文章:
1. 点字符“” 在MVC Web API 2中进行请求,例如api / people / STAFF.452872. javascript - thymeleaf模板 只有length如何循环生成标签?3. golang - 用IDE看docker源码时的小问题4. 如何解决docker宿主机无法访问容器中的服务?5. 求大神指点js修改margintop导致无限下滑的问题6. node.js - 我是一个做前端的,求教如何学习vue,node等js引擎?7. javascript - node如何关闭主进程后 打开另一进程?8. java - 在Spring初始化过程中阻塞合理吗?9. docker - 各位电脑上有多少个容器啊?容器一多,自己都搞混了,咋办呢?10. python2.7为什么点击了"开始"按钮后,tkinter上的按钮,图中红色部分,再也点不动了?

网公网安备