文章详情页
python - 正则表达式匹配html的问题。
浏览:95日期:2022-09-05 14:29:29
问题描述
<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>用BeautifulSoup html.parser解析的网页,现在用re模块想抓取**第7行**的中文内容,放在一个组里面(.*?)。正则老是匹配不上,用换行符也匹配不上,不知道怎么写了。。。
问题解答
回答1:既然你都用bs4解析了,为什么不用它提取哪?bs4内有一个stripped_string的函数正好满足你的需要。
回答2:import repattern = re.compile(r’</span>.*?</span>(.*?)</dd>’, re.S)str = ’’’<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>’’’print(pattern.search(str).group(1))===> 中文内容 #需要抓取的内容回答3:
const re = /^</span>(.*)</dd>$/
这样可以不?
相关文章:
1. java - 对于jsp技术,aspx技术的困惑2. docker-compose中volumes的问题3. dockerfile - [docker build image失败- npm install]4. docker - 各位电脑上有多少个容器啊?容器一多,自己都搞混了,咋办呢?5. javascript - [,null]是什么用法6. java - jvm 年轻代 如何回收 survivor 对象7. java - idea如何不显示.idea target这些文件夹8. javascript - vue vue-router 报$router重复定义9. android - 安卓做前端,PHP做后台服务器 有什么需要注意的?10. javascript - 移动端H5页面禁止缩放了,在浏览器上仍然可以缩放
排行榜
