文章详情页
python - 正则表达式匹配html的问题。
浏览:77日期:2022-09-05 14:29:29
问题描述
<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>用BeautifulSoup html.parser解析的网页,现在用re模块想抓取**第7行**的中文内容,放在一个组里面(.*?)。正则老是匹配不上,用换行符也匹配不上,不知道怎么写了。。。
问题解答
回答1:既然你都用bs4解析了,为什么不用它提取哪?bs4内有一个stripped_string的函数正好满足你的需要。
回答2:import repattern = re.compile(r’</span>.*?</span>(.*?)</dd>’, re.S)str = ’’’<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>’’’print(pattern.search(str).group(1))===> 中文内容 #需要抓取的内容回答3:
const re = /^</span>(.*)</dd>$/
这样可以不?
相关文章:
1. css3 - [CSS] 动画效果 3D翻转bug2. MySQL客户端吃掉了SQL注解?3. 求大神帮我看看是哪里写错了 感谢细心解答4. javascript - JS设置Video视频对象的currentTime时出现了问题,IE,Edge,火狐,都可以设置,反而chrom却...5. python - Django分页和查询参数的问题6. javascript - 百度echarts series数据更新问题7. javascript - 图片能在网站显示,但控制台仍旧报错403 (Forbidden)8. python小白的基础问题 关于while循环的嵌套9. phpstady在win10上运行10. php自学从哪里开始?
排行榜
