文章详情页
python - 正则表达式匹配html的问题。
浏览:178日期:2022-09-05 14:29:29
问题描述
<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>用BeautifulSoup html.parser解析的网页,现在用re模块想抓取**第7行**的中文内容,放在一个组里面(.*?)。正则老是匹配不上,用换行符也匹配不上,不知道怎么写了。。。
问题解答
回答1:既然你都用bs4解析了,为什么不用它提取哪?bs4内有一个stripped_string的函数正好满足你的需要。
回答2:import repattern = re.compile(r’</span>.*?</span>(.*?)</dd>’, re.S)str = ’’’<dd class='gray6'> <span class='gray6'> 中文 <span class='padl27'></span> 中文 </span> 中文内容 #需要抓取的内容</dd>’’’print(pattern.search(str).group(1))===> 中文内容 #需要抓取的内容回答3:
const re = /^</span>(.*)</dd>$/
这样可以不?
相关文章:
1. macos - mac下docker如何设置代理2. javascript - Js对象怎么通过value值拿到key值?3. javascript - [MUI 子webview定位]4. vue.js - Vue APP基于webpack的项目,它是独立的项目吗?我后台是Java的,要如何实现,跨域请求吗?大牛请教一下谢谢5. 前端 - 怎样让scale缩小的元素不占据原来的空间?6. docker - 各位电脑上有多少个容器啊?容器一多,自己都搞混了,咋办呢?7. dockerfile - 为什么docker容器启动不了?8. docker 下面创建的IMAGE 他们的 ID 一样?这个是怎么回事????9. java - SSH 根据id字段不能更新数据问题10. docker-compose 为何找不到配置文件?
排行榜
![javascript - [MUI 子webview定位]](http://www.haobala.com/attached/image/news/202302/105404965f.jpg)
网公网安备