python - 如何正则字符串中的所有汉字
问题描述
这样算吗?121238asdf<img src='https://imgsa.baidu.com/forum/w%3D580/sign=da0493cd90ef76c6d0d2fb23ad14fdf6/e483aa4bd11373f0bddb2e73a40f4bfbf9ed04b1.jpg' height='420'>
字符串如上,类型是’str’,要正则获得汉字。我之前使用[u4e00-u9fa5]结果获得的还是英文,符号跟数字的list。求教导正确姿势。另外说说我哪里写错了..
pattern = re.compile(r’[u4E00-u9FA5]’)print pattern.findall(x[1])
这是我写的...但是返回结果就没有汉字,反而是除汉字外的其他字符。
问题解答
回答1:我这里假设你需要匹配的文本为s:
pattern = re.compile(ur'[u4e00-u9fa5]')print pattern.findall(s.decode(’utf8’))
这里的decode(’utf8’)是怕s的值为类似x66x77x88这样的Unicode散列。另外,需要注意compile()中ur修饰符,u为Unicode修饰符。
PS:我是从这篇文章得到的启发。
Update刚才看了下楼下说的,确实用Python 3就不存在输出为Unicode散列的情况了,以下摘自此处
Unicode 字符串在Python2中,普通字符串是以8位ASCII码进行存储的,而Unicode字符串则存储为16位unicode字符串,这样能够表示更多的字符集。使用的语法是在字符串前面加上前缀 u。
在Python3中,所有的字符串都是Unicode字符串。
回答2:你用的是python2,uxxxx是unicode字符,匹配后得到的是字节串,print出来是各个字节值。
换python3 就没这个问题了
相关文章:
1. javascript - 一排三个框,各个框的间距是15px,距离外面的白框间距也是15px,这个css怎么写?2. javascript - 如何利用vue组件 动态生成router-link3. html5 - javascript写业务有用到什么编程范式没?4. html5 - vue-cli 装好了 新建项目的好了,找不到项目是怎么回事?5. javascript - immutable配合react提升性能?6. javascript - vue 手机端项目在进入主页后 在进入子页面,直接按返回出现空白情况7. css3 - 微信前端页面遇到的transition过渡动画的bug8. javascript - jQuery post()方法,里面的请求串可以转换为GBK编码么?可以的话怎样转换?9. python3.x - python 中的maketrans在utf-8文件中该怎么使用10. mysql - C#连接数据库时一直这一句出问题int i = cmd.ExecuteNonQuery();

网公网安备