python - 如何正则字符串中的所有汉字

查看:176
本文介绍了python - 如何正则字符串中的所有汉字的处理方法,对大家解决问题具有一定的参考价值,需要的朋友们下面随着小编来一起学习吧!

问题描述

问 题

这样算吗?121238asdf<img class="BDE_Image" src="https://imgsa.baidu.com/forum/w%3D580/sign=da0493cd90ef76c6d0d2fb23ad14fdf6/e483aa4bd11373f0bddb2e73a40f4bfbf9ed04b1.jpg" width="560" height="420">

字符串如上,类型是'str',要正则获得汉字。我之前使用[u4e00-u9fa5]结果获得的还是英文,符号跟数字的list。求教导正确姿势。另外说说我哪里写错了..

pattern = re.compile(r'[\u4E00-\u9FA5]')
print pattern.findall(x[1])

这是我写的...但是返回结果就没有汉字,反而是除汉字外的其他字符。

解决方案

我这里假设你需要匹配的文本为s

pattern = re.compile(ur"[\u4e00-\u9fa5]")
print pattern.findall(s.decode('utf8'))

这里的decode('utf8')是怕s的值为类似\x66\x77\x88这样的Unicode散列。另外,需要注意compile()ur修饰符,u为Unicode修饰符。

PS:我是从这篇文章得到的启发。

Update

刚才看了下楼下说的,确实用Python 3就不存在输出为Unicode散列的情况了,以下摘自此处

Unicode 字符串

在Python2中,普通字符串是以8位ASCII码进行存储的,而Unicode字符串则存储为16位unicode字符串,这样能够表示更多的字符集。使用的语法是在字符串前面加上前缀 u。

在Python3中,所有的字符串都是Unicode字符串。

这篇关于python - 如何正则字符串中的所有汉字的文章就介绍到这了,希望我们推荐的答案对大家有所帮助,也希望大家多多支持IT屋!

查看全文
登录 关闭
扫码关注1秒登录
发送“验证码”获取 | 15天全站免登陆