【发布时间】:2015-09-15 16:38:55
【问题描述】:
为了简化我的任务,假设我想在某个网页中找到用希伯来语写的任何单词。
所以我知道希伯来字符代码是U+05D0 到U+05EA。
我想写这样的东西:
expr = "[\u05D0-\u05EA]+"
url = "https://en.wikipedia.org/wiki/Category:Countries"
web_handle = urllib2.urlopen(url)
website_text = website_handle.read()
matches = sre.findall(exp, website_text)
for item in matches:
print item
我期望的输出是:
用语
但输出却是很多中文/日文字符。
【问题讨论】:
-
@stribizhev 它什么也找不到。也许我应该改用 HTML 代码?