【发布时间】:2014-06-24 19:53:59
【问题描述】:
假设我有很多字符串,比如
“words words words
有没有办法通过python直接将这些转换成它们所代表的字符?
我试过了
h = HTMLParser.HTMLParser()
print h.unescape(x)
但出现此错误:
UnicodeEncodeError: 'ascii' codec can't encode characters in position 0-2: ordinal not in range(128)
我也试过
print h.unescape(x).encode(utf-8)
但它编码
“ 为â
什么时候应该是引号
【问题讨论】:
-
是什么让您认为
“应该是逗号?这是来自哪个网页?将它们转换为它们所代表的字符h.unescape(x)这样做...但是当您尝试打印它时会出现问题...尝试查看它的 repr -
我说引号不是逗号。从上下文中可以清楚地看出这是一个引号,因为它们出现在应该有引号的字符串的开头和结尾。此页面也在“作为 HTML 实体的字符串:”部分中显示了这一点 software.hixie.ch/utilities/cgi/unicode-decoder/…
-
我的错误......好吧,这让我有更多的工作可以等待
标签: python parsing unicode html-parsing ascii