【发布时间】:2014-02-08 14:35:18
【问题描述】:
我看了几天这个错误,看起来 htmlParse 函数在解析俄语符号时存在编码问题。
例如:
htmlParse("http://ru.wikipedia.org/wiki/Russia", encoding="UTF-8")
此页面采用 UTF-8 编码,但可以肯定的是,我正致力于 htmlParse 以 UTF-8 对其进行编码。
但在 htmlParse() 输出中,英文符号是正确编码的,但俄语看起来是典型的错误编码符号。
我使用的是 Windows 8,我的语言环境是 Russian_Russia.1251。我认为非 Unicode 语言环境是这里的问题,因为当我在 Ubuntu 中使用此命令时,一切都按预期工作,但 Ubuntu 具有 en_EN.UTF-8 语言环境。
【问题讨论】:
标签: r html-parsing