【发布时间】:2011-06-14 07:33:03
【问题描述】:
我正在尝试为个人项目抓取一些日本网站。正如您所期望的那样,带有 UTF-8 文本的站点工作得非常好,但是我无法从指定其他国际编码(特别是 EUC-JP)的站点中获取任何文本。节点似乎也在解释文本并执行修改而不是原始传递它 - 我尝试将响应设置为同时解释为 ascii 和二进制,然后将我的终端应用程序设置为 EUC-JP,但在做了 @ 987654321@,两者都不是实际文本。
我浏览了 Node 文档,它似乎只支持两种主要的文本编码(二进制和 base64 除外。)
我正在使用内置的 http 客户端,并通过 response.setEncoding 方法指定编码,例如response.setEncoding('utf8');
其他人如何在 Node 中处理国际文本(尤其是在原始数据不是 UTF-8 的情况下?)二进制缓冲区是唯一的方法吗?
虽然我做了一些研究,但我对字符编码的了解并不多,因此我们将不胜感激。谢谢!
【问题讨论】:
标签: javascript node.js unicode character-encoding internationalization