【问题标题】:Using Jsoup to extract text from HTML, but returned left and right quotation mark chars使用Jsoup从HTML中提取文本,但返回左右引号字符
【发布时间】:2017-11-17 06:15:33
【问题描述】:

所以我使用 Jsoup 从 html 片段中提取了一些文本,如下所示:

<font style="font-family:Times New Roman" size="2">BHI Finance LLC (“BHI Finance”)</font>

注意左右引号。我在 Java 中将此文本存储在 String 中:

Element firstEntry = row.select("td").first();
String toAdd = firstEntry.select("font").text();

String toAdd 打印为 BHI Finance LLC (?BHI Finance?)

转换为 int 时的两个问号字符分别是 147 和 148,我发现它们是(某些?)html char 编码上的左右引号。我的问题是如何让 Jsoup 将左右引号解析为 regualar ascii 引号?

【问题讨论】:

    标签: java html string character-encoding jsoup


    【解决方案1】:

    看起来不像是解析问题。更有可能的是,无论您使用什么来显示解析的内容,都无法正确显示这些字符。

    最简单的可能就是替换它们:

    toAdd = toAdd.replaceAll("[“”]", "\"");
    

    【讨论】:

    • 嗨!所以我只是使用 System.out.println(toAdd) 并且我尝试了这个并且它没有工作,它仍然给我字符代码 147 和 148(在标准 ascii 中实际上并不存在)
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-07-26
    • 1970-01-01
    • 1970-01-01
    • 2020-04-29
    • 1970-01-01
    • 2015-05-08
    相关资源
    最近更新 更多