【问题标题】:Unable to detect a unicode in R无法在 R 中检测到 unicode
【发布时间】:2018-10-16 11:40:14
【问题描述】:

在 R 中,我们试图检测复选框和复选框。完整的PDF通过pdftools包读取并以dataframe的形式存储。

复选框以“U+F0A8”字符的形式存储(删除了包含字符“U+F0A8”的符号,因为它在符号中不可见)在执行字符串检测或gref函数或只是打印这些字符不会被检测到或打印。请帮忙。我已附上截图供参考。

如果您需要更多详细信息,请告诉我。提前致谢。

【问题讨论】:

  • 为您的问题添加一些数据。你想要的输出是什么?
  • 我们需要查看源 PDF 和代码,以便您阅读它。
  • 抱歉 PDF 文件是机密文件...

标签: r string nlp text-mining


【解决方案1】:

尝试使用fixed,这样它只比较字节:

str_detect(String(splitted_query_text_AA[70,1]), fixed("<U+F0FE>"))

【讨论】:

    【解决方案2】:

    我找到了解决这个问题的方法。

    字符串(splitted_query_text_AA[77,1]) (2) 计划年份

    stri_enc_isutf16be(splitted_query_text_AA[77,1]) [1] 是的

    stri_escape_unicode(splitted_query_text_AA[77,1]) [1]“(2)\uf0fe计划年”

    str_detect(stri_escape_unicode(splitted_query_text_AA[77,1]), "uf0fe") [1] 是的

    谢谢

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-11-26
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多