【问题标题】:Pandas read_html issue with &nbsp&nbsp 的 Pandas read_html 问题
【发布时间】:2021-03-18 20:26:38
【问题描述】:

我正在使用 pandas read_html 读取 html 文件,但遇到了不间断空格的问题。我在结果数据框的一列中有数据,该列应包含类似“ABCDEF G”的字符串(F 和 G 之间的三个空格)。相反,我得到的是“ABCDEF G”(F 和 G 之间的一个空格)。当我检查 html 文件时,它显示“ABCDEF   G”,因此出于某种原因,这三个不间断空格仅更改为一个空格。 html 中的所有单个不间断空格都可以正常工作。有没有办法解决这个问题,让它保留 F 和 G 之间的三个空格?

【问题讨论】:

    标签: python html pandas non-breaking-characters


    【解决方案1】:

    这并不优雅,但现在我正在做

     with open(htmllink, 'r') as r: 
            data = r.read().replace('   ', '___')
    

    然后返回并用三个空格替换下划线。仍在寻找更好的方法来做到这一点,但现在应该可以了。

    【讨论】:

      猜你喜欢
      • 2017-05-17
      • 2017-01-04
      • 2019-12-23
      • 1970-01-01
      • 1970-01-01
      • 2022-11-25
      • 2019-08-17
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多