【发布时间】:2011-06-27 11:04:20
【问题描述】:
我有一个脚本需要在被 lxml.HTML() 读取以进行解析之前确定字符集。如果找不到它,我将假设 ISO-8859-1(这是正常的假设字符集吗?),并在 html 中搜索具有 charset 属性的元标记。但是我不确定最好的方法。我可以尝试使用 lxml 创建一个 etree,但我不想读取整个文件,因为我可能会遇到编码问题。但是,如果我不阅读整个文件,我将无法构建 etree,因为某些标签不会被关闭。
我是否应该只找到带有一些花哨字符串下标的元标记并在找到它或读取一定数量的行后跳出循环?也许使用低级别的 HTML 解析器,例如 html.parser?顺便说一句,使用 python3,谢谢。
【问题讨论】:
标签: python html python-3.x html-parsing