【发布时间】:2018-01-01 09:52:31
【问题描述】:
我确实想从<meta charset="UTF-8"/> html 文档中获取数据,但对 html 和编码了解不多。
这是我要获取的刺:
<title>Tom & Jerry » The First Adventure</title>
我的代码中读取它的部分是这样的:
title = tree.xpath('//title/text()')[0]
但它只会获取 'Tom' 作为名称/变量 title
如果 HTML 标题是
<title>Tom & Jerry » The First Adventure</title>
它只会获取 Tom & Jerry
我怀疑答案是排序,但我不知道如何搜索它。我需要做什么才能获取 Tom & Jerry » The First Adventure?
【问题讨论】:
-
我认为 xpath 方法是内置的,但是由于您的评论,我对此进行了更多尝试,发现它来自 lxml 并且工作正常。如上所述,问题出在代码的其他地方。
-
这是一个问答网站。请添加正确的答案。不要通过编辑问题来提供“答案”。另请参阅stackoverflow.com/help/self-answer。