【发布时间】:2017-07-05 08:19:38
【问题描述】:
我正在尝试从 HTML 页面获取确切的文本,但输出文本与预期文本不同。
HTML 页面上的文本
Салнас 14
beautifulSoup 的文字展示
ĐĄĐ°ĐťĐ˝Đ°Ń 14
我的代码是
page = BeautifulSoup(url.read(),'html.parser')
page.find(id='tdo_11').text
div 的 HTML 检查代码
<td class="ads_opt" id="tdo_11" nowrap=""><b>Салнас 14</b></td>
我不明白是什么原因造成的? 我应该使用不同的解析器吗?
【问题讨论】:
-
您是否尝试过更改文本编码?
-
您需要找出页面使用的字符编码,例如UTF8。
-
对我来说这似乎是一个编码问题。您是否尝试过使用页面使用的字符编码对文本进行编码?
-
你能给我们页面的URL吗?
标签: python beautifulsoup html-parser