【发布时间】:2014-06-21 21:17:14
【问题描述】:
我注意到,当我使用 Beautiful Soup 从 Web 获取 HTML 时,它会发生某种变化。这是我用来获取它的代码:
from bs4 import BeautifulSoup
import requests
url ="http://www.basketnews.lt/lygos/59-nacionaline-krepsinio-asociacija/2013/naujienos.html"
r = requests.get(url)
soup = BeautifulSoup(r.text)
print soup
这是原始 HTML 的一部分:
<a href="/news-73149-valanciunui-ir-raptors-sezonas-baigtas-foto-statistika.html">Valančiūnui ir Raptors sezonas baigtas <span class="title_description">(foto, statistika)</span></a>`
这是与 Beautiful Soup 相同的 HTML 部分:
<a href="/news-73149-valanciunui-ir-raptors-sezonas-baigtas-foto-statistika.html">ValanÄiÅ«nui ir âRaptorsâ sezonas baigtas <span class="title_description">(foto, statistika)</span></a>
您会看到我正在解析的 HTML 中的文本是如何混乱的。问题出在哪里?
【问题讨论】:
-
我认为您粘贴的代码中还有一些额外的`
标签: python beautifulsoup python-requests