【发布时间】:2017-11-05 10:45:41
【问题描述】:
我必须从 HTML 页面中提取特定单词并计算该单词被重复的次数。我如何在 python 中使用漂亮的汤来做到这一点?如何在汤中传递 url 然后数单词?
这是我到目前为止的代码。我不知道下一步该做什么。
import bs4 as bs
import urllib.request
source = urllib.request.urlopen('https://pythonprogramming.net/parsememcparseface/').read()
soup = bs.BeautifulSoup(source,'lxml')
for paragraph in soup.find_all('p'):
print(paragraph.string)
print(str(paragraph.text))
【问题讨论】:
-
您要提取的这些词是什么?
-
现在问这个问题还为时过早。继续学习。
-
@cᴏʟᴅsᴘᴇᴇᴅ 我正在尝试提取单词 Internet 和计算机。你能帮帮我吗?
-
嗯,这并不难。尝试多用谷歌搜索。提示:使用带有
text属性的soup.find_all。
标签: python python-3.x beautifulsoup