【发布时间】:2018-07-06 07:26:29
【问题描述】:
使用下面的代码,并尝试在 href 末尾找到值。有没有办法提取href,并在BeutifulSoup/Regex 中找到page= 之后的值?
from bs4 import BeautifulSoup
import requests
import json
import re
request = requests.get('https://www.goodreads.com/quotes/tag/fun?page=1')
soup = BeautifulSoup(request.text, 'html.parser')
findNext = soup.find("a", class_="next_page")
print(findNext)
得到这个输出:
<a class="next_page" href="/quotes/tag/fun?page=2" rel="next">next »</a>
注意:要从上述或任何其他可能出现的数字中提取2。
【问题讨论】:
-
所以获取
href值,然后使用re获取等号右侧的任何内容。 -
re.find('page=(\d+)',findNext['href']) -
你可以将其拆分成一个数组,然后选择数组中的最后一项!
标签: javascript python html regex beautifulsoup