【发布时间】:2022-01-24 06:35:35
【问题描述】:
我一直在尝试使用 requests 模块从 webpage 获取表格内容。但是,当我执行下面的脚本时,除了该表中可用的结果之外,我得到了一些乱码:
import requests
from bs4 import BeautifulSoup
link = 'https://cityofdavid.secure.force.com/?productId=01t0600000AE2dR&lang=en_us'
with requests.Session() as s:
s.headers['User-Agent'] = 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.150 Safari/537.36'
resp = s.get(link)
soup = BeautifulSoup(resp.text,"lxml")
for item in soup.select("table.table > tbody > tr"):
data = [i.text for i in item.select("td")]
print(data)
当前结果:
["{{timeForTour.TourStartTime__c | date: 'dd/MM/yyyy' : '200'}}", '{{timeForTour.TourStartHour__c }}', '{{timeForTour.EndTime__c}}', '{{timeForTour.Number_Of_Participants_Left__c}}', '\nSelect\n\n']
['{{price.Name}}', '{{price.Field1__c}}', '\n\n\n', '{{(price.quantity)? price.Field1__c*price.quantity:0}}', 'NIS']
['{{item.Name}}', '{{item.Field1__c}}', '{{item.quantity}}', '{{item.quantity*item.Field1__c}}', 'NIS']
预期结果(截断):
24/01/2022 10:00 11:00 15
24/01/2022 12:00 13:00 15
24/01/2022 14:00 15:00 15
24/01/2022 16:00 17:00 15
PS 这是landing page,我单击book a tour 按钮以获取上述请求中的链接。
【问题讨论】:
标签: python python-3.x web-scraping beautifulsoup python-requests