【问题标题】:iterate scraping throught URLS通过 URL 迭代抓取
【发布时间】:2022-07-13 03:43:40
【问题描述】:

我有这段代码,我试图做,但在无效架构上出错

#for index, row in df.iterrows():
  #  print(index,row["Data"])
for offset in (df.apply(lambda row: row["Data"]  , axis = 1)):

    response = requests.get(df["Data"])
    print('url:', response.url)
    

这是我的数据框,它是每页一组链接(每页 10 个)和两个索引,因此它们是 20 个链接。 数据 0 [http://www.mercadopublico.cl/Procurement/Modu... 1 [http://www.mercadopublico.cl/Procurement/Modu...

我想让这段代码每 10 个链接运行一次并抓取它们并获取数据,然后转到 next ,但抓取的数据将在表格中的一组信息上。

但我无法让响应获取数据框内的 url

我收到这条消息

InvalidSchema: No connection adapters were found for '0    [http://www.mercadopublico.cl/Procurement/Modu...\n1    [http://www.mercadopublico.cl/Procurement/Modu...\nName: Data, dtype: object'

你对此有什么建议吗? 最好的问候

我认为这也可以帮助我将两个索引放在一个融合它们,但不知道如何去做,搜索了很多但找不到如何,一些我尝试但没有工作的 np.array 参考。

【问题讨论】:

    标签: python html web-scraping


    【解决方案1】:

    只是为了回答,因为我解决了它,如果您稍后抓取,切勿将 url 存储为数据帧,而不是让数据帧 resultsurl[] 将其存储为列表 resultsurl=list()

    然后在 list() 中对 i 进行迭代,这种情况是 calet resulturl..

    谢谢

    【讨论】:

      猜你喜欢
      • 2016-11-18
      • 2019-04-29
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-10-25
      • 1970-01-01
      • 2021-09-25
      • 1970-01-01
      相关资源
      最近更新 更多