【问题标题】:Why does Beautiful Soup Return filename instead of full link? [duplicate]为什么 Beautiful Soup 返回文件名而不是完整链接? [复制]
【发布时间】:2016-01-16 13:32:51
【问题描述】:

使用下面的简单代码,我面临以下问题:为什么 Beautiful Soup 只返回文件名而不是完整的链接地址?

from bs4 import BeautifulSoup
import urllib2
url = 'http://www.gks.ru/bgd/free/B00_25/IssWWW.exe/Stg/d000/I000650R.HTM'
data = urllib2.urlopen(url).read()
page = BeautifulSoup(data,'lxml')
for link in page.findAll('a'):
       l = link.get('href')
       print l

我得到的都是输出:

I000660R.HTM
I000670R.HTM
I000680R.HTM
I000690R.HTM
I000700R.HTM
I000706R.HTM
I000707R.HTM
I000708R.HTM
I000709R.HTM
000710.HTM
000711.HTM
000712.HTM
000713.HTM
000714.HTM
000715.HTM

【问题讨论】:

  • 大概是因为该页面上的href链接都是相对的。

标签: python-2.7 beautifulsoup


【解决方案1】:

问题解决了,考虑到链接的相关性,我将输出与 url 的根连接起来。谢谢。

【讨论】:

    猜你喜欢
    • 2023-03-12
    • 2019-07-21
    • 2021-12-08
    • 1970-01-01
    • 2016-11-16
    • 2014-11-29
    • 2016-06-08
    • 2020-06-06
    • 1970-01-01
    相关资源
    最近更新 更多