【问题标题】:Web scraping getting every string after href links网页抓取在href链接之后获取每个字符串
【发布时间】:2021-06-03 21:53:11
【问题描述】:

我正在尝试使用 beautifulsoup 在 rottentomatoes 的文章中抓取电影标题。但是,电影标题位于每部电影页面的 href 链接之后。这是我想要得到的:

<a href="https://www.rottentomatoes.com/m/the_shape_of_water_2017/">The Shape of Water</a> 我只想获取文本“水的形状”我可以获取此文本,但这仅适用于一部电影。我想对同一页面上的所有电影执行此操作,并且每部电影,链接的最后一部分都会更改。谁能告诉我该怎么做,我是网络抓取的初学者?

【问题讨论】:

    标签: web-scraping beautifulsoup href


    【解决方案1】:
    html_doc = """<a href="https://www.rottentomatoes.com/m/the_shape_of_water_2017/">The Shape of Water</a>"""
    
    from bs4 import BeautifulSoup
    soup = BeautifulSoup(html_doc, 'html.parser')
    
    for x in soup:
        print(x.text) # The Shape of Water
    

    在beautifulsoap中,当你想获取标签的文本时,只需将text与标签一起使用

    【讨论】:

    • 我编辑了这个问题。链接的最后一部分是电影的名称,我在问如何在同一页面上获取每部电影的电影标题文本。
    • 当标签中给出电影“水形物语”的名称时,您不需要从链接中提取,只需获取网站上的所有链接并提取文本即可跨度>
    • 这不起作用,因为并非所有链接都在这些文本之前。有很多我不想要的链接。
    • 然后只需获取href链接并在“/”的基础上将其拆分并获取列表中的-2元素
    • 我尝试了你所说的,The Broadway Melody [More] Anita Page Bessie Love Charles King Jed Prouty Harry Beaumont The Greatest Show on Earth [More] Betty Hutton Cornel Wilde Charlton Heston James Stewart Cecil B. DeMille 这是结果的一个示例部分。这里包含每部电影和演员,但我只想要电影标题。我怎样才能做到这一点?电影标题是“[更多]”上方的文字
    猜你喜欢
    • 1970-01-01
    • 2021-04-07
    • 1970-01-01
    • 2017-05-29
    • 2020-08-08
    • 1970-01-01
    • 1970-01-01
    • 2015-04-10
    • 2021-03-01
    相关资源
    最近更新 更多