【问题标题】:Newspaper3k returns 0 articles from archive.org waybackmachine pages whereas the live page works as expectedNewspaper3k 从 archive.org waybackmachine 页面返回 0 篇文章,而实时页面按预期工作
【发布时间】:2017-12-19 12:58:42
【问题描述】:

当尝试在 archive.org 的存档页面 url 上使用 python 库报纸3时,它无法获取任何文章。但是,当在同一个实时页面 url 上使用它时,它可以正常工作。请看下面:

import newspaper

len(newspaper.build('https://bbc.co.uk/news').articles)
>> 111

len(newspaper.build('https://web.archive.org/web/http://www.bbc.co.uk/news').articles)
>>> 0

即使使用返回原始修改页面的特殊id hack 也不起作用:

len(newspaper.build('https://web.archive.org/web/20171219030622id_/http://www.bbc.co.uk/news').articles)
    >>> 0

任何帮助将不胜感激,谢谢!

【问题讨论】:

    标签: python python-newspaper


    【解决方案1】:

    我没有发现任何迹象表明该库旨在与 archive.org 一起使用,或者它与 archive.org 一起使用。

    [1][2] 的来源列表均未提及 archive.orgweb.archive.org

    我下载了整个repository 来搜索源代码,其中也没有提到任何一个 Internet Archive 域。

    据我所知,this filearticles 属性基于 RSS/ATOM 提要。我不认为 Internet Archive 会归档这些内容,即使这样做,由于它们会链接回网站的实时版本,因此需要对库本身进行一些更改才能使它们与 Internet Archive 一起使用。

    You've already opened an issue,您在其中指定它根本不起作用(即使在单篇文章上 - 这可能是其他地方的问题,例如在它用来决定哪些节点包含文章的节点评分算法中)所以如果你不想深入库源代码并自己修复它,你所能做的就是等待。

    【讨论】:

    • 目前有 139 个未解决的问题,可以肯定地说,我的特定问题永远不会得到解决。感谢您尝试提供帮助。
    • @Derek Right...我真的认为为您完成此请求需要向 Newspaper3k 提出冗长的拉取请求,这超出了 Stack Overflow 问题的范围。我相信我已经根据我上面的答案找到了如何解决这个问题的一般方法,但实际操作取决于你。
    • 谢谢 Fred,我只是对为了得到我需要的东西而需要做的工作有点恼火,你的回答是正确的。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-04-29
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2019-09-27
    • 1970-01-01
    相关资源
    最近更新 更多