【问题标题】:How to use Javascript in a Node.js app to get external webpage info/webscraping?如何在 Node.js 应用程序中使用 Javascript 来获取外部网页信息/网页抓取?
【发布时间】:2018-05-30 20:18:10
【问题描述】:

我正在使用适用于 Node.js 的 Twit API,并将我的代码托管在 Heroku 上,这是它当前运行的地方。我遵循了 Daniel Shiffman 的教程:http://shiffman.net/a2z/twitter-bots/http://shiffman.net/a2z/bot-heroku/

我希望我的机器人转到 https://en.wikipedia.org/wiki/Special:Random 并“获取”标题。然后我会将标题作为推文发布。经过一番研究,我似乎想做一些叫做 webscraping 的东西。假设 wiki 页面的标题位于 head 的 html 文件中的 title 标记中。有谁知道我如何访问该网址并获取我需要的信息?我不知道从哪里开始。 stackoverflow 上的搜索结果让我找到了关于使用 jquery 和 yahoo api 的过时答案。 javascript 中的解决方案会很有帮助,所以我知道它与 heroku 兼容

【问题讨论】:

    标签: javascript node.js heroku twitter


    【解决方案1】:

    你可以用Puppeteer,从谷歌来做的,看看

    Github

    Article

    【讨论】:

    • 谢谢你。它工作得很好。正是我想要的。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-08-28
    • 1970-01-01
    • 1970-01-01
    • 2012-10-03
    • 2021-04-26
    相关资源
    最近更新 更多