【问题标题】:Machine Learning model to parse webpage data and extract fields用于解析网页数据和提取字段的机器学习模型
【发布时间】:2020-08-03 11:42:54
【问题描述】:

我需要从不同的网站提取通用数据。就像我想抓取 100 个活动网站并提取相同的信息,如活动名称、价格、位置等。每个网站都有不同的布局,所以我正在手动编写抓取规则。有一些像 diffbot 这样的服务可以自动提取它。他们正在使用某种 AI/ML 模型。我想知道这是否可以是命名实体任务,或者可以使用 LSTM。

【问题讨论】:

    标签: python machine-learning web-scraping nlp named-entity-recognition


    【解决方案1】:

    如果没有关于目标网站结构/格式的更多详细信息,很难给出一个通用的答案。

    如果这些主要是基于文本的(即自然文本不是半结构化的表格和所有),那么它似乎是命名实体的经典信息提取 (IE)。 LSTM 是一种可以用于此的架构,就像 spacy 中的架构一样。许多其他经典的 NLP 库,如 stanfordNLP 也可以使用(并不总是与深度学习一起使用)。

    如何选择?这取决于这些页面中的语言类型。如果它是更自然的英语,那么 DL 模型可能会更好。如果这是一个领域术语(需要学习的小数据集),您可能需要研究更多基于语法的分析。

    【讨论】:

      【解决方案2】:

      要添加到之前的响应,请不要忘记检查您抓取的网站是否有 API,这可以大大减少编码时间,并且如果网站更改其布局,则更加可靠。

      您可能已经检查过了,但提醒一下也无妨。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2019-07-17
        • 1970-01-01
        • 2016-04-12
        • 1970-01-01
        • 2012-10-31
        • 2017-01-14
        • 1970-01-01
        • 1970-01-01
        相关资源
        最近更新 更多