【问题标题】:Data collection frequency strategy数据收集频率策略
【发布时间】:2023-01-25 23:00:25
【问题描述】:

我有一个问题,我想知道是否有人有效地解决了这个问题。我正在开发一个收集器(我们称它为 A)以从源(我们称它为 B)收集数据,该源又从其他地方收集数据。 B每5分钟收集一次,A应该使用什么频率或策略?如果 A 的频率是 B 的两倍,那么它将以一个间隔的重复数据结束。如果它与 B 相同,那么如果收集时间完全相同,它就有可能获得陈旧数据。有人解决了这个问题吗?

【问题讨论】:

    标签: web-scraping google-bigquery data-science bigdata


    【解决方案1】:

    如果有某种时间数据与您从源 B 收集的数据相关联,那么您可以使用它来排除重复结果;您可以将其设置为仅包含具有更新时间戳的新数据。

    我之前通过将日期/时间转换为 Unix 纪元时间戳然后检查最新数据是否具有更大的值,或者忽略它来完成此操作。如果您愿意,这将允许您以两倍于 B 的速率运行数据收集。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-11-14
      • 1970-01-01
      • 2020-08-07
      • 1970-01-01
      • 2012-04-20
      • 2019-03-03
      相关资源
      最近更新 更多