【问题标题】:How to generalize sequence based models with 100k data samples?如何用 100k 数据样本泛化基于序列的模型?
【发布时间】:2019-01-10 00:34:34
【问题描述】:

我们有一个数据集,其中包含超过 40 万的唯一用户以及他们在网站中一年中的访问天数,如下所示。值可以在 1 到 365 之间变化。

{
U1:[3,6,28,57,128,129,247,289,...],
U2:[18,77,81,179,340,...],
U3:[192,195,289,298,310,376,...],
U4:[93],
...
...
U400k:[54,97,164,167,250,...]
}

我们有四年的类似数据集。我们希望为个人用户预测一年中的第二天用户可能会再次访问该网站。我在考虑如何推广基于序列的模型;但欢迎任何其他想法。那么有人知道我们如何解决这个问题吗?

【问题讨论】:

  • 这太宽泛了。你在代码方面尝试过什么,你到底卡在哪里?
  • 我们一直在寻找解决这个问题的正确方法。我们最初考虑的是基于序列的模型,与上面显示的序列有天的差距。
  • 您可以从一年中的某一天向数据集添加更多特征,例如季节、月份、工作日/周末、假日。这有助于识别用户的趋势。

标签: python machine-learning time-series sequence prediction


【解决方案1】:

1) 一种方法是对数据进行分类/聚类并在组级别进行分析。 (动态时间序列扭曲或聚类技术)。

如果您想在用户级别进行分析,则构建所有 100K 时间序列。

2) 我觉得根据你所拥有的数据,无法预测用户会在哪一天来到现场。您可以通过时间序列算法预测明年的访问量。然后使用访问次数到他可能会来的时间。

3)您还可以尝试 Facebook 的预言机模型用于时间序列预测 esp build 用于预测现场访问量。

https://machinelearningstories.blogspot.com/2017/05/facebooks-phophet-model-for-forecasting.html

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-10-02
    • 2010-11-23
    • 1970-01-01
    • 2016-09-02
    • 2015-12-30
    • 2022-11-13
    • 2013-05-07
    • 2021-02-06
    相关资源
    最近更新 更多