【问题标题】:How to interpret lag vs current variable scatter plots如何解释滞后与当前变量散点图
【发布时间】:2016-06-21 08:22:53
【问题描述】:

我对统计数据和时间序列非常陌生,我正在按照本教程 (http://www.johnwittenauer.net/a-simple-time-series-analysis-of-the-sp-500-index/) 进行时间序列分析。所以,我得到了具有第一个数据差异的固定时间序列,所以我没有采用任何对数第一差异。 (见附件)。我还创建了一个滞后 1440 的滞后变量,因为我的数据分辨率为 1 分钟(每分钟服务器的事务计数),因此我想使用前一天的数据来预测第二天。出于这个原因,我绘制了滞后 1440 与滞后 0 变量的散点图,我似乎无法解释该图。在我看来,它是每周共同相关的,但有人可以确认吗?

另外,我确实尝试了 scipy.stats.stats 中的 pearsonr 函数,它返回 (nan, 1.0),而 numpy.corrcoef() 返回所有 nan 矩阵。

非常感谢任何帮助。

提前致谢。

【问题讨论】:

  • 我认为这个问题在这里大多是题外话,因为解释散点图与编程无关(这更适合crossvalidated。但是,你得到 nans 可能被认为是一个编程问题. 无论如何,我会尽力帮助解决这两点。1. 散点图中的数据看起来与我完全不相关。您可以在某一天获得接近 0 的值,而在前一天,所以几乎没有任何预测可能。(但一天非常高的值不太可能对应于前一天非常高的值。)

标签: python numpy scipy time-series correlation


【解决方案1】:

在这里,我将回答您问题的第二部分 - 与编程相关的部分(关于散点图的解释,请参阅我对问题的评论)。

2. 获得 nans 相关的事实可能是由于数据中有 nans 或其他无效值。事实上,第二个时间序列(在 7 月刻度后的第 3 个峰值之前)有一个短暂的差距。这样的差距通常表示 nans。

如果数据中有此类无效值(nan、inf 等),它们通常会传播到相关性等汇总统计信息。

解决方案取决于手头的问题。您可以尝试跳过时间序列中缺少值的部分,也可以尝试将其替换为默认值(例如 0)。

【讨论】:

  • 嗨。感谢您的快速回复。好吧,我确实做了 df.dropna() 来删除 nan 值。我确实有“0”值,那会引起问题吗?这是我尝试将第一个差异与那些不产生“inf”值的差异联系起来的时候
  • 0 值不应导致 Korrelation 中的 nan,除非整个信号为 0。
  • 不,从图中可以看出,整个信号看起来很完美。会不会是因为缺分?我删除了具有 nan 或 0 值的时间戳
猜你喜欢
  • 2020-06-27
  • 2018-11-27
  • 1970-01-01
  • 1970-01-01
  • 2015-11-01
  • 2012-08-19
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多