【问题标题】:Stream Analytics job reference data join creating duplicates流分析作业参考数据加入创建重复项
【发布时间】:2018-04-14 19:50:23
【问题描述】:

我正在使用流分析来加入流数据(通过 IoT 中心)和参考数据(通过 Blob 存储)。参考数据 blob 文件每分钟使用最新数据生成,格式为“filename-{date} {time}.csv”。参考 blob 文件数据在 Azure 机器学习函数中用作 SA 作业中的参数。流分析作业的输出(到 Azure SQL 或 Power BI)似乎生成了多行,而不是为 Azure 机器学习函数的输出生成一行,每一行用于来自先前 blob 文件的参数值。我的理解是它应该只使用最新的 blob 文件内容,但看起来它正在使用所有 blob 文件并从 AML 输出生成多行。这是我正在使用的查询:

选择 AMLFunction(Ref.Input1, Ref.Input2), * FROM IoTInput 流 LEFT JOIN RefBlobInput Ref ON Stream.DeviceId = Ref.[DeviceID]

如果查询或文件路径需要更改以避免重复记录,请您提出建议?谢谢

【问题讨论】:

    标签: azure azure-stream-analytics stream-analytics


    【解决方案1】:

    要仅使最新文件生效,您需要将文件存储在特定的文件夹结构中。

    如果你有记录,每当你选择参考数据文件作为流输入时;流输入对话框要求您提供文件夹结构以及日期和时间格式。

    Stream 总是从最新的 {date}/{time} 文件夹中搜索参考文件。即你需要像这样存储你的文件,

    2018-01-25/07:30/filename.json (YYYY-MM-DD/HH-mm/filename.json)

    注意:在这里,您的时间文件夹每分钟都必须是唯一的。同样,日期文件夹对于每个日期都必须是唯一的。每当您创建新文件时,请在新的时间戳文件夹和当前日期文件夹下创建它。

    您可以使用流输入支持的任何日期时间格式。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2023-03-20
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多