【发布时间】:2020-06-09 05:43:48
【问题描述】:
使用 K-means 聚类模型通过 BigQuery ML 检测异常。
数据集信息
date Date
trade_id INT
trade_name STRING
agent_id INT
agent_name String
total_item INT
映射 - 一个交易有多个基于日期的代理。
由sum(total_iteam) 使用以下信息训练的模型
trade_id
trade_name
agent_id
agent_name
Number of cluster: 4
需要根据日期查找每个交易和代理的异常情况。
使用给定的数据集训练模型并计算 distance_from_closest_centroid。每个交易和代理都基于日期距离被调用。最右距离被视为异常。使用这些信息
问题 1.如何找到模型需要使用的簇数(例如:用于选择最小簇数选择的肘法)。
问题 2. 每天新增交易数据时如何建立模型。可以每天构建模型的增量方式。
【问题讨论】:
-
根据文档,如果您使用 K-means 省略
num_clusters,BigQuery ML 将根据训练数据中的行数选择一个合理的数量。此外,您还可以使用超参数调整来确定最佳集群数量。因此,您必须针对num_clusters的不同值运行CREATE MODEL查询,找到误差度量并选择误差最小的点link。 -
另外,请注意num_clusters 从 2 变为 100。这两个信息对您有帮助吗?
-
@AlexandreMoraes 感谢您提供信息。这真的很有帮助。
-
您介意我总结一下我分享的信息作为答案吗?因此,它将为社区做出更多贡献。
-
@AlexandreMoraes 嗨。我对构建模型有疑问(构建模型的增量方式)。我已经编辑了我的问题,请看-谢谢
标签: machine-learning google-bigquery