【发布时间】:2021-12-04 16:36:51
【问题描述】:
我创建了一个日志接收器来捕获我们项目中使用的组件生成的日志。 下面给出了接收器的详细信息:
gcloud logging sinks describe test-project-instance-activity
bigqueryOptions:
usePartitionedTables: true
usesTimestampColumnPartitioning: true
createTime: '2021-10-17T05:15:48.434334305Z'
description: test sink to capture the instance activities
destination: bigquery.googleapis.com/projects/test-project/datasets/test_logging
filter: |-
resource.type = cloud_composer_environment OR
resource.type = cloud_dataproc_cluster OR
resource.type = gce_disk OR
resource.type = gce_vm_instance OR
resource.type = gke_container OR
resource.type = k8s_cluster
name: test-project-instance-activity
updateTime: '2021-10-17T05:15:48.434334305Z'
writerIdentity: serviceAccount:p121-639060@gcp-sa-logging.iam.gserviceaccount.com
我正在大查询数据集中捕获日志详细信息,该数据集已创建以下表列表:
SELECT table_id FROM `test-project.test_logging`.__TABLES__;
我检查并发现大多数表格都包含 INFO 日志,并且它们为围绕这些 google API 发生的任何活动生成了大量数据。我们真的需要这么多信息日志吗?排除或过滤它们的最佳方法是什么?
Exclusion filter(s):
resource.type="container"
severity="INFO"
根据谷歌文档:日志在被 Logging API 接收后被排除
这是否意味着我只能保存保存排除的 INFO 日志条目的空间.. 例如 gcs 或 bq。
或者我是否需要更改我的应用程序代码以减少有关日志记录的报告。或者可以在 airflow.cfg 文件上更改某些内容。
任何指向 sqls 的指针来分析这些日志表?
只是一个摘要:以防万一。我们正在运行气流 dags 以将 gcs 存储桶数据摄取到 bq 并使用 spark 对它们进行一些聚合,我们每天每 15 分钟摄取大量数据。
请建议尽量减少和降低日志记录成本。我们每个月都会生成大量日志。
我们是否也会为 _Default 日志存储桶付费?如果我禁用它,我会错过什么。
【问题讨论】:
标签: google-cloud-platform google-cloud-logging