【问题标题】:How to manually control data schema interpretation如何手动控制数据模式解释
【发布时间】:2019-05-14 15:59:37
【问题描述】:

当我从 https://www1.ncdc.noaa.gov/pub/data/uscrn/products/subhourly01/2017/CRNS0101-05-2017-TX_Austin_33_NW.txt 导出公共天气数据时,只要太阳辐射 > 9,我其余列的所有数据都会集中到一个列中,如下所示。我已尝试以 txt 和 csv 格式上传,但问题仍然存在于 excel、sheets 和 dataprep 中。

为什么会这样?

是否有一种编程方式来解决此问题,以便数据按预期填充,每列 1 个值?

【问题讨论】:

    标签: excel pandas csv google-cloud-dataprep


    【解决方案1】:

    很可能是因为初始数据结构没有被正确检测到。如果数据集的第一行与其余行的结构不同,就会发生这种情况。

    要在 Dataprep 中解决此问题,您可以按照以下步骤指示数据集的结构:

    1. 转到流视图
    2. 右键单击数据集并选择“删除结构...”
    3. 打开配方
    4. 插入拆分行步骤:
      • splitrows col: column1 on: '\n'
    5. 使用空格正则表达式拆分列(例如,/\s+/
      • splitpatterns col: column1 type: on on: /\s+/ limit: 22

    (您可以在创建新步骤时将以下命令复制并粘贴到搜索输入中)

    这是您应该得到的:

    注意:导入数据集时也可以阻止初始结构检测。见https://cloud.google.com/dataprep/docs/html/Remove-Initial-Structure_136154971

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-08-26
      • 2013-12-29
      • 2011-09-18
      • 1970-01-01
      • 2011-06-07
      • 2010-10-05
      • 2019-03-30
      • 2011-06-07
      相关资源
      最近更新 更多