【问题标题】:In Trifacta or Google Cloud Dataprep, i'm trying to flag rows with non alpha numeric (�). What formula do I use?在 Trifacta 或 Google Cloud Dataprep 中,我试图用非字母数字 (�) 标记行。我用什么公式?
【发布时间】:2020-04-28 06:52:54
【问题描述】:

在 Trifacta 或 Google Cloud Dataprep 中,我尝试用非字母数字 (�) 标记行。我用什么公式? 试过这个公式,但不起作用

Replace Matches of `�` from EMPLOYEE_FIRST with NOT VALID

【问题讨论】:

  • 请详细说明没有用。

标签: google-cloud-platform google-cloud-dataprep trifacta


【解决方案1】:

你能解释一下“不起作用”是什么意思吗?

以下步骤适用于 Dataprep。您可以将其直接粘贴到新建步骤向导中:

replacepatterns col: EMPLOYEE_FIRST with: 'NOT VALID' on: `�` global: true

如果这对您不起作用,您能否发布一个屏幕截图,说明添加(或尝试添加)此步骤后发生的情况?

【讨论】:

  • 尝试此步骤后没有任何变化。带有“�”的相同值出现在预览列上。我想用 "�" 标记 EMPLOYEE_FIRST 列中的那些行。如果“�”存在,我也在尝试寻找一个布尔公式将其标记为真
  • 好吧,我只是在免费牧马人上复制了我的初始结果。我正在使用一个非常简单的 CSV 数据集。您的输入数据集的类型是什么?它是如何编码的?导入时是否修改了编码?
  • 这是一个来自第三方的简单 txt 文件,我正在尝试使用云数据准备对其进行转换。 .txt 文件中的实际值为“Ñ”。将数据集导入dataprep时,值变为“�”
  • 我创建了一个文本文件,其中仅包含 Ñ 的实例。它在 Dataprep 中表现得很好。但是,当我重新导入文件并将编码更改为 US-ASCII 时,它显示为所有 � 字符。这就是我询问编码的原因,并提到在导入期间更改编码(请参阅指定后的编辑设置要导入的文件)。默认情况下,Dataprep 使用 UTF-8 导入,但有一些干扰。也许您可以通过在导入期间使用编码来解决此问题。
  • 我应该补充一点:如果没有进展,请考虑向 Trifacta (support@trifacta.com) 提交支持请求。包括指向此线程的链接以获取上下文,以及 Dataprep 的版本(单击设置 => 关于)以及您的示例数据集(如果可能)。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2016-04-16
  • 2011-03-27
  • 1970-01-01
  • 2015-05-22
  • 2014-04-26
  • 1970-01-01
相关资源
最近更新 更多