【发布时间】:2015-10-29 22:35:45
【问题描述】:
我正在将 CSV 文件从 S3 加载到 Redshift。此 CSV 文件是包含 PageUrl 的分析数据(例如,可能在查询字符串中包含用户搜索信息)。
它在有单双引号字符的行上阻塞,例如,如果有一个 14" 玩具的页面,那么 PageUrl 将包含:
http://www.mywebsite.com/a-14"-toy/1234.html
可以理解,Redshift 无法处理此问题,因为它需要一个结束双引号字符。
我认为我的选择是:
- 预处理输入并删除这些字符
- 在 Redshift 中配置 COPY 命令以忽略这些字符,但仍会加载行
- 将 MAXERRORS 设置为较高的值并使用单独的进程清除错误
选项 2 会很理想,但我找不到!
如果我不够努力,还有其他建议吗?
谢谢
邓肯
【问题讨论】:
-
我知道这是一年前的事了,但是有什么更新可以找到#2 的答案吗?
标签: amazon-web-services csv amazon-redshift