【发布时间】:2017-03-13 16:35:34
【问题描述】:
我正在为我们的内部文件格式(二进制序列化)实现一个自定义 U-SQL 提取器。它在“原子”模式下运行良好:
[SqlUserDefinedExtractor(AtomicFileProcessing = true)]
public class BinaryExtractor : IExtractor
如果我关闭“Atomic”模式,看起来 U-SQL 会在随机位置拆分文件(我猜只是 250MB 块)。这对我来说是不能接受的。文件格式有一个特殊的行分隔符。我可以在我的提取器中定义一个自定义行分隔符并为其启用并行性吗?从技术上讲,如果有帮助的话,我可以将我们的行分隔符更改为新的分隔符。 有人可以帮我解决这个问题吗?
【问题讨论】:
标签: azure-data-lake u-sql