【发布时间】:2020-02-27 04:09:36
【问题描述】:
机器学习库的最低要求是能够推断现实世界机器学习应用程序中大量字段的类型(例如:2,000)。
真实世界的机器学习应用程序存在于管道中。字面意思是:UNIX/Linux 风格的 fifoq 中的管道,通过管道符号连接的命名管道。不是在以第三方语言编写并编译的文档中称为“管道”的抽象。这些管道通常是类型化的(与一般情况一样,不是模板化的),并且与 UNIX/Linux 管道相关的所有工具都在运行时推断类型。
这些工具允许动态生成 csv 字段和类型并将其扩展为超出手动编码单个文件容量的任意宽度。
因此,再次强调,ML 库的最低要求是它能够打开 ML 文件,而不会在 ML 工程师可以使用 GNU 工具推出整个系统时将工作时间表交给他 + Python 在相同的时间内。
这意味着推断可能动态生成且快速变化的 CSV 文件中大量字段的类型。理想情况下,相同的二进制控制台应用程序可用于演进或开发管道的各个阶段的 CSV 数据,因此无需注释字段类型和重新编译。
我正在审查 ML.NET 数据 IO 系统,以及 F# 的 CsvProvider 和 C# 的可用 CSV 库。我还在审查 CLR/CLI 互操作,因为我可以构建 C++ CSV 推理系统,但 CLR/CLI VS 模板似乎只能在 Windows 平台上工作。
似乎无法加载具有推断的基本类型(日期时间、双精度、整数、字符串)的 CSV。这是一个准确的评估吗?
【问题讨论】:
标签: ml.net