【发布时间】:2020-04-06 09:50:24
【问题描述】:
我从数据分析师的角度总结了有关数据 I/O 的经验教训,而没有受益于数据工程专业知识(并且非常明确地指出了该缺点)。为了给各种备选方案提供上下文,考虑到我店内的限制,我对 XML 导入/导出进行了简单的试验,并完成了有关模式的在线阅读。关于第四代语言环境的开源实用程序,我注意到的一件事是它似乎使用默认值(我没有指定):
<?xml version="1.0" encoding="utf-8"?>
<y>
<DataFrame1>
<DataFrame1_Field1>[75;75;75;75;75;75;75;75;75;...;75;75]</DataFrame1_Field1>
<DataFrame1_Field2>[2014;2014;2015;2015;2016;2016;...;2083;2084;2084;2085;2085;2086;2086]</DataFrame1_Field2>
<DataFrame1_Field3>
<item>ABC</item>
<item>DEF</item>
<...snip...>
<item>00-00</item>
<item>00-00</item>
<item>00-00</item>
</DataFrameP_FieldM>
<DataFrameP_FieldN>[2;2;4;2;5;3;5;3;3;1;5;5;...;4;5;3;3;2;4;2;1;2;4]</DataFrameP_FieldN>
</DataFrameQ>
<DataFrameR>
<DataFrameR_Field1>[75;75;75;75;75;75;...;75;75;75;75;75]</DataFrameR_Field1>
<DataFrameR_Field2>[1;2;3;4;5;6;7;...;1638;1639;1640;1641;1642]</DataFrameR_Field2>
<DataFrameR_Field3>[0;0;0;0;0;0.014925;0.223881;0.014925;...;0;0.059701;0;0;0;0;0;0;0.626866]</DataFrameR_Field3>
</DataFrameR>
<DataFrameS>
<DataFrameS_Field1>[75;75;75;75;75;75;...;75;75;75;75;75;75;75]</DataFrameS_Field1>
<DataFrameS_Field2>[1;1;1;1;1;1;1;...;1642;1642;1642;1642;1642]</DataFrameS_Field2>
<DataFrameS_Field3>[0;0;0;0;0;0;0;0;...;7;0.7;0.7;0.8;0.8;0.8;0.9;0.9;1]</DataFrameS_Field3>
<DataFrameS_Field4>[0;0.1;0.2;...;0;0.1;0.2;0;0.1;0]</DataFrameS_Field4>
<DataFrameS_Field5>[1;0.9;0.8;...;0.3;0.2;0.1;0;0.2;0.1;0;0.1;0;0]</DataFrameS_Field5>
<DataFrameS_Field6>[0;0;0;0;0;0;...1;1;1;1;1;1;1;1;1;1]</DataFrameS_Field6>
</DataFrameS>
</y>
解释标签:所有以字符串“DataFrame...”开头的标签都是我在代码中进行的匿名化处理。在匿名化之前,DataFrameX(其中 X 是任何字母数字字符)是我的 4GL 环境 [1] 中数据框对象的名称。所有包含字符串“DataFrame”和“Field”的标签也是匿名的。在匿名化之前,它们是数据框中的字段名称。标签<y>就是4GL环境下数据帧集合的对象名。
数据的排列对我来说都很有意义,因为我知道我对数据来自的数据帧做了什么。所有的标签都是有意义的。我假设它们来自通用默认模式。但是,我的网络搜索没有发现任何迹象表明存在这种默认模式,更不用说达成一致/标准化了。是否有这样的通用默认值,或者这些标签是导出实用程序作者的结果?
[1] 4GL 环境是 Matlab,但我的问题是关于 XML 实践和约定而不是 Matlab。
【问题讨论】:
标签: xml xsd schema xsd-validation xml-validation