【问题标题】:Matlab: Explicit or named association of `splitapply` arguments with table VariableNamesMatlab:`splitapply`参数与表变量名称的显式或命名关联
【发布时间】:2018-05-08 12:35:07
【问题描述】:

我一直在硬着头皮研究 Matlab 中执行常见 SQL 操作所需的额外代码和簿记。下面是一个典型的 SQL 代码模式示例,用于生成汇总数据表 tDat 的指标:

SELECT vGrouping, MEAN( x - y ) AS rollup1, VAR(y+z) AS rollup2
INTO tRollups FROM tDat GROUP BY vGrouping

我的 SQL 有点生疏,但是 SQL 用户应该清楚大致的想法。这是 Matlab 的等价物:

% Create test data
tDat = array2table( floor(10*rand(5,3)) , ...
                    'VariableNames',{'x','y','z'} );
tDat.vGrouping = ( rand(5,1) > 0.5 )

% Calculate summary metrics for each group of data
[vGroup,grps] = findgroups(tDat.vGrouping)
fRollup = @(a,b,c)[ mean(a-b) var(b+c) ] % Calculates summary metric
rollups = splitapply( fRollup, tDat(:,{'x','y','z'}), vGroup )

% Code pattern 1 to assemble results
tRollups = [ array2table( grps , 'VariableNames',{'group'} ) ...
             array2table( rollups , ...
                          'VariableNames',{'rollup1','rollup2'} ) ]

% Code pattern 2 to assemble results
tRollups = array2table( [grps rollups], ...
                        'VariableNames',{'group','rollup1','rollup2'} )

这不是一个公平的比较,因为 Matlab 代码包含数据设置,以及用于组装汇总指标的两种可能的代码模式。此外,我还添加了 cmets——不是为了让 Matlab 代码变得更冗长,而是因为它非常繁忙,需要一些认知路标来帮助阅读。

除了代码量之外,让我烦恼的一件事是fRollup 中的汇总表达式没有明确与输入或输出数据列的名称相关联。参数是虚拟参数,来自tDat 的实际输入数据列在splitapply 调用中指定。与 fRollup 参数的关联是位置关联的,因此字段/变量名称本身无法强制执行正确关联。同样,tRollups 中的输出列在 array2table 调用中指定,再次在位置上与fRollup 输出相关联。

这使得 SQL 语句中相当简单的关系很难在 Matlab 代码中看到。是否有没有这个缺点的替代模式或设计习惯,但希望不会对其他缺点产生太大影响?

后注: 出于某种原因,即使以下内容不能解决 splitapply 输入/输出参数与实际输入/输出变量的命名/显式关联,我仍然发现它更容易看关系。代码肯定看起来不那么嘈杂。关键是用于生成数据摘要指标的函数fRollup 现在返回多个输出,而不是将它们捆绑到单个阵列输出中。这允许我将标量 struct ssRollups 的属性显式命名为分配的目标。我不需要对表格进行各种转换,使用额外的代码来指定VariableNames,只是为了将结果与已识别的组连接起来。相反,组标识开始只是作为grps 的另一个属性struct (ssRollups) 与splitapply 结果相同——事实上,它是第一个带来struct 存在。

% File tmp.m
%-----------
function tmp

   % Create test data
   tDat = array2table( floor(10*rand(5,3)) , ...
                       'VariableNames',{'x','y','z'} );
   tDat.vGrouping = ( rand(5,1) > 0.5 )

   % Find the groups
   [ vGroup, ssRollups.grps ] = findgroups(tDat.vGrouping)

   % Calculate summary metrics for each group of data
   [ ssRollups.rollup1 ssRollups.rollup2 ] = ...
      splitapply( @fRollup, tDat(:,{'x','y','z'}), vGroup );

   % Display use nice table formatting
   struct2table( ssRollups )

end % function tmp

function [rollup1 rollup2] = fRollup(a,b,c)
   rollup1 = mean(a-b);
   rollup2 = var(b+c);
end % function fRollup

不过,作为一个多输出函数,fRollup 似乎更适合非匿名函数。对我来说,它实际上似乎更好地记录了多个输出,尽管代码不太紧凑。这可能只是更紧凑的可读性更差的情况之一,导致数据关系更难查看。但是,它确实需要将整个代码段落制成一个函数(在这种情况下为tmp),除非您不介意将fRollup 分解为它自己的函数和m 文件。我不喜欢在我的文件系统中乱扔那些本来打算在一个地方使用的微型 sn-p 函数。

【问题讨论】:

  • 我建议你看一下groupsummary函数,但如果你需要计算非标准指标,我担心这不能满足你的需求。
  • 我认为你是对的,我是 SOL。此处说明的组汇总功能只是一个示例。我正在寻找一种使关系更容易看到的通用方法。此外,doc groupsummary 在我的 Matlab 2015b 中没有任何结果。我在网上找到了帮助页面,但它没有指定它首次亮相的版本。有趣的是,我似乎记得提供该信息的 Matlab 文档。
  • 您可以在文档页面底部找到它Introduced in R2018a
  • 噢!怎么可能错过它,特别是因为我正在寻找它的底部区域。谢谢。

标签: sql matlab


【解决方案1】:

此“答案”不直接处理实际输入/输出变量与提供给splitapply 的函数句柄的参数之间的显式命名关联。但是,它显着简化了初始示例中的代码,希望可以更清楚地看到函数参数和输入/输出变量之间的关系。此解决方案最初包含在问题的AFTERNOTE 中。由于似乎不会很快出现更好的答案,因此我决定将其作为答案。它使用dealsplitapply 实现匿名多输出函数,以用于由其分组参数描述的数据组。

% Create test data
tDat = array2table( floor(10*rand(5,3)) , ...
                    'VariableNames',{'x','y','z'} );
tDat.vGrouping = ( rand(5,1) > 0.5 )

% Find the groups
[ vGroup, ssRollups.grps ] = findgroups(tDat.vGrouping)

% Calculate summary metrics for each group of data
fRollup = @(a,b,c) deal( mean(a-b), var(b+c) )
[ ssRollups.rollup1 ssRollups.rollup2 ] = ...
   splitapply( fRollup, tDat(:,{'x','y','z'}), vGroup );

% Display use nice table formatting
struct2table( ssRollups )

在出现更好的解决方案之前,这种方法将是我对splitapply 的首选习惯用法。

这是一个变体,它使用表变量作为splitapply 的输出。这在使用多个分组变量时可能更方便,因为findgroups 会将分组变量名称传递给 LHS 上的输出变量 tRollups

% Create test data
tDat = array2table( floor(10*rand(8,3)) , ...
                    'VariableNames',{'x','y','z'} );
tDat = [ tDat ...
         array2table( rand(8,2)>0.5 , ...
                      'VariableNames',{'vGrpng1','vGrpng2'} ) ];

% Find the groups
[ vGroup, tRollups ] = findgroups(tDat(:,{'vGrpng1','vGrpng2'}));

% Calculate summary metrics for each group of data
fRollup = @(a,b,c) deal( mean(a-b), var(b+c) )
[ tRollups.rollup1 tRollups.rollup2 ] = ...
   splitapply( fRollup, tDat(:,{'x','y','z'}), vGroup );

tRollups

这是一个使用多个分组变量并使用标量结构而不是表来输出findgroupsplitapply 的版本:

% Create test data
tDat = array2table( floor(10*rand(8,3)) , ...
                    'VariableNames',{'x','y','z'} );
tDat.vGrpng1 = rand(8,1)>0.5 ;
tDat.vGrpng2 = rand(8,1)>0.5

% Find the groups
[ vGroup, ssRollups.vGrpng1, ssRollups.vGrpng2 ] = ...
    findgroups( tDat.vGrpng1, tDat.vGrpng2 );

% Calculate summary metrics for each group of data
fRollup = @(a,b,c) deal( mean(a-b), var(b+c) )
[ ssRollups.rollup1 ssRollups.rollup2 ] = ...
   splitapply( fRollup, tDat(:,{'x','y','z'}), vGroup );

% Display using nice table formatting
struct2table( ssRollups )

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-09-13
    相关资源
    最近更新 更多