【发布时间】:2017-08-27 00:04:53
【问题描述】:
我的问题可能是微不足道的。我使用 MPI 库并行化了 CFD 代码,现在我正在尝试调查我的并行效率。首先,我创建了一个案例,该案例将在等级之间提供相等的负载,并且计算量与传输数据的比率恒定。因此,我的期望是,当我增加等级时,任何运行时变化都将仅归因于通信延迟。但是,我意识到不调用等级通信的子例程(因此它们只进行域计算,因此它们处理所有等级的相同负载)贡献显着——实际上是最大的运行时间增加。我在这里想念什么?这甚至有意义吗?
【问题讨论】:
-
可能应该发布重现您的问题的代码。你可以edit它进入你的问题。
-
如果您的应用程序是内存绑定的,那么同一个套接字上的所有排名将共享相同的内存带宽。这可以解释效率下降
-
对不起 Cody Gray,但由于工业产权问题,我无法分享代码
标签: c performance parallel-processing mpi cdf