【问题标题】:How to pin threads to cores with predetermined memory pool objects? (80 core Nehalem architecture 2Tb RAM)如何将线程固定到具有预定内存池对象的内核? (80 核 Nehalem 架构 2Tb RAM)
【发布时间】:2013-08-06 02:14:16
【问题描述】:

在使用 2Tb DRAM 的 80 核 (160HT) nehalem 架构上运行一些测试后,我遇到了一个小的 HPC 问题:

具有超过 2 个套接字的服务器开始大量停止(延迟),因为每个线程开始请求有关“错误”套接字上的对象的信息,即请求来自正在处理一个套接字上的某些对象的线程提取实际在另一个插槽上的 DRAM 中的信息。

尽管我知道它们正在等待远程套接字返回请求,但内核似乎已 100% 使用。

由于大多数代码是异步运行的,因此重写代码要容易得多,因此我可以将消息从一个套接字上的线程解析到另一个线程(无锁定等待)。 此外,我想将每个线程锁定到内存池,这样我就可以更新对象而不是在垃圾收集器上浪费时间(~30%)。

因此问题:

如何在 Python 中通过预先确定的内存池对象将线程固定到内核?

更多上下文:

当您将 ZeroMQ 放在中间并在每个 ZMQworker 管理的内存池之间传递消息时,Python 运行多核是没有问题的。在 ZMQ 的 8M 消息/秒下,对象的内部更新需要的时间比管道可以填充的时间长。这都在这里描述:http://zguide.zeromq.org/page:all#Chapter-Sockets-and-Patterns

因此,稍微简化一下,我生成了 80 个 ZMQworkerprocesses 和 1 个 ZMQrouter 并使用大量对象(实际上是 5.84 亿个对象)加载上下文。 从这个“起点”开始,对象需要进行交互才能完成计算。

这就是想法:

  • 如果“对象 X”需要与“对象 Y”交互并且在 python-thread的本地内存池,然后交互 应该直接做。
  • 如果“对象 Y”在同一个池中不可用,那么我希望它 通过 ZMQrouter 发送消息并让路由器返回一个 在稍后的某个时间点做出响应。我的架构是非阻塞的,所以在特定的 python 线程中发生的事情只会继续,而无需等待 zmqRouters 响应。即使对于同一个套接字上但在不同内核上的对象,我也不希望进行交互,因为我更喜欢干净的消息交换,而不是让 2 个线程操作同一个内存对象。

为此,我需要知道:

  1. 如何确定给定 python 进程(线程)的套接字 继续运行。
  2. 如何将特定套接字上的内存池分配给 python 进程(一些 malloc 限制或类似限制,以便内存池的总和不会将内存池从一个套接字推到另一个)
  3. 我没有想到的事情。

但是我在 python 文档中找不到有关如何执行此操作的参考,并且在谷歌上我一定是在寻找错误的东西。

更新:

关于“为什么在 MPI 架构上使用 ZeroMQ?”的问题,请阅读以下主题:Spread vs MPI vs zeromq?,因为我正在开发的应用程序是为分布式部署而设计的,即使它是在 MPI 架构上进行测试的。 比较合适。

更新 2:

关于问题:

“如何在 Python(3) 中将线程固定到具有预定内存池的内核”答案在 psutils

>>> import psutil
>>> psutil.cpu_count()
4
>>> p = psutil.Process()
>>> p.cpu_affinity()  # get
[0, 1, 2, 3]
>>> p.cpu_affinity([0])  # set; from now on, this process will run on CPU #0 only
>>> p.cpu_affinity()
[0]
>>>
>>> # reset affinity against all CPUs
>>> all_cpus = list(range(psutil.cpu_count()))
>>> p.cpu_affinity(all_cpus)
>>>

worker 可以与内核挂钩,从而可以有效地利用 NUMA(查找您的 CPU 类型以验证它是 NUMA 架构!)

第二个元素是确定内存池。这也可以使用psutilsresource library

【问题讨论】:

  • 你能用更多的上下文解释你的问题吗?我会天真地回答 Python 进程不能运行多核,所以你必须在这里谈论 80(或 160)个独立进程。可以实现将它们固定到特定的核心,例如在 Linux 上使用 taskset(请参阅 man tasklet)。
  • zeromq 允许您放弃所有超线程上的工作负载,但这并不意味着创建的内存对象会自动保留在每个线程中。
  • 好的。到目前为止,一切都很好。我发现使用 python Threading 我可以将内存锁定到 Threading.local()。现在我只需要将线程固定到核心。这是 C 还是内核作业?

标签: python multithreading threadpool hpc ipython-parallel


【解决方案1】:

只是想知道这是否不适合使用 python 远程对象 - 这可能值得调查,但不幸的是我无法访问此类硬件。

正如documentation 中所解释的,虽然 pyro 通常用于在网络上的多台机器之间分配工作,但它也可用于在单台机器上的内核之间共享处理。

在较低级别上,Pyro 只是一种进程间通信形式。因此,在 Python 组件之间使用更原始形式的 IPC(例如普通 TCP/IP 套接字)的任何地方,您都可以考虑使用 Pyro。

虽然 pyro 可能会增加一些开销,但它可能会加快速度并且应该使事情更易于维护。

【讨论】:

  • 你能详细解释一下你的想法吗?
【解决方案2】:

你可能低估了这个问题,没有超级简单的方法可以完成你想要的。作为一般准则,您需要在操作系统级别工作以按照您想要的方式进行设置。您想要使用所谓的“CPU 亲和性”和“内存亲和性”,您需要认真考虑您的系统架构和软件架构,以使事情正确。在真正的 HPC 中,命名的“关联性”通常由 MPI 库处理,例如 Open MPI。您可能需要考虑使用一个,并让该 MPI 库处理您的不同进程。操作系统、MPI库和Python之间的接口可以由mpi4py包提供。

您还需要了解线程和进程的概念以及操作系统设置。虽然对于 CPU 时间调度程序,线程是要调度的任务,因此理论上 可能 具有单独的亲和性,但我只知道整个进程的亲和性掩码,即一个进程中的所有线程。对于控制内存访问,NUMA(非统一内存访问)是正确的关键字,您可能需要查看http://linuxmanpages.com/man8/numactl.8.php

在任何情况下,您都需要阅读有关亲和力主题的文章,并且可能希望开始阅读 Open MPI 常见问题解答中有关 CPU/内存亲和力的内容: http://www.open-mpi.de/faq/?category=tuning#paffinity-defs

如果您想在不使用 MPI 库的情况下实现目标,请查看您的 Linux 发行版的包 util-linuxschedutilsnumactl,以获得有用的命令行工具,例如 taskset,你可以例如从 Python 内部调用,以便为某些进程 ID 设置关联掩码。

这篇文章似乎生动地描述了 MPI 库如何帮助您解决问题:

http://blogs.cisco.com/performance/open-mpi-v1-5-processor-affinity-options/

这个 SO 答案描述了您如何将硬件架构一分为二:https://stackoverflow.com/a/11761943/145400

一般来说,我想知道您正在应用的机器是否适合该任务,或者您是否可能在错误的一端进行优化。如果您在一台机器上发送消息并达到内存带宽限制,我不确定 ZMQ(通过 TCP/IP,对吗?)是否是执行消息传递的正确工具。回到 MPI, 用于 HPC 应用程序的消息传递接口......

【讨论】:

  • 感谢您的详细回答。浏览这些链接需要一些时间。
  • 你做出决定了吗?
  • MPI 库是 的去处。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2017-12-07
  • 2014-04-06
  • 1970-01-01
  • 2012-05-21
  • 2014-04-12
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多