【问题标题】:Indefinite daemonized process spawning in PythonPython中无限期的守护进程生成
【发布时间】:2012-01-15 13:01:39
【问题描述】:

我正在尝试构建一个 Python 守护程序来启动其他完全独立的进程。

一般的想法是对于给定的 shell 命令,每隔几秒钟轮询一次,并确保该命令的 k 个实例正在运行。我们保留一个 pidfiles 目录,当我们轮询时,我们删除那些 pids 不再运行的 pidfiles 并启动(并为其创建 pidfiles),但我们需要访问其中的 k 个进程。 p>

子进程也需要完全独立,这样如果父进程死了,子进程就不会被杀死。根据我的阅读,似乎没有办法使用 subprocess 模块来做到这一点。为此,我使用了这里提到的sn-p:

http://code.activestate.com/recipes/66012-fork-a-daemon-process-on-unix/

我做了一些必要的修改(你会看到附加的 sn-p 中注释掉的行):

  1. 原始父进程无法退出,因为我们需要启动器守护进程无限期地持续存在。
  2. 子进程需要以与父进程相同的 cwd 开始。

这是我的 spawn fn 和一个测试:

import os
import sys
import subprocess
import time

def spawn(cmd, child_cwd):
    """
    do the UNIX double-fork magic, see Stevens' "Advanced 
    Programming in the UNIX Environment" for details (ISBN 0201563177)
    http://www.erlenstar.demon.co.uk/unix/faq_2.html#SEC16
    """
    try: 
        pid = os.fork() 
        if pid > 0:
            # exit first parent
            #sys.exit(0) # parent daemon needs to stay alive to launch more in the future
            return
    except OSError, e: 
        sys.stderr.write("fork #1 failed: %d (%s)\n" % (e.errno, e.strerror))
        sys.exit(1)

    # decouple from parent environment
    #os.chdir("/") # we want the children processes to 
    os.setsid() 
    os.umask(0) 

    # do second fork
    try: 
        pid = os.fork() 
        if pid > 0:
            # exit from second parent
            sys.exit(0) 
    except OSError, e: 
        sys.stderr.write("fork #2 failed: %d (%s)\n" % (e.errno, e.strerror))
        sys.exit(1) 

    # redirect standard file descriptors
    sys.stdout.flush()
    sys.stderr.flush()
    si = file('/dev/null', 'r')
    so = file('/dev/null', 'a+')
    se = file('/dev/null', 'a+', 0)
    os.dup2(si.fileno(), sys.stdin.fileno())
    os.dup2(so.fileno(), sys.stdout.fileno())
    os.dup2(se.fileno(), sys.stderr.fileno())

    pid = subprocess.Popen(cmd, cwd=child_cwd, shell=True).pid

    # write pidfile       
    with open('pids/%s.pid' % pid, 'w') as f: f.write(str(pid))
    sys.exit(1)

def mkdir_if_none(path):
    if not os.access(path, os.R_OK):
        os.mkdir(path)

if __name__ == '__main__':
    try:
        cmd = sys.argv[1]
        num = int(sys.argv[2])
    except:
        print 'Usage: %s <cmd> <num procs>' % __file__
        sys.exit(1)
    mkdir_if_none('pids')
    mkdir_if_none('test_cwd')

    for i in xrange(num):
        print 'spawning %d...'%i
        spawn(cmd, 'test_cwd')
        time.sleep(0.01) # give the system some breathing room

在这种情况下,一切似乎都很好,即使父进程被杀死,子进程也会继续存在。但是,我仍然遇到原始父母的产卵限制。大约 650 次生成后(不是同时,子进程已经完成),父进程因错误而窒息:

spawning 650...
fork #2 failed: 35 (Resource temporarily unavailable)

有没有办法重写我的 spawn 函数,以便我可以无限期地生成这些独立的子进程?谢谢!

【问题讨论】:

  • 您的工艺表是什么样的? ps aux 是否显示了一大堆等待收割的僵尸进程? (我在第一个分叉的孩子上没有看到wait() 的任何代码。)
  • 我想是的:pastebin.com/qDrFmHWk
  • 考虑使用 pyinotify 来监控目录中的变化而不是轮询。

标签: python fork subprocess daemon spawn


【解决方案1】:

我稍微修改了您的代码,并且能够运行 5000 个进程而没有任何问题。因此,我同意@sarnold 的观点,即您遇到了一些基本限制。我的修改是:

proc = subprocess.Popen(cmd, cwd=child_cwd, shell=True, close_fds=True)    
pid = proc.pid

# write pidfile       
with open('pids/%s.pid' % pid, 'w') as f: f.write(str(pid))
proc.wait()
sys.exit(1)

【讨论】:

  • 切换到:pid = subprocess.Popen(cmd, cwd=child_cwd, shell=True, close_fds=True).pid,但仍然失败:spawning 647... fork #2 failed: 35 (Resource temporarily unavailable) spawning 648... fork #1 failed: 35 (Resource temporarily unavailable)
  • close_fds 与信号设置相结合对我来说非常有效!
【解决方案2】:

感谢your list of processes 我愿意说这是因为您遇到了许多基本限制之一:

  • rlimit nproc 允许给定用户执行的最大进程数 -- 有关每个用户进程限制的详细信息,请参阅 setrlimit(2)bash(1) ulimit/etc/security/limits.conf
  • rlimit nofile 允许给定进程一次打开的最大文件描述符数。 (每个新进程可能会在 父进程 中为子进程的 stdinstdoutstderr 描述符创建三个新管道。)
  • 系统范围的最大进程数;见/proc/sys/kernel/pid_max
  • 系统范围内打开文件的最大数量;见/proc/sys/fs/file-max

因为您没有收割死去的孩子,所以这些资源中的许多资源的开放时间都超过了应有的时间。 init(8) 正在妥善处理您的第二个孩子——他们的父母已经死了,所以他们被重新安置到 init(8)init(8) 将在他们之后清理 (wait(2))当他们死去的时候。

但是,您的程序负责在 first 子集之后进行清理。 C 程序通常为SIGCHLD 安装一个signal(7) 处理程序,该处理程序调用wait(2)waitpid(2) 来获取子进程的退出状态,从而从内核内存中删除其条目。

但是脚本中的信号处理有点烦人。如果您可以将SIGCHLD 信号处置显式设置为SIG_IGN,内核将知道您对退出状态不感兴趣,并将为您收割孩子_。

尝试添加:

import signal
signal.signal(signal.SIGCHLD, signal.SIG_IGN)

靠近程序顶部。

请注意,我不知道这对Subprocess 有什么作用。它可能不高兴。如果是这种情况,那么您需要 install a signal handler 为您拨打 wait(2)

【讨论】:

  • 子进程假设处理 SIGCHLD 魔法。结合 close_fds 它应该可以解决某些版本的 python 中的错误(参见bugs.python.org/issue4216)。
  • 信号设置和 close_fds 在 OSX 和 Ubuntu 上为我解决了这个问题!轻松完成 50k 进程。谢谢你们!
  • @ILYA:如果Subprocess 被用于创建所有进程,它可能会正常工作;但在这种情况下,一半的流程是手工创建的。
猜你喜欢
  • 2019-08-03
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-05-14
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多