【问题标题】:nvidia-smi process hangs and can't be killed with SIGKILL eithernvidia-smi 进程挂起,也不能用 SIGKILL 杀死
【发布时间】:2017-05-20 05:37:45
【问题描述】:

我使用的是 Ubuntu 14.04,CUDA 工具包 8,驱动程序版本 367.48

当我发出nvidia-smi 命令时,它只是无限期挂起。 当我再次登录并尝试杀死nvidia-smi 进程时,例如kill -9 <PID>,它并没有被杀死。 如果我给出另一个 nvidia-smi 命令,我会发现两个进程都在运行 - 当然是从另一个 shell 登录时,因为它像以前一样卡住了。

可能是与驱动程序有关的问题吗? 这不是最新的,但仍然很新..

【问题讨论】:

  • 这不是一个真正的答案,但很高兴知道问题消失了,删除 367 驱动程序并通过 apt 软件包再次安装,该软件包附带 361.93.02 Nvidia 驱动程序的版本。
  • 这也发生在我身上。我想知道一个处于运行状态的进程如何不能被 SIGKILL 杀死?
  • @Reith 有一些特殊的进程状态是内核无法终止的:init 进程、僵尸进程和不间断的休眠进程(这些只有在某个 IO 资源可用时才会唤醒)。这些只能通过关机/重启来杀死。

标签: linux linux-device-driver nvidia


【解决方案1】:

鉴于您的特殊情况,我会按照 bio 的建议尝试重新安装它。

你试过sudo kill -9 <PID>吗?你可能有但仍然把它放在那里。或者,也许做sudo kill -15 <PID> 来终止它。鉴于您告诉我们的内容,这看起来好像您的驱动程序陷入了signal 1 挂断。

nvidia-smi 在运行时会自发挂起似乎很奇怪,但问题可能在于未正确安装或无法以超级用户访问权限运行。

你试过用吗:

service nvidia-smi status pgrep nvidia-smi ps -aux | grep nvidia-smi

获取其当前状态?

无论如何,希望这会有所帮助。我会尝试卸载并重新安装或使用sudo apt --fix-broken 尝试修复损坏的包/驱动程序。

干杯!

【讨论】:

    【解决方案2】:

    我通过每次启动

    解决了这个问题

    sudo nvidia-smi -pm 1

    上述命令启用持久性模式。这个问题已经影响 nvidia 驱动程序两年多了,但他们似乎对修复它并不感兴趣。这似乎与电源管理问题有关,在系统启动一段时间后,如果nvidia-persistenced 服务启用了no-persistence-mode 选项,GPU 会省电,nvidia-smi 命令会挂起等待在设备上再次赋予它控制权的东西

    【讨论】:

    • 谢谢。我会接受你的回答,因为它看起来足够详细,但我现在无法测试它。我想我还是会接受它:D
    • 谢谢。即使使用驱动程序版本:410.79 和 CUDA 10,问题仍然存在。我需要 wakeonlan 来启动和停止带有 RTX2080 egpu 的 T480。大多数情况下,nvidia-persistenced 服务挂起,只有物理关机才会终止服务。在我的 nvidia-persistenced 服务中,没有启用 no-persistence-mode 选项。这个nvidia持久化服务真的是一团糟,默认是不行的。
    猜你喜欢
    • 2012-01-31
    • 2014-03-19
    • 1970-01-01
    • 2018-10-16
    • 1970-01-01
    • 2012-03-12
    • 2014-05-18
    • 2013-04-26
    • 1970-01-01
    相关资源
    最近更新 更多