【发布时间】:2022-06-20 14:19:54
【问题描述】:
我在算法中使用斯坦福 CoreNLP 模型,其中包括服务器的 Java 客户端 (StanfordCoreNLPClient),以便通过命令行或其 Web 服务与用 Java 编写的 CoreNLP 进行交互。因此,Stanford CoreNLP 开发了一个名为 Stanza 的 Python 包,其中包括一个向 Stanford CoreNLP 服务器发出请求的 API。
该模型在笔记本电脑和我的个人电脑上运行良好。 但是,我没有设法在 AWS EMR 集群上安装节,我总是遇到以下我无法处理的错误:
因此,我尝试使用另一个 python 包来使用 Stanford CoreNLP 服务器,而我设法在我的 AWS EMR 上安装的唯一一个是 PyNLP (https://github.com/sina-al/pynlp),它是 Stanford CoreNLP 的 Python 包装器新浪。同样,它在笔记本电脑和我的个人计算机上运行良好,但这次我设法将它(pypi 库)安装在 EMR 集群上。 但是,每当我实例化一个 StanfordCoreNLP 对象时,我都会收到以下错误:“HTTPConnectionPool(host='127.0.0.1', port=9000): Max retries exceeded with url: /?properties=%7B%22serializer% 22%3A+%22edu.stanford.nlp.pipeline.ProtobufAnnotationSerializer%22%2C+%22outputFormat%22%3A+%22serialized%22%2C+%22annotators%22%3A+%22entitymentions%22%7D(由NewConnectionError('
关于信息,我可以通过在 AWS EMR 集群上运行的算法连接到互联网,因为我可以使用“请求”模块并执行 requests.get ...,效果很好。
谁能解释我为什么在 AWS EMR 上出现此错误,而不是在笔记本电脑或我的个人计算机上? AWS EMR 上的端口是否被阻止?我该怎么做才能让它发挥作用?
提前感谢您的宝贵帮助!!!
【问题讨论】:
-
从错误消息看来,设备上没有剩余空间。什么卷附加到您的 EMR?你使用什么实例?也许你觉得 this SO answer 或 this AWS post 有帮助
标签: amazon-web-services stanford-nlp amazon-emr stanza