【问题标题】:"Exception in thread "main" java.lang.NullPointerException" error when running web scraper program运行网络爬虫程序时出现“线程“主”java.lang.NullPointerException 中的异常”错误
【发布时间】:2013-10-12 18:08:08
【问题描述】:

我对网络抓取还很陌生,对 Java 的了解有限。

每次我运行这段代码时,我都会收到错误:

Exception in thread "main" java.lang.NullPointerException

    at sws.SWS.scrapeTopic(SWS.java:38)
    at sws.SWS.main(SWS.java:26)
Java Result: 1
BUILD SUCCESSFUL (total time: 0 seconds)

我的代码是:

import java.io.*;

import java.net.*;

import org.jsoup.Jsoup;

import org.jsoup.nodes.Document;

public class SWS
{

    /**
     * @param args the command line arguments
     */
    public static void main(String[] args)
    {
        scrapeTopic("wiki/Python");

    }

    public static void scrapeTopic(String url)
    {
        String html = getUrl("http://www.wikipedia.org/" + url);



        Document doc = Jsoup.parse(html);

        String contentText = doc.select("#mw-content-text > p").first().text();

        System.out.println(contentText);


    }


    public static String getUrl(String Url)
    {
        URL urlObj = null;

        try 
        {
            urlObj = new URL(Url);

        }

        catch(MalformedURLException e)
        {
            System.out.println("The url was malformed");

            return "";
        }


        URLConnection urlCon = null;

        BufferedReader in = null;

        String outputText = "";

        try
        {
            urlCon = urlObj.openConnection();

            in = new BufferedReader(new InputStreamReader(urlCon.getInputStream()));
             String line = "";

             while ((line = in.readLine()) != null)
             {
                 outputText += line;

             }

             in.close();
        }

         catch(IOException e)
         {
             System.out.println("There was a problem connecting to the url");

             return "";

         }

        return outputText;



    }

}

我一直盯着我的屏幕有一段时间了,需要帮助!

提前致谢。

【问题讨论】:

  • SWS.java:38 是哪一行?

标签: java web screen-scraping jsoup


【解决方案1】:

在以下代码中:

 String contentText = doc.select("#mw-content-text > p").first().text()

如果doc.select("#mw-content-text > p") 没有找到任何与查询匹配的元素并返回一个empty 元素,在此类元素上调用first() 应该给出NullPointerException

查看Element.selectElements.first()的jsoup文档页面

【讨论】:

  • 一种合理的可能性,尽管如我的回答中所述,在运行 OP 的代码时并没有发生这种情况。不知道谁投反对票或为什么投反对票,但请投赞成票!
  • 感谢您的支持。可能对于您的情况,它正在成功读取 html 文档,这意味着 OP 可能在 urlConnection 上失败。
【解决方案2】:

在这一行

doc.select("#mw-content-text > p").first().text();

你的 doc.select 显然没有找到任何东西,所以它返回 null。然后在 null 上调用 first() 方法,这就是它以错误结尾的原因。

【讨论】:

  • 我也是这么想的。
  • 赞成以补偿毫无根据的反对票。虽然实际上, select 不返回 null 而是一个空元素。仍然是合理的怀疑。
【解决方案3】:

您的代码完全符合我的要求。

为了调试和诊断其他答案是否指出可能的错误,您最好使用一些临时变量并在调试器中逐步执行代码。

public static void scrapeTopic(String url)
{
    String html = getUrl("http://www.wikipedia.org/" + url);
    Document doc = Jsoup.parse(html);

    Elements select = doc.select("#mw-content-text > p");
    Element first = select.first();
    String contentText = first.text();

    System.out.println(contentText);
}

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-09-30
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-04-14
    • 2021-05-06
    相关资源
    最近更新 更多