【问题标题】:htmlunit java - How to parse a content results from javascript? and a htmlunit errorhtmlunit java - 如何解析来自 javascript 的内容结果?和一个 htmlunit 错误
【发布时间】:2019-05-17 02:28:53
【问题描述】:

这是我要抓取的页面之一:https://www.tokopedia.com/berkahcell2/promo-termurah-vr-virtual-reality-box-v-2-0-remote-bluetooth-gamepad/review?src=topads

我想“ulasan terbaru”下的评论文本,我认为这是javascript的结果(虽然我可能错了,我不完全确定如何检查它检查元素),除此之外,我也不确定 HTMLUnit 中的几件事

我已经阅读到 scrape 我需要使用 HTMLUnit 而不是 Jsoup 的 javascript 内容。我已阅读http://htmlunit.10904.n7.nabble.com/Selecting-a-div-by-class-name-td25787.html 以尝试scrape按类对 div 进行评论,但我的输出为零。

    public static void comment(String url) throws IOException{

        WebClient client = new WebClient();
        client.setCssEnabled(true);
        client.setJavaScriptEnabled(true);
        
        try {
            HtmlPage page = client.getPage(url);
            List<?> date = page.getByXPath("//div/@class='list-box-comment'");
            System.out.println(date.size());
            for(int i =0 ; i<date.size();i++){
                System.out.println(date.get(i).asText());
            }
        }
        catch(Exception e){
                e.printStackTrace();
            }

    }

这是我的代码中将处理评论抓取的部分,我做得对吗?但是我有两个问题:

  1. 在“asText()”中说“无法解析方法 asText()”
  2. 即使我在没有“asText()”的情况下运行,我也会将此视为错误:
com.gargoylesoftware.htmlunit.ObjectInstantiationException: unable to create HTML parser
    at com.gargoylesoftware.htmlunit.html.HTMLParser$HtmlUnitDOMBuilder.<init>(HTMLParser.java:418)
    at com.gargoylesoftware.htmlunit.html.HTMLParser$HtmlUnitDOMBuilder.<init>(HTMLParser.java:342)
    at com.gargoylesoftware.htmlunit.html.HTMLParser.parse(HTMLParser.java:203)
    at com.gargoylesoftware.htmlunit.html.HTMLParser.parseHtml(HTMLParser.java:179)
    at com.gargoylesoftware.htmlunit.DefaultPageCreator.createHtmlPage(DefaultPageCreator.java:221)
    at com.gargoylesoftware.htmlunit.DefaultPageCreator.createPage(DefaultPageCreator.java:106)
    at com.gargoylesoftware.htmlunit.WebClient.loadWebResponseInto(WebClient.java:433)
    at com.gargoylesoftware.htmlunit.WebClient.getPage(WebClient.java:311)
    at com.gargoylesoftware.htmlunit.WebClient.getPage(WebClient.java:373)
    at com.gargoylesoftware.htmlunit.WebClient.getPage(WebClient.java:358)
    at ReviewScraping.comment(ReviewScraping.java:86)
    at ReviewScraping.main(ReviewScraping.java:108)
Caused by: org.xml.sax.SAXNotRecognizedException: Feature 'http://cyberneko.org/html/features/scanner/allow-selfclosing-iframe' is not recognized.
    at org.apache.xerces.parsers.AbstractSAXParser.setFeature(Unknown Source)
    at com.gargoylesoftware.htmlunit.html.HTMLParser$HtmlUnitDOMBuilder.<init>(HTMLParser.java:411)
    ... 11 more

我希望我能把所有的评论都显示出来

/edit 我在制作这个时使用 Intellij 作为我的 IDE,并且 HTMLUnit 的依赖项通过使用 Maven 在我的 Intellij 项目结构中

【问题讨论】:

    标签: java htmlunit


    【解决方案1】:

    关于你的代码:

    public static void main(String[] args) throws IOException {
        final String url = "https://www.tokopedia.com/berkahcell2/promo-termurah-vr-virtual-reality-box-v-2-0-remote-bluetooth-gamepad/review?src=topads";
    
        try (final WebClient webClient = new WebClient(BrowserVersion.FIREFOX_60)) {
            webClient.getOptions().setThrowExceptionOnScriptError(false);
    
            HtmlPage page = webClient.getPage(url);
            webClient.waitForBackgroundJavaScript(40_000);
    
            System.out.println(page.asXml());
    
            List<DomNode> date = page.getByXPath("//div[@class='list-box-comment']");
            System.out.println(date.size());
    
            for(int i = 0 ; i < date.size();i++){
                System.out.println(date.get(i).asText());
            }
        }
    }
    

    现在页面本身的问题:

    已经进行了一些测试,看起来页面在真实浏览器中也会产生错误(检查浏览器控制台)。但是使用 HtmlUnit 你会遇到更多问题(可能是因为缺少对某些 javascript 功能的支持)。通常这种页面使用很多很多行的 js 代码——我要弄清楚哪里出了问题真的很费时间。如果您想解决此问题,请尝试找出问题的真正原因(请参阅http://htmlunit.sourceforge.net/submittingJSBugs.html 获取一些提示)并提交错误报告。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-02-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-01-06
      • 2015-11-07
      相关资源
      最近更新 更多