【问题标题】:searching and saving specifing links in html code在 html 代码中搜索和保存指定链接
【发布时间】:2012-12-28 22:33:05
【问题描述】:
</div><div class="tr">
  </div><div class="bl">
  </div><div class="br">
  </div>  <img src="http://blablabla.com/medium/blablabla.jpg" />
</div></a>
          </div><div class="meta">
<h3 class="action">
<span>
    <a href="/abc">ABC</a>
  </span> a picture
</h3>        

我将网站的 HTML 源代码保存到 String 中:

  public static BufferedReader read(String url) throws Exception
  {
    return new BufferedReader(
        new InputStreamReader(
            new URL(url).openStream()));
  }

在这段代码中,我想将所有图像 url 保存在一个新的字符串中,该字符串带有 \n,其中包含 /medium/,或者使字符串中的所有图像链接更容易连接 \n。 流程应该如何?提前致谢

【问题讨论】:

  • 我会使用正则表达式来查找网址。

标签: java string search image bufferedreader


【解决方案1】:

您可以使用JSoup 来获取图像标签,并使用简单的String.contains 来获取您要查找的图像标签,而不是尝试自己解析 HTML 内容。

Document doc = Jsoup.connect("http://www.blah.com/foo.html");
for (Element e : doc.select("img")) {
    String imageSrc = e.attr("src");
    if (imageSrc.contains("/medium/")) {
     ...
    }
}

还有avoid using regex to parse HTML

【讨论】:

  • 应该为“Document doc = ..”导入哪个:org.w3c.dom 或 org.jsoup.nodes?我想我必须将 Jsoup.conne.. 类型转换为 (Document)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2011-04-09
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2018-07-26
  • 2019-04-08
  • 1970-01-01
相关资源
最近更新 更多