【问题标题】:extract all "ul a" entities from html page that have a certain String in the "title"从“标题”中具有特定字符串的html页面中提取所有“ul a”实体
【发布时间】:2015-06-30 23:37:34
【问题描述】:

this page 上的示例风格中,我试图根据维基百科的消歧页面了解特定名称可以应用于特定人员的所有含义。

问题在于维基百科页面高度不统一。

一个共同的特点是,名称列表将作为链接a 的一部分出现在ul 元素中,并且在链接的title= 组件中将引用我们的名称寻找。因为这些是相关维基百科页面的链接。

使用 jsoup 或其他方法,我如何识别这些组件?

h2:contains(people) + ul a

^这适用于它们都在标题为People 的部分中,但正如我所提到的,情况并非总是如此。

也许在伪代码中我们可以这样做:

ul a && title contains *String*

可能是这样的:

a[href], [title]

但只匹配标题的一部分,而不是整个内容。


This 是一个非常非结构化页面的示例,其中需要调用这种方法。

This 是一个不重要的例子。

但我正在尝试制作一些可普遍适用的东西,以同样适用于这两种类型。

【问题讨论】:

    标签: html regex parsing jsoup wikipedia


    【解决方案1】:

    这种作品:

            Elements linx = docx.select("a:contains(Corzine)");
    
            for (Element linq : linx) 
            {
                System.out.println(linq.text());
            }
    

    但也许你们中的一个人可能会找到更好的解决方案。

    【讨论】:

      猜你喜欢
      • 2014-12-16
      • 1970-01-01
      • 2012-12-19
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-06-03
      • 2021-04-10
      • 2018-02-02
      相关资源
      最近更新 更多