【发布时间】:2023-03-22 02:04:02
【问题描述】:
我有一个工作流程,可以获取用户在keywords.csv 中指定的关键字。然后,它开始对带有作为搜索 url 的一部分迭代的关键字的页面进行搜索查询。这在以前很容易,因为我可以使用 url 参数li=100000 在一个页面上显示所有结果。他们改变了它,所以我必须获取单个页面并从那里提取它。
问题是,我是 talend 的新手,从同事那里得到了这个工作流程。这是概述,执行旧的 li=100000 并将所有结果写入单独的文本文件(keyword_1.txt、keyword_2.txt、....):
这是来自工作门户网站 absolventa 的示例查询:
http://www.absolventa.de/stellenangebote?query%5Bcity%5D=&query%5Bradius%5D=100&query%5Btext%5D=SAP&utf8=%E2%9C%93
我现在的问题是——如何在 talend 中添加函数来抓取 page1,然后抓取所有指定关键字的 page 2。并将其添加到我的流程中。请解释低级别,因为我是 Talend 的新手。
非常感谢您!
【问题讨论】:
标签: java parsing talend web-crawler