【发布时间】:2011-07-13 20:25:05
【问题描述】:
我正在通过创建一个小程序来学习 C#,但找不到类似的帖子(如果此答案发布在其他地方,请道歉)。
我如何对网站进行屏幕抓取以获取 PDF 链接(然后我可以将其下载到指定位置)?有时一个页面会有一个链接到另一个具有实际 PDF 链接的 HTML 页面,所以如果在第一页上找不到实际的 PDF,我希望它自动查找在“PDF”中包含“PDF”的链接链接的文本,然后在生成的 HTML 页面中搜索真正的 PDF 链接。
我知道我可能可以通过 google 搜索文件类型来实现类似的东西,但这对我来说似乎是“作弊”:) 我宁愿学习如何在代码中做到这一点,但我不知道从哪里开始.我对使用 XElement 等进行 XML 解析有点熟悉,但我不确定如何从 HTML 页面(或其他格式?)获取链接。
谁能指出我正确的方向?谢谢!
【问题讨论】:
标签: c# pdf screen-scraping html-parsing html-content-extraction