【发布时间】:2017-06-04 19:32:06
【问题描述】:
我目前正在使用 htmlAgilityPack 进行一些网页抓取,但是我遇到了一个包含脚本标签的网站,我无法加载它进行抓取。我对网络几乎没有经验,不确定如何正确加载网页并转换回 htmlAgility 可以解析的内容。
几乎,当我在 chrome 中检查元素时,有一个表格,但 htmlAgilityPack 读取了一个脚本标签。
任何帮助将不胜感激。
谢谢
【问题讨论】:
-
已经有很多关于“抓取动态页面”的问题...确保搜索并显示您尝试过的方法以及它们如何不适合您的情况。
-
所有这些方法都不适用于我说我正在使用的控制台应用程序。
-
google.com/search?q=c%23+scraping+dynamic+pages+javascript 提供两种选择的答案...使用 Google 或 Bing 可能比您使用的任何搜索引擎更好...
-
谢谢。这些方法适用于几个包含 Javascript 的站点,但在某些站点上不起作用。这是我的初始化方式:
标签: c# web-scraping web-crawler console-application html-agility-pack