【发布时间】:2010-05-20 19:50:04
【问题描述】:
所以这就是交易。我正在为一个扫描所有产品页面并记录产品数据的网站创建一个蜘蛛机器人。我正在使用 C# 和 WebClient 库来下载 HTML 字符串。我要爬的网站必须是特制的,因为从 WebClient.DownloadString() 收到的 HTML 与我在浏览器上查看 HTML 源时获得的 HTML 不同。这似乎是故意的,因为我无法获得的唯一信息是价格。
有没有人知道这个问题的解决方法,或者任何人都可以解释发生了什么?谢谢。
【问题讨论】:
-
如果我们能看到代码中出现了哪些差异,那将会有所帮助。例如,“查看源代码”向您展示了什么以及您的机器人向您展示了什么?
-
您能否提供相关网站的网址?
-
我个人会使用
WebRequest/WebResponse来检索详细信息。或者使用 DownloadData 并将byte[]格式化为使用正确编码的字符串。