【问题标题】:How to get dynamically loaded data crawled by search engines?如何获取搜索引擎抓取的动态加载数据?
【发布时间】:2014-01-07 12:23:45
【问题描述】:

我面临一个问题,在网站上,我们在标题上有导航选项卡,出现悬停下拉菜单,并且数据已填充并显示给用户。此数据是动态生成的,因此不会出现在页面源中。 经过研究,谷歌抓取工具会抓取页面源中存在的任何内容。虽然他们不会抓取脚本标签。

现在我的数据是 JSON 数据,它位于脚本标签内,并出现在页面源中。此 JSON 数据用于使用 javascript 填充导航选项卡上的结果。

我希望这些数据被搜索引擎抓取。

有没有办法做到这一点?

【问题讨论】:

  • 我碰巧找到了this。它可能会帮助你

标签: javascript json web-crawler


【解决方案1】:

如果 DOM 中不存在,则不可搜索,它们不会在其上爬行。它需要在 DOM 中,这样他们才能找到它。

【讨论】:

  • 如果它们存在于 DOM 中,仍然是爬虫如何爬取它?因为它没有出现在页面源上。
  • 你怎么知道没有被抓取?粘贴代码更好!
  • 感谢您的回复。但是,我找不到任何有用的东西来解决我的查询
  • 我认为爬虫引导加载页面就像普通用户在浏览网站时一样。我以前从未读过爬虫读取脚本,它们只读取内容和链接标签;所以可能你没有很好地让你的内容加载到脚本中。
猜你喜欢
  • 2012-06-13
  • 1970-01-01
  • 1970-01-01
  • 2023-03-15
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-04-10
  • 1970-01-01
相关资源
最近更新 更多