【问题标题】:why is urllib2 missing table fields which I can see in the Firefox source?为什么 urllib2 缺少我可以在 Firefox 源代码中看到的表字段?
【发布时间】:2009-10-07 02:45:32
【问题描述】:

我从 urllib2 收到的 html 缺少几十个数据字段,当我在 Firefox 中查看 URL 的源时可以看到这些字段。任何建议将不胜感激。这是它的样子:

来自 FireFox 查看源代码:

# ...<td class=td6>as</td></tr></thead>|ManyFields|<br></div><div id="c1">...

从 urllib2 返回 html:

# ...<td class=td6>as</td></tr></thead>|</table>|<br></div><div id="c1">...

【问题讨论】:

  • 您确实没有提供足够的信息...您要检索的 URL 是什么,是 CGI 脚本还是 JSP 还是静态 html;服务器是否进行任何用户代理处理(根据用户代理返回不同的 HTML); HTML sn-ps 不完整。请编辑并添加更多细节。
  • 认为最好插入示例 URL - 谢谢

标签: python html field urllib2


【解决方案1】:

粗略检查一下,您获得的页面似乎有 很多 Javascript;也许是 Javascript 合作构建了您在 Firefox 中看到的信息(至少其中一些正在积极地改变页面的内容)。如果您需要抓取富含 JS 的页面,最好的办法是通过 Selenium 自动化一个实际的浏览器。

【讨论】:

    【解决方案2】:

    您看到的额外内容是由 JavaScript 生成的。它不是原始 HTML 文档的一部分,因此不会出现在诸如 urllib2 之类的普通 HTTP 提取器中。

    【讨论】:

      猜你喜欢
      • 2011-01-11
      • 2019-05-04
      • 2018-02-14
      • 2021-04-09
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多