【发布时间】:2015-02-24 21:32:48
【问题描述】:
我正在尝试用 Python 从国际象棋网站上抓取一些游戏文件,但遇到了问题。我的计划是从 html 中删除所有游戏 id,然后将它们插入某个 url 以下载它们。困难的部分实际上是获取游戏 ID。
相关的 html 看起来像这样:
<a class="games right-4" href="/livechess/game?id=1012106017"> View</a>
<a class="games right-4" href="/livechess/game?id=982464559"> View</a>
<a class="games right-4" href="/livechess/game?id=1011988271"> View</a>
我对@987654322@ 部分感兴趣。此外,页面中没有其他以/livechess/... 开头的事件。
如何使用正则表达式提取这些 id?我试过阅读一些东西,但它让我感到困惑而不是帮助。
【问题讨论】:
标签: python regex web-scraping