【发布时间】:2019-03-08 09:09:14
【问题描述】:
我正在从一个中国学术文章数据库中挖掘一些链接。
当我将页面刷新到我正在查看的文章时,或者只是复制并粘贴一个 url 时,该 url 会重定向到数据库的主页而不是文章。
例如,以下链接转到我的搜索结果: http://search.cnki.net/search.aspx?q=%E4%BA%BA%E5%B7%A5%E6%99%BA%E8%83%BD
第一篇文章的个人网址是: http://www.cnki.net/kcms/detail/detail.aspx?dbcode=CJFQ&dbName=CJFQ2016&FileName=KJDB201615009&v=&uid=
但是,如果您尝试直接单击文章链接或刷新文章页面,则会重定向到数据库主页。为什么会这样?有没有办法让这些文章获得一个“稳定”的网址?
虽然我不确定,但可能很重要的一个细节是 HTML 代码中指向各个文章的 url 也不同。
<a href="http://epub.cnki.net/grid2008/brief/detailj.aspx?filename=KJDB201615009&dbname=CJFDLAST2016" target="_blank">
【问题讨论】:
标签: html url web-scraping hyperlink href