【发布时间】:2020-03-10 22:24:54
【问题描述】:
我正在尝试获取此网站列表中的所有href:https://nihongonosensei.net/?page_id=10246。 该网站非常简单和干净。在查看了源代码后,我没有发现任何动态。
但是,如果我这样做了
import requests
url = 'https://nihongonosensei.net/?page_id=10246'
r = requests.get(url)
r.text
r.text 仅包含大约 20000 个字符信息。超过一半的 html 缺失。
我尝试从“查看页面源代码”复制整个 HTML 并直接加载到 Beautifulsoup:
from bs4 import BeautifulSoup
html = '' # too long to copy. Here is the link: view-source:https://nihongonosensei.net/?page_id=10246
soup = BeautifulSoup(html, 'html.parser')
仍然只保留了大约 20000 个字符,并且缺少 html 的上半部分。
这是我的问题:
-
requests和BeautifulSoup是否有字符限制? - 如果是这样,我该如何消除限制?
- 如果没有,为什么我无法获得完整的 html?
非常感谢!
雷切尔
【问题讨论】:
-
您想获取所有
href链接吗? -
是的。试图获取列表中的所有链接/文本。
-
list是什么意思?检查下面的答案 -
谢谢!刚回复你。下面的列表仍然不是完整的列表。
-
从答案中的 cmets 看来,问题似乎只是 VS Code 正在切断冗长的输出。因此,我投票关闭它,因为错字/无法复制。
标签: python html web-scraping beautifulsoup python-requests