【发布时间】:2018-02-15 08:13:25
【问题描述】:
我试图从下面的 sn-p 解析评论中的内容,但它似乎根本不起作用。我怎样才能让它工作?我的意图是获取 p 标记内的文本,输出应为:
Hi there!!
Hi again!!
我已经尝试过的脚本:
from bs4 import BeautifulSoup, Comment
content="""
<!-- comment --><a href="https://extratorrent.ag/"><p>Hi there!!</p></a>
<!-- comment1 --><a href="https://thepiratebay.se/"><p>Hi again!!</p></a>
"""
soup = BeautifulSoup(content, 'lxml')
for comment in soup.find_all(string=lambda text:isinstance(text,Comment)):
data = BeautifulSoup(comment.next_element,"lxml")
for item in data.select("p"):
print(item.text)
我遇到的错误:
Traceback (most recent call last):
File "C:\AppData\Local\Programs\Python\Python35-32\Social.py", line 9, in <module>
data = BeautifulSoup(comment.next_element,"lxml")
File "C:\AppData\Local\Programs\Python\Python35-32\lib\site-packages\bs4\__init__.py", line 191, in __init__
markup = markup.read()
TypeError: 'NoneType' object is not callable
【问题讨论】:
-
发布错误的完整回溯
标签: python python-3.x web-scraping beautifulsoup