【发布时间】:2016-11-22 23:54:04
【问题描述】:
尝试从包含特定字符串的href标签中提取文本,下面是我的示例代码的一部分:
Experience = soup.find_all(id='background-experience-container')
Exp = {}
for element in Experience:
Exp['Experience'] = {}
for element in Experience:
role = element.find(href=re.compile("title").get_text()
Exp['Experience']["Role"] = role
for element in Experience:
company = element.find(href=re.compile("exp-company-name").get_text()
Exp['Experience']['Company'] = company
它不喜欢我定义 Exp['outer_key']['inner_key'] = value 的语法,它返回 SyntaxError。
我正在尝试建立一个 Dict.dict,其中包含有关角色和公司的信息,还希望包含每个人的日期,但还没有那么远。
谁能在我的代码中发现任何明显的错误?
非常感谢您对此的任何帮助!
【问题讨论】:
-
似乎
Exp['Experience']["Role"] = role不起作用,因为它本质上是未初始化的。从另一张票看来,您似乎可以改用.append(...)或预先初始化数组。 -
@Lupinity mine 是一个稍微不同的问题 - 我想构建如下输出:{Experience : {role: role_name, company: company_name}, {role: role_name, company: company_name}, ....}
标签: regex python-3.x web-scraping beautifulsoup