【发布时间】:2020-03-06 13:41:53
【问题描述】:
我正在使用 Python 读取 HTML 数据,但我很难从该 HTML 中找到“d:Title>Good To Great</d:Title>”之间的所有子字符串。
data = "<html><head></head><body><pre style='word-wrap': break-word; white-space: pre-wrap;
d:Title>Good To Great</d:Title>d:ComplianceAssetId m:null='true'/>
d:Title>War and Peace</d:Title>/d:ComplianceAssetId m:null='false'/>
d:Title>The Great Gatsby</d:Title>/entry></feed></pre></body></html>"
预期输出:
['Good To Great', 'War and Peace', 'The Great Gatsby']
我怀疑正则表达式可能是一个解决方案,但我对正则表达式的了解有限(仍在学习),谁能帮我解决这个问题?
提前感谢您的帮助。
【问题讨论】:
-
嗨 bangbangbangbang,请查看 re 包以获取有关内置包的详细信息。您还可以在 Google 上搜索“深入 Python 3”,在那里您可以找到一本非常方便的书,其中涵盖了基本的 Python 3,包括正则表达式处理。
-
我怀疑正则表达式可能是一个解决方案:如果您还没有,请参阅this。