【发布时间】:2020-01-19 10:24:58
【问题描述】:
我需要在 python 中解析由 url 引用的 bibtex 文件,例如:“https://www.aclweb.org/anthology/papers/J/J18/J18-1001.bib” 从 bibtex 我需要提取“页面”字段。如何在python中实现这一点?
【问题讨论】:
标签: parsing beautifulsoup bibtex pyhook
我需要在 python 中解析由 url 引用的 bibtex 文件,例如:“https://www.aclweb.org/anthology/papers/J/J18/J18-1001.bib” 从 bibtex 我需要提取“页面”字段。如何在python中实现这一点?
【问题讨论】:
标签: parsing beautifulsoup bibtex pyhook
将其作为字符串读入,然后通过正则表达式获取以下页面的字符串:
import requests
import re
url = 'https://www.aclweb.org/anthology/papers/J/J18/J18-1001.bib'
data = requests.get(url).text
print (re.search(r'(?<=pages = \").*?(?=\",)', data).group())
输出:
'1--15'
【讨论】: