【发布时间】:2021-08-25 08:04:39
【问题描述】:
我正在使用 python 进行主题建模任务,我想从年度/可持续发展报告中提取文本。但是我的问题是,当我尝试提取报告时,提取的行在页面中的两个不同列之间断开,即,它将相邻段落中的两个不同行连接成一个句子。如何完全按照报告中的方式提取线条。我附上了报告的版本和函数提取的行。
下面是我使用的函数:
#函数从url获取pdf:
def converter(url):
text=[]
req= requests.get(url)
with pdfplumber.open(BytesIO(req.content)) as pdf:
for i in range(0, len(pdf.pages)):
pages= pdf.pages[i]
text.append(pages.extract_text())
return "\n".join(str(i) for i in text)
这里是报告的第一行(第一列和第二列的开始,由函数合并在一起):
\n我在 2019 年的首要职责之一是面试我们 踏上了新的战略时期\非“早安挪威”节目 在 2016 年的谈话中,我表示希望 AF 能感受到\n关于 AF 的 当我们的目标是紧密结合的百分比增加一倍 希望超越\n女性
如果我能以报告中给出的确切方式提取句子,将会很有帮助。
【问题讨论】:
标签: python text-extraction topic-modeling information-extraction pdfplumber