【发布时间】:2019-03-06 19:13:43
【问题描述】:
我有一个文本文件;
...在表5中,我们了解了压力之间的关系 和音量。它说......现在我们知道......表 9:代表 x 和 y 的图形。表 6 都是关于力的,它对 对象....
现在我已经编写了一个代码来提取其中包含单词 table 的行;
with open file( <pathname + filename.txt>, 'r+') as f:
k = f.readlines()
for line in k:
if ' Table ' in line:
print(line)
现在我希望以特定格式打印输出;
(txt文件名),(表格id),(表格内容)
我通过使用python的.split方法来做到这一点;
x = 'Paper ID:' + filename.split('.')[0] + '|' + 'Table ID:' + line.split(':')[0] + '|' + 'Table Content:' + line.split(':')[1] + '|'
现在,如您所见,我可以将表格 id 和表格内容分开,其中一些 . 在没有分隔符的情况下,我如何做同样的事情,即这些行;
在上面的表5中,我们了解了压力之间的关系 和音量。它说......现在我们知道...... 或者 在表 7 中我们看到了......
?
有人可以帮忙吗?
【问题讨论】:
-
我认为你应该看看正则表达式(短正则表达式)。以下可能有效:
Table\W[0-9](.*)Table\W[0-9]其中第 1 组是您的表格内容。资源:regex101.com 或 regexr.com 用于测试 en.wikipedia.org/wiki/Regular_expression python_specific:tutorialspoint.com/python/python_reg_expressions.htm