【发布时间】:2014-03-10 14:47:10
【问题描述】:
我有这个文件:
<table>
<tr>
<td WIDTH="49%">
<p><a href="...1.htm"> cell to remove</a></p></td>
<td WIDTH="51%"> some text </td>
</tr>
我需要这样的结果:
<table>
<tr>
<td>
</td>
<td WIDTH="51%"> some text </td>
</tr>
我正在尝试使用此 html 读取文件并将我的第一个标签替换为空标签:
ret = open('rec1.txt').read()
re.sub('<td[^/td>]+>','<td> </td>',ret, 1)
final= open('rec2.txt', 'w')
final.write(ret)
final.close()
如您所见,我是使用 python 的新手,当我阅读 rec2.txt 时,它包含与前一个文件完全相同的文本。
tks
【问题讨论】:
-
我猜你没有读到这个:stackoverflow.com/questions/1732348/…
-
您可能会发现this 很有用
-
我曾经使用 BeautifulSoup 来查找元素 (stackoverflow.com/questions/866000/…) 并删除它 (stackoverflow.com/questions/1765848/…)
标签: python html regex html-parsing