【发布时间】:2017-05-16 10:26:34
【问题描述】:
我有这个代码:
for fileid in wordlist.fileids()[4:5]:
url = open(fileid, 'r').read()
soup = BeautifulSoup(url)
find_all = soup.find_all("speech", soup)
soup_sub = re.sub("<.+?>", "", str(find_all))
print fileid
print soup_sub
从本地 xml 文件中得到一个特定的元素。然后它从其中取出 xml 代码并打印一个列表。该列表的片段在这里。你可以看到里面有分配的unicode。如何从该列表中获取此 unicode?p>
<p>\nIk heet de minister van Sociale Zaken en Werkgelegenheid van harte welkom. Er hebben zich vijf sprekers voor dit VAO aangemeld.\u200a\n, \nVoorzitter. Ik wil drie moties indienen. Dit wordt topsport voor mij.\u200a\n\nMotie\nDe Kamer,\u200a\ngehoord de beraadslaging,\u200a\noverwegende dat bedrijfsongevallen wel bij de inspectie gemeld moeten worden en beroepsziekten niet;\u200a\noverwegende dat door registratie van beroepsziekten optimaal preventief beleid gevoerd kan worden;\u200a\</p>
【问题讨论】:
标签: python xml beautifulsoup