【发布时间】:2013-08-01 18:31:03
【问题描述】:
所以我正在构建一个简单的 HTML scraper,在文本中有一些符号图像,我需要的是获取这个 img 标签的 src,但保持它们相同放置在文本中的img标签中。
--由于我问错了问题而重写了问题。
【问题讨论】:
-
如果您正在编写 HTML 抓取工具,为什么不使用 HTML DOM 解析器而不是正则表达式?
-
用regExp不能很好地解析HTML,使用HTML解析器(阅读stackoverflow.com/a/1732454/1529630)
-
请不要使用 html 遍历库之外的任何东西来解析 html,这个社区比什么都讨厌。
-
我在 HTML DOM 中使用了一切,但这部分给我带来了麻烦,因为我需要知道每个图像在文本中的位置,而我没有用 DOM 做到这一点
-
如果你已经使用了 DOM 解析器,它应该只能提取 src 属性。也许如果你问那个,它可能会更快地解决实际问题。