【发布时间】:2011-11-07 04:57:04
【问题描述】:
我正在尝试解析网页。 基本上它被存储在一个字符串中,如下所示:
"[HTML CODE ...]world:[HTML CODE ...]my_number[REST OF HTML_CODE ...]"
当然,“world:”和“MY_NUMBER”是 html 代码的一部分,但是我想忽略第一次出现“world:”之前的所有内容。我需要的是第一次出现“世界:”之后出现的第一个数字,请记住一堆html代码将在它们之间。 我可以对 html 代码进行子串化,但如果可能的话,我想只使用一个正则表达式来完成这一切。
这是我尝试匹配的正则表达式:
'/(?<=world:)\D+?[0-9]+/'
但这会返回“世界:”和我的号码之间的所有 html 内容。
谢谢!
【问题讨论】:
-
您可以删除之前的所有内容,包括“world:”,然后找到剩余字符串中的第一个数字。
-
正如我所写的,我可以对 html 代码进行子字符串化,但我只想在可能的情况下使用正则表达式。没有什么特别的原因,我只是想提高我的正则表达式知识