【发布时间】:2019-03-28 08:08:40
【问题描述】:
当文本包含如下内容时,我在解析 dom 元素时遇到问题。我想从实际使用 Javascript 中删除突出显示的文本。你能帮我解决这个问题吗?我想依赖正则表达式。
我知道如何使用标准字符串函数以及 dom 解析器获取引用属性。
对于像下面这样的节点,使用诸如替换之类的字符串函数,切片可能会起作用,但我需要遍历整个字符串。这是性能问题。
所以我想使用正则表达式在节点中查找此类属性。
<p class=MsoListParagraphCxSpFirst style='text-indent:-.25in;mso-list:l0 level1 lfo1'>
在上面的例子中,我想删除类属性,类名可以是任何东西。这些节点是从 MS word 生成的,不在我的控制范围内。
编辑:以下是我用来搜索未引用文本的模式。但它不起作用
var pattern = /<p class=\s*=\s*([^" >]+)/im
【问题讨论】:
-
发布的问题似乎根本没有包含any attempt 来解决问题。 StackOverflow 期待您 try to solve your own problem first,因为您的尝试有助于我们更好地了解您想要什么。请编辑问题以显示您尝试过的内容,以说明您在minimal reproducible example 中遇到的特定问题。欲了解更多信息,请参阅How to Ask 并拨打tour。
-
我不推荐使用 MS Word 创建网页。
-
我没有使用 MS Word 来创建网页。我们有一个解决方案,用户可以将数据从 MS Word 文档复制到我们在应用程序中使用的富文本编辑器。但是,文本格式在 chrome 浏览器中看起来不太好。因此我们决定将文本解析为标准的 html 格式并在编辑器中显示。我们正在开发类似于tiny.cloud/docs/demo/full-featured 的解决方案,代码示例为@github.com/tinymce/tinymce/blob/master/src/core/main/ts/api/…
-
@CertainPerformance 通常当我没有答案时,我会来这里。否则我自己解决问题。
-
当然,你不应该有答案,但你应该至少稍微尝试一下 在询问之前。见How much research effort is expected of Stack Overflow users?
标签: javascript regex