【发布时间】:2010-06-20 14:25:11
【问题描述】:
您好,我正在寻找清理标签或至少从文本中的自定义标签中获取数据的最佳实践或想法。
我确信我可以编写某种“解析器”,它会手动遍历每一行,但今天不是有一些更聪明的方法吗?
数据思考:
{电话:555-123456789}
这里我们将“电话”作为键,将数字作为数据。看起来很像 JSON 格式,但更容易为人类编写。
或
{link: article123456 ; title: Read about article 123456 here }
也可以是普通的 (X)HTML:
<a href="article123456.html" > Read about article 123456 here </a>
人类并不总是善于“修剪”他们的输入,用懒惰的所见即所得编辑器制作的旧网站也不是,所以我首先需要弄清楚哪些对属于一起,然后在找到“内部数据”之后修剪结果.
问题在于上面的“标题”部分,标题文本周围没有“”,因此它可以自动添加它们或将错误显示给人类。
对如何以最佳方式获取这些数据有任何想法吗?似乎有几种方法可能有效,但您解决此问题的最佳方法是什么?
【问题讨论】:
-
我想提一下,我同意@tlayton 的回答,所以如果有的话,用不同的标记器回答也会很棒?
标签: c# input intellisense text-parsing