【发布时间】:2009-10-02 08:39:09
【问题描述】:
如何从包含语言字符、字母数字字符英文字母的文件中仅提取特定语言的字符
【问题讨论】:
如何从包含语言字符、字母数字字符英文字母的文件中仅提取特定语言的字符
【问题讨论】:
这取决于几个因素:
字符串是用UTF-8编码的吗?
您想要所有非英文字符,包括符号和标点符号等,还是只想要来自书面语言的非符号字符?
是否要捕获非英语或非拉丁字符?我的意思是,你想要é 和ç 之类的字符,还是只想要浪漫和日耳曼字母之外的字符?
最后,
假设您使用的是 UTF-8,您不需要基本标点符号但可以使用其他符号,并且您不需要任何标准拉丁字符但可以使用重音字符等,您可以在您使用的任何语言中使用字符串正则表达式函数来搜索所有非 Ascii 字符。这将消除您可能试图清除的大部分内容。
在 php 中是:
$string2 = preg_replace('/[^(\x00-\x7F)]*/','', $string1);
但是,这会删除行尾,您可能想要也可能不想要。
【讨论】: