【发布时间】:2017-09-20 19:37:03
【问题描述】:
我收到了一个非常大的 CSV 数据文件,我需要将其导入 MySQL 数据库。不幸的是,CSV 文件在每 50 行数据之后有一个文本页脚,如下所示:
0,,,,,," of 2,401",,,,
10,,,,,," of 2,401",,,,
999,,,,,," of 2,401",,,,
"1,000",,,,,," of 2,401",,,,
"2,396",,,,,," of 2,401",,,,
...etc
如您所见,当数字达到 1,000 时,模式会发生变化(它们开始使用双引号将开始的 Page # 括起来)。这超出了我对 RegEx 的理解。我需要一个正则表达式来识别所有这些行并删除它们。
【问题讨论】:
-
你可能会逃脱: /[^,]+,,,,,," of 2,401",,,,$// 这很懒,但我怀疑一次就足够了固定器
-
^("?)[\d,]+?\1,+"\s*of [\d,]+",+$或^(?:[\d,]+|"[\d,]+"),+"\s*of [\d,]+",+$