在某些情况下,String#split 会将字符串拆分为具有多个字符的子字符串。每个子字符串开头的字符串偏移量可能不够。可能需要开始和结束索引。
以下方法返回一个元组数组,每个元组的第一个元素是strip 返回的字符串部分,第二个元素是该子字符串开始的索引。请注意,这不仅提供了一种计算所需索引的方法,而且还返回了 split 返回的子字符串。
def split_with_offsets(str, r)
indices = []
str.scan(r) { indices << Regexp.last_match.begin(0) }
str.split(r).zip(indices << str.size).map { |s,ndx| [s, ndx-s.size] }
end
有了这些信息,就可以直接获得一个范围数组,每个范围都是分割条的子字符串的偏移量。
def gaps(str, r)
split_with_offsets(str, r).each_cons(2).map { |(s,f), (_,lp1)| f+s.size..lp1-1 }
end
这里有两个例子。
#1
str = "Hello stack overflow"
r = /\W+/
split_with_offsets(str, r)
#=> [["Hello", 0], ["stack", 6], ["overflow", 12]]
gaps(str, r)
#=> [5..5, 11..11]
#2
str = "I | cannot | wait | for | the election |to |be | over"
r = /\s*\|\s*/
split_with_offsets(str, r)
#=> [["I", 0], ["cannot", 4], ["wait", 13], ["for", 20], ["the election", 29],
# ["to", 43], ["be", 47], ["over", 53]]
gaps(str, r)
#=> [1..3, 10..12, 17..19, 23..28, 41..42, 45..46, 49..52]