为什么我不能在子字符串中捕获一个以上的数字？

debugcn 发表于 Dev

安吉特·戈亚尔

我正在创建正则表达式以从日志文件中提取各种字段。我使用一些工具创建了一个正则表达式，它几乎完成了。唯一的事情是对于一个字段，它只提取一位数字而不是完整数字。为了更好地理解，我已将其保存到以下链接。

图案：

/(?=[^P]*(?:ParNew|P.*ParNew|PSYoungGen|DefNew))^(?:).*(?P<ParNew_before_1>\d)K\->(?P<ParNew_after_1>\d+)K\((?P<young_heap_size>\d+)K\), (?P<par_new_duration>\d+\.\d+) secs\] (?P<ParNew_before_2>\d+)K\->(?P<ParNew_after_2>\d+)K\((?P<total_heap_size>\d+)/

细绳：

146372.273: [GC146372.274: [ParNew: 378633K->88155K(419456K), 0.0313803 secs] 9893391K->9602913K(12478080K), 0.0320299 secs] [Times: user=0.32 sys=0.01, real=0.03 secs]

电流输出：

Full match      `146372.273: [GC146372.274: [ParNew: 378633K->88155K(419456K), 0.0313803 secs] 9893391K->9602913K(12478080`
Group `ParNew_before_1`     `3`
Group `ParNew_after_1`      `88155`
Group `young_heap_size`     `419456`
Group `par_new_duration`    `0.0313803`
Group `ParNew_before_2`     `9893391`
Group `ParNew_after_2`      `9602913`
Group `total_heap_size`     `12478080`

预期输出：

Full match      `146372.273: [GC146372.274: [ParNew: 378633K->88155K(419456K), 0.0313803 secs] 9893391K->9602913K(12478080`

团体 ParNew_before_1 378633

Group `ParNew_after_1`      `88155`
Group `young_heap_size`     `419456`
Group `par_new_duration`    `0.0313803`
Group `ParNew_before_2`     `9893391`
Group `ParNew_after_2`      `9602913`
Group `total_heap_size`     `12478080`

在上面的例子中：ParNew_before_1只提取一位数字的组。

维克多·斯特里比尤夫

这里我要注意三件事：

前瞻应该放在之后^（仅在字符串的开头检查其模式会更有意义）
该\d不会匹配超过1个位数，添加+后它来搭配1个或更多
.*太贪心了，用lazy .*?。

用

^(?=[^P]*(?:ParNew|P.*ParNew|PSYoungGen|DefNew)).*?(?P<ParNew_before_1>\d+)K->(?P<ParNew_after_1>\d+)K\((?P<young_heap_size>\d+)K\), (?P<par_new_duration>\d+\.\d+) secs\] (?P<ParNew_before_2>\d+)K\->(?P<ParNew_after_2>\d+)K\((?P<total_heap_size>\d+)
 ^^^                                           ^  ^                      ^

看到这个正则表达式演示

此外，您不需要对-不在字符类内的进行转义。

本文收集自互联网，转载请注明来源。

如有侵权，请联系[email protected] 删除。