【发布时间】:2022-01-15 13:00:09
【问题描述】:
在本文中,我试图提取以下行的所有标题和页码:
- 以 - 开头
- 后跟空格
- 然后是章节标题
- 然后是页面#,像这样:#page=9&
这是我正在使用的原始文本的示例:
| "Principles of Microeconomics 2e" (null)
- "Preface" #page=9&zoom=0,0,58
| "1. About OpenStax" #page=9&zoom=0,0,150
| "2. About OpenStax resources" #page=9&zoom=0,0,248
| "3. About Principles of Microeconomics 2e" #page=9&zoom=0,0,544
| "4. Additional resources" #page=13&zoom=0,0,367
| "5. About the authors" #page=14&zoom=0,0,58
- "Chapter 1. Welcome to Economics!" #page=17&zoom=0,0,58
| "1.1. What Is Economics, and Why Is It Important?*" #page=18&zoom=0,0,338
| "1.2. Microeconomics and Macroeconomics*" #page=22&zoom=0,0,448
| "1.3. How Economists Use Theories and Models to Understand Economic Issues*" #page=23&zoom=0,0,565
我当前的正则表达式:
(?:\-\s)(["'])(?:(?=(\\?))\2.)*?(?:page=)(?<=\=)(.*?)(?=\&)
当前使用此正则表达式匹配整行,但没有将所需元素放入单独的组中。而且我在执行此分隔时遇到了麻烦。
当前输出: current output
想要的输出:
Match 1: "Preface" #page=9&
Group 1: Preface
Group 2: 9
Match 2: "Chapter 1. Welcome to Economics!" #page=17&
Group 1: Chapter 1. Welcome to Economics!
Group 2: 17
我试图在一组中提取标题,在另一组中提取页码。 我该怎么做?
【问题讨论】: