如何使用正则表达式提取以编号开头、后跟多个注解的完整代码块
技术百科
花韻仙語
发布时间:2026-01-01
浏览: 次 本文讲解如何用 python 正则表达式精准匹配并分组提取形如“1. @xxx”开头、后续紧接多行 `@annotation` 的逻辑块,解决单行匹配导致内容截断的问题。
在处理结构化注解文本(如 Spring 注解示例、JavaDoc 标签等)时,常需按语义块而非单行进行提取。原始代码 re.findall("(?:[0-9][.][ ]).+", txt) 仅捕获编号行本身,忽略了其后属于同一逻辑单元的 @Autowired、@Override 等注解——因为这些注解位于独立行,且不以数字编号开头。
关键在于:将整个逻辑块视为一个“主项+附属项”结构,其中:
- 主项:以 数字. 开头的行(如 1. @aut1.or);
- 附属项:后续连续的、以 @ 开头的行(如 @Autowired),直到遇到下一个编号或文本结束。
以下为健壮、可复用的解决方案:
import re
txt = '''1. @aut1.or
@Autowired
2. @Override
@param
@SuppressWarnings'''
# 第一步:先提取所有可能的“起始行”(编号行)及其位置
start_matches = list(re.finditer(r'^\d+\.\s+@[\w.]+', txt, re.MULTILINE))
if not start_matches:
result = []
else:
result = []
for i, match in enumerate(start_matches):
start_pos = match.start()
# 取当前起始行到下一个起始行(或文本末尾)之间的内容
end_pos = start_matches[i + 1].start() if i + 1 < len(start_matches) else len(txt)
block = txt[start_pos:end_pos].strip()
# 清理块内多余空行,保留换行符分隔注解
cleaned_block = re.sub(r'\n\s*\n', '\n', block) # 合并空行
result.append(cleaned_block)
print(result)
# 输出:
# ['1. @aut1.or\n@Autowired',
# '2. @Override\n@param\n@Suppre
ssWarnings']✅ 优势说明:
- 使用 re.MULTILINE 配合 ^ 确保精确匹配行首编号;
- 基于位置切片(start_pos/end_pos)天然支持跨行归属,避免正则贪婪匹配风险;
- 兼容注解中含点号(如 @aut1.or)、下划线或大小写混合(如 @SuppressWarnings);
- 自动过滤空行,保持结果整洁。
⚠️ 注意事项:
- 若文本中存在无编号的孤立注解(如开头直接写 @Deprecated),该方案会忽略它们——这符合“仅提取编号逻辑块”的需求;
- 如需支持中文编号(如“一.”、“二.”)或括号编号(如“(1)”),需扩展正则模式;
- 生产环境建议添加异常处理,并对 txt 做非空和类型校验。
此方法超越简单 findall,体现“定位锚点 → 划分区间 → 提取子串”的典型文本结构化解析思路,适用于日志分段、测试用例提取、文档标记解析等多种场景。
# python
# app
# java
# red
# 正则表达式
相关栏目:
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
AI推广<?muma echo $count; ?>
】
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
SEO优化<?muma echo $count; ?>
】
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
技术百科<?muma echo $count; ?>
】
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
谷歌推广<?muma echo $count; ?>
】
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
百度推广<?muma echo $count; ?>
】
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
网络营销<?muma echo $count; ?>
】
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
案例网站<?muma echo $count; ?>
】
<?muma
$count = M('archives')->where(['typeid'=>$field['id']])->count();
?>
【
精选文章<?muma echo $count; ?>
】
相关推荐
- php订单日志怎么按状态筛选_php筛选不同状态订
- php485读数据时阻塞怎么办_php485非阻塞
- Win11相机打不开提示错误怎么修_相机权限开启与
- C++如何使用std::async进行异步编程?(
- Win11文件夹预览图不显示怎么办_Win11缩略
- php高频调试功能有哪些_php常用调试函数与工具
- 如何在Golang中实现邮件发送功能_Golang
- 如何在Golang中使用encoding/gob序
- Win10电脑怎么设置IP地址_Windows10
- 如何优化Golang程序CPU性能_Golang
- 如何在Golang中验证模块完整性_Golangg
- c++怎么调用nana库开发GUI_c++ 现代风
- Win11怎么退出微软账户_切换Win11为本地账
- mac怎么分屏_MAC双屏显示与分屏操作技巧【指南
- Mac系统更新下载慢或失败怎么办_解决macOS升
- 如何在Golang中定义接口_抽象方法和多态实现
- Win10怎样清理C盘浏览器缓存_Win10清理浏
- php怎么连接数据库_MySQL数据库连接的基础代
- Python lxml的etree和Element
- 如何使用Golang实现微服务状态监控_Golan
- 如何处理“XML格式不正确”错误 常见XML we
- 使用类变量定义字符串常量时如何实现类型安全的 Li
- 如何在Golang中处理二进制数据_Golang
- Win11任务栏天气怎么关闭 Win11隐藏天气小
- Win11开机自检怎么关闭_跳过Win11开机磁盘
- Win11如何关闭游戏模式 Win11禁用Xbox
- 如何高效获取循环末次生成的 NumPy 数组最后一
- Win10电脑怎么设置休眠快捷键_Windows1
- C++如何将C风格字符串(char*)转换为std
- MAC如何启用访达侧边栏显示_MAC Finder
- Linux如何安装JDK11_Linux环境变量配
- 作用域操作符会影响性能吗_php静态调用性能分析【
- Python字符串处理进阶_切片方法解析【指导】
- Windows10如何重置此电脑_Windows1
- Win10怎么卸载剪映_Win10彻底卸载剪映方法
- php删除数据怎么清空表_truncate与del
- php8.4如何配置ssl证书_php8.4htt
- Win11怎么更改计算机名_Windows11系统
- Win11怎样彻底卸载自带应用_Win11彻底卸载
- php订单日志怎么导出excel_php导出订单日
- Win11如何更改用户账户文件夹名称 Win11修
- php订单日志怎么记录物流_php记录订单物流变更
- 如何使用Golang捕获测试日志_Golang t
- Windows 10怎么把任务栏放在屏幕上方_Wi
- 如何在 Go 中可靠地测试含 time.Time
- Win11如何隐藏桌面图标 Win11一键隐藏/显
- 如何自定义Windows终端的默认配置文件?(Po
- Win11怎么关闭通知中心_Windows11系统
- Python类装饰器使用_元编程解析【教程】
- 如何在Golang中处理URL参数_Golang

ssWarnings']
QQ客服