CSDN 完整教程系列《从小白到 AI 大模型开发工程师的进阶之路》 技术点AI-0122 生成器 主人公小蓝伞本文是第 34 期围绕【yield、生成器表达式、流式处理和内存占用】展开。示例用于复现实验标注【建议验证】的部分需要按读者自己的 Windows、Python 版本和网络条件执行。一、问题背景与适用场景逐行筛选日志中的 ERROR 记录文件再大也只处理当前行。 本期要把概念落成一个可观察、可回滚的小实践。二、先给结论yield 保存执行状态并按需产生数据大文件处理保持流式消费避免 list(generator) 把结果重新全部加载。 本期最小产出大文件逐行处理器。三、前置准备Windows 10/11建议 Python 3.11 或项目采用的兼容版本。练习目录D:\ai-learning\issue-34涉及文件、依赖或配置时先备份。不要提交 Token、密码和个人路径未执行命令不得写成实测结果。四、最小可复现实践在练习目录保存并执行from io import StringIO ​ def errors(stream): for line in stream: if line.startswith(ERROR): yield line.rstrip() ​ log StringIO(INFO start\nERROR timeout\nINFO retry\nERROR refused\n) for line in errors(log): print(line)预期结果只输出 ERROR 行生成器被 for 消费时才执行。五、关键原理与工程判断1. 先定义输入和成功判据yield 保存执行状态并按需产生数据大文件处理保持流式消费避免 list(generator) 把结果重新全部加载。2. 保留状态和失败原因把输入、输出、版本、目录和完整错误记入 README 或日志便于定位而不是只写【失败】。3. 小步执行与回滚先跑最小样例再一次改一个变量危险操作先 dry-run、备份或 Git 提交。六、常见问题与避坑创建生成器后期待函数体立即执行必须由 next、for 或其他消费者驱动。用 list(generator) 收集全部数据大文件场景保持流式消费并限制缓存。重复遍历已经耗尽的生成器需要新一轮结果时重新调用生成器函数。七、验证清单正常、边界、失败三类输入均有验证。重新打开终端或进程后复验排除缓存和当前会话影响。产物能再次读取、运行或恢复未实测部分标记【建议验证】。八、面试题本期技术点解决什么问题解决输入、状态或失败边界的可控性。为什么先做最小实践降低变量数量区分语法、环境和业务问题。出现错误先做什么保存完整错误确认版本、目录、权限和输入。如何判断真正生效重启相关进程后用独立命令和功能测试复核。什么时候不能照搬示例系统、版本、权限或输入契约不同就要先调整并阅读官方文档。九、本期小结与下一期本期完成 大文件逐行处理器把正确路径和失败路径都变成可验证动作。下一期继续学习资料库中的下一个技术点。点个关注不迷路跟着小蓝伞把 Python 基础变成工程能力。可靠的程序也要能解释失败。官方资料9. Classes — Python 3.14.7 documentation十、记录与回滚建议记录时间、解释器版本、执行目录、关键输出和失败原因出现异常先停止批量操作保留现场后恢复备份或回退 Git。