自动化脚本最危险的状态不是报错,而是悄悄死掉没人知道——等发现时可能已经停了一个月。批量定时任务长期无人值守运行(读数据、调模型、写文件、回流索引),任何一环静默失败都会让整条链路空转,而外层完全看不出来。
点击空白处退出提示
自动化脚本最危险的状态不是报错,而是悄悄死掉没人知道——等发现时可能已经停了一个月。批量定时任务长期无人值守运行(读数据、调模型、写文件、回流索引),任何一环静默失败都会让整条链路空转,而外层完全看不出来。
为批量定时任务统一引入状态留痕机制,让"跑没跑、跑成什么样"完全可回溯。功能模块:① 统一状态文件——每次运行落一份 JSON,记录最后运行时间、处理日期、处理条数、是否走了降级路径、产物路径、回流状态;② 分级状态值——正常 / 跳过 / 失败分别落不同状态,进程退出码随状态返回,定时任务日志一眼可判;③ 人类可读汇报——同时在标准输出打印一行汇总(日期 | 处理条数 | 摘要引擎 | 产物文件 | 回流状态),不用解析 JSON;④ 异常可发现——连续多天状态不变即可判定任务已停,把"静默死亡"变成"下一次查看就能发现"。
我独立完成状态留痕机制的设计与落地。技术栈:Python 标准库(json / datetime)、文件系统状态落盘、定时任务调度(launchd / cron)、退出码语义。实现亮点:一是状态文件与人类可读汇报双通道,机器可解析、人可一眼看懂;二是把"降级"这件事也写进状态(used_llm 字段),避免降级长期发生却无人察觉;三是退出码与状态联动,失败能被上层调度器捕获。结果:任何一天的运行状态都可回溯,不存在"不知道有没有跑"的情况;连续运行 3 个月期间,异常均在下一次查看时即被发现。



评论