Skip to content

第 25 章 自动化工作流的可靠性

难度 ★★★ 深入预计 25 分钟场景 让自动化稳定可靠
可靠性自动化

自动化跑一次成功不难,天天跑都不翻车才难。这一章给你的自动化「上保险」。

八条可靠性准则

  1. 先手动验证:没手动跑通的流程,不要自动化。
  2. 幂等(Idempotent):重复跑不产生副作用(如重复发消息)。用「今日是否已发」做开关。
  3. 小范围先行:写操作先在测试目录/测试群验证。
  4. 失败回退:明确「跑挂了怎么办」——告警、跳过、还是重试。
  5. 超时与重试:给外部调用设超时;失败最多重试 N 次,避免死循环。
  6. 密钥隔离:Token/Key 走配置或环境变量,不写进对话与产物。
  7. 可观测:每次运行留日志(时间、输入输出、结果),出事能查。
  8. 定期体检:每周看一次运行记录,清理失效的自动化。

一个可靠的日报自动化长这样

每天 9:00:
1. 取昨日数据(带超时 30s,失败重试 2 次)。
2. 生成摘要;若取数失败 → 发「数据未就绪」告警,跳过推送。
3. 幂等开关:今日已推送则跳过。
4. 推送到飞书「我个人」会话(非群)。
5. 写一行运行日志到 /logs/daily.jsonl。

验收标准

  • [ ] 重复触发不会重复推送
  • [ ] 上游失败有告警而非静默
  • [ ] 有日志可追

自动化 + 写权限 = 放大风险

批量删、批量发、改数据库这类,务必「干跑(dry-run)验证 → 小范围 → 全量」,并保留回滚。

给自动化也写 CASE

把「这个自动化怎么配、踩过什么坑」记成 CASE,下次重建或交接都省事。

到此,你已具备「系统」能力

TASK→CASE→WORKFLOW→AI TEAM 四层,你都走过了。最后一篇,把它落到岗位和行业。

⚓ 本章复盘 · 让这一次成功沉淀下来
  • 我跑通了本章任务,并对照文中的「验收标准」逐项确认。
  • 我把关键的提示词 / 配置 / 命令记进了自己的笔记或知识库。
  • 如果这类事会重复出现,我会考虑把它沉淀成 Skill 或自动化。