Files
dev-ops-agent/skills/multi-cloud-infra-ops/references/ops-checklists.md
T

1.4 KiB

运维检查清单

确认策略

  • 只读查询操作:不需要请求确认;目标范围和凭据明确时直接执行。
  • 状态变更操作:执行前必须得到用户明确确认。
  • 状态变更操作包括创建、更新、删除、重启、停止、启动、扩缩容、续费、绑定、解绑、部署、发布、迁移、恢复、故障切换、授权、撤权、导入和数据写入。
  • 请求确认前必须列出:
    • 目标账号、地域、资源类型和资源 ID。
    • 将要执行的具体操作。
    • 预期影响和可能的停机时间。
    • 是否可以回退,以及如何回退。
    • 执行前是否需要备份、快照或导出。
    • 变更后的验证方式。

只读发现

  • 确认云账号和凭据 profile。
  • 确认地域和资源 ID。
  • 收集当前配置。
  • 检查监控、日志、告警和近期操作历史。
  • 识别依赖项,例如 DNS、CLB、安全组、VPC 路由、NAT、COS bucket、证书和后端服务。

生产变更

  • 说明影响范围和预计持续时间。
  • 变更前准备回退方案。
  • 变更前判断是否需要备份、快照或导出。
  • 记录变更前配置值。
  • 执行能解决问题的最小变更。
  • 变更后从用户可见路径验证。

故障响应

  • 先止血,再解释。
  • 尽可能缩小影响范围。
  • 破坏性清理前先保留证据。
  • 用具体时间戳记录时间线。
  • 将重复出现的修复动作沉淀为 Runbook 或脚本。