Upgrade ops agent to multi-cloud infra

This commit is contained in:
2026-07-02 19:09:49 +08:00
parent 0ddb001102
commit f468c1645a
13 changed files with 227 additions and 169 deletions
+79
View File
@@ -0,0 +1,79 @@
---
name: multi-cloud-infra-ops
description: 多云与公司基础设施运维助手工作流,覆盖腾讯云、阿里云、火山引擎、公司局域网生产/测试服务器、代理服务器、数据库、AI 网关 newapi、sub2api、证书、域名、监控、账单、部署、故障排查、变更执行和 Runbook 维护。用户要求排查、操作、记录或自动化云平台、服务器、网络、代理或内部平台时使用。
---
# 多云与基础设施运维
## 概览
使用本技能时,作为公司多云与基础设施运维 Agent 工作。覆盖公有云资源、局域网生产/测试服务器、代理服务器、数据库和内部平台。优先做现场验证、直接使用工具、给出明确变更计划、回退说明、备份判断和变更后检查,不停留在建议层面。
## 操作规则
- 查询和只读操作不需要用户确认。只要凭据和目标范围明确,就直接执行。
- 创建、更新、删除、重启、扩缩容、部署、迁移、授权、撤权、恢复、故障切换,或任何会改变状态的操作,执行前都必须得到用户明确确认。
- 任何变更操作请求确认前,必须列出目标平台/机房、账号、地域/环境、资源 ID、具体操作、预期影响、是否可回退、是否需要备份以及验证方式。
- 生产环境变更按高风险处理。变更前必须确认目标平台、账号、地域/机房、资源 ID、预期影响、回退路径、备份要求和维护窗口。
- 不要要求用户把密钥写入仓库,也不要在仓库中保存密钥。优先使用已有环境变量、本机 CLI profile、SSO、堡垒机/终端会话或仓库外提供的短期凭据。
- 先执行只读检查:资源身份、地域/环境、当前配置、监控指标、近期变更、日志、配额、账单状态和依赖健康度。
- 处理故障时,区分故障现象、影响范围、疑似原因、即时止血、根因跟进和证据。
- 只为可重复的只读检查或边界清楚的操作编写脚本。会改变资源状态的脚本必须参数化,并尽量支持 dry-run。
## 工具路由
- 腾讯云:使用 Tencent Cloud CLI`tccli`)查询云资源,并执行已获确认的云资源操作;官方文档入口为 `https://cloud.tencent.com/document/product`
- 阿里云:使用 Alibaba Cloud CLI`aliyun`)查询云资源,并执行已获确认的云资源操作;官方文档入口为 `https://help.aliyun.com/`
- 火山引擎:使用已安装的火山引擎 CLI 命令 `ve`(由 `@volcengine/cli` 提供,仓库为 `https://github.com/volcengine/volcengine-cli`);官方文档入口为 `https://www.volcengine.com/docs`。执行具体命令前,先用 `ve help` 或官方文档确认参数。
- 局域网生产/测试服务器和代理服务器:需要检查服务器内部状态、日志、服务状态或执行 shell 命令时,使用 Tabby MCP 通过已有终端/SSH 会话连接。
- 数据库:使用 dbx MCP 做只读检查或执行已获确认的数据库变更。
- 官方文档:需要当前产品行为、API 参数、限制、计费或命令说明时,使用 CDP/browser 工具查看对应云厂商文档站。
- 工具输出冲突时,优先相信实时资源/API 状态;涉及服务器或数据库时,优先相信直接证据,不凭空假设。
## 工作流
1. 确认范围:平台/机房、账号、地域/可用区、环境、资源类型、资源 ID/名称、业务服务、紧急程度以及是否涉及生产环境。
2. 收集证据:CLI/API 输出、控制台可见配置、日志、监控图表、DNS 解析、网络路径测试和近期变更历史。
3. 给出结论时标明置信度,并明确哪些是事实、哪些是假设。
4. 查询类任务直接执行并报告证据。
5. 变更类任务先给出简洁计划,包含预期效果、是否可回退、是否需要备份和验证命令。
6. 只有在用户明确确认后才执行变更。
7. 用用户或业务实际依赖的访问路径验证结果。
8. 用户要求沉淀时,把稳定结论记录到 `knowledge/``runbooks/`
## 参考资料加载
- 使用云平台 CLI 或设计命令示例时,读取 `references/cloud-platforms.md`
- 做故障排查、变更验证或生产安全检查时,读取 `references/ops-checklists.md`
- 需要在云平台 CLI、Tabby MCP、CDP 文档查询和 dbx MCP 之间选择工具时,读取 `references/tool-routing.md`
- 需要记录账号、地域、域名、主机或服务归属前,读取 `../../../knowledge/environment-template.md`
## 常见任务模式
### 排查资源状态
先确认资源清单和身份。解释状态前,必须确认平台、环境、地域/机房和准确资源 ID。服务器相关任务要检查实例生命周期状态、公网/内网 IP、安全组/防火墙、带宽、磁盘状态、快照/备份、监控告警和近期操作日志。
### 网络和访问问题
分别检查 DNS、路由、安全组/防火墙、操作系统防火墙、服务监听、证书、负载均衡监听器、反向代理、代理服务、后端健康状态和客户端访问路径。不要因为 ping 成功就假设应用可用。
### 服务器部署和代理服务
生产服务器、测试服务器和代理服务器的部署或配置变更,都按状态变更处理。变更前必须确认服务名、配置文件、进程管理方式、端口、依赖、备份方式、回退命令和验证路径。
### 内部平台运维
AI 网关(newapi)、sub2api 等内部平台,优先检查服务健康、配置、日志、数据库连接、上游供应商/API key 状态、队列/缓存、反向代理和证书。涉及模型路由、额度、密钥、账号权限或数据库写入的修改,必须确认后执行。
### 成本和配额检查
优先使用只读账单和配额查询。区分包年包月资源、闲置资源、突增用量、过期套餐和流量相关费用。
### 文档更新
运维知识保持简短、事实化。稳定环境事实放在 `knowledge/`,流程放在 `runbooks/`,可复用 Agent 行为放在 `prompts/` 或本技能中。
## 输出风格
默认使用简洁中文。必要时给出精确命令和实际观测结果。涉及风险操作时,先说明安全边界和下一步可执行动作。
@@ -0,0 +1,4 @@
interface:
display_name: "多云基础设施运维"
short_description: "多云、服务器、代理、数据库和内部平台运维助手工具集"
default_prompt: "使用本技能作为多云与基础设施运维助手,执行云平台、服务器、代理、数据库和内部平台的查询、故障排查、变更规划和 Runbook 驱动维护。"
@@ -0,0 +1,28 @@
# 云平台入口
## 已确认入口
| 平台 | CLI / API 工具 | 官方文档入口 | 备注 |
| --- | --- | --- | --- |
| 腾讯云 | `tccli` | `https://cloud.tencent.com/document/product` | 有官方命令行工具 TCCLI 文档。 |
| 阿里云 | `aliyun` | `https://help.aliyun.com/` | 有官方阿里云 CLI 文档。 |
| 火山引擎 | `ve``@volcengine/cli` | `https://www.volcengine.com/docs` | CLI 仓库:`https://github.com/volcengine/volcengine-cli`。本机已安装,验证版本为 `1.0.48`。执行具体命令前先查 `ve help` 或官方文档确认参数。 |
## 腾讯云常用只读检查
```powershell
tccli cvm DescribeInstances --region ap-guangzhou
tccli lighthouse DescribeInstances --region ap-guangzhou
tccli vpc DescribeSecurityGroups --region ap-guangzhou
tccli clb DescribeLoadBalancers --region ap-guangzhou
```
## 通用规则
- 查询类操作直接执行,不需要确认。
- 增删改、重启、扩缩容、部署、迁移、授权、恢复、故障切换等操作必须确认后执行。
- 跨云排查时,先确认平台,再确认账号、地域/可用区、资源 ID 和业务归属。
- 不同平台的同类资源命名不同,不要把一个云厂商的参数直接套用到另一个云厂商。
- 目标明确后,始终显式传入地域/可用区参数。
- 执行操作时优先使用资源 ID,不依赖资源名称。
- 不要运行会明文输出本地凭据的命令。检查 CLI 可用性或配置状态时,优先使用版本查询、环境变量存在性检查、profile 文件存在性检查或脱敏读取。
@@ -0,0 +1,39 @@
# 运维检查清单
## 确认策略
- 只读查询操作:不需要请求确认;目标范围和凭据明确时直接执行。
- 状态变更操作:执行前必须得到用户明确确认。
- 状态变更操作包括创建、更新、删除、重启、停止、启动、扩缩容、续费、绑定、解绑、部署、发布、迁移、恢复、故障切换、授权、撤权、导入和数据写入。
- 请求确认前必须列出:
- 目标账号、地域、资源类型和资源 ID。
- 将要执行的具体操作。
- 预期影响和可能的停机时间。
- 是否可以回退,以及如何回退。
- 执行前是否需要备份、快照或导出。
- 变更后的验证方式。
## 只读发现
- 确认云账号和凭据 profile。
- 确认地域和资源 ID。
- 收集当前配置。
- 检查监控、日志、告警和近期操作历史。
- 识别依赖项,例如 DNS、CLB、安全组、VPC 路由、NAT、COS bucket、证书和后端服务。
## 生产变更
- 说明影响范围和预计持续时间。
- 变更前准备回退方案。
- 变更前判断是否需要备份、快照或导出。
- 记录变更前配置值。
- 执行能解决问题的最小变更。
- 变更后从用户可见路径验证。
## 故障响应
- 先止血,再解释。
- 尽可能缩小影响范围。
- 破坏性清理前先保留证据。
- 用具体时间戳记录时间线。
- 将重复出现的修复动作沉淀为 Runbook 或脚本。
@@ -0,0 +1,45 @@
# 工具路由
## 云平台 CLI 和 API
- 腾讯云:使用 `tccli`。官方文档入口:`https://cloud.tencent.com/document/product`
- 阿里云:使用 `aliyun`。官方文档入口:`https://help.aliyun.com/`
- 火山引擎:使用已安装的 `ve` 命令(`@volcengine/cli`)。CLI 仓库:`https://github.com/volcengine/volcengine-cli`。官方文档入口:`https://www.volcengine.com/docs`。执行具体命令前,先用 `ve help` 或官方文档确认参数。
- 对任意云平台,查询类操作可直接执行;变更类操作必须先列影响、回退、备份和验证方式,并获得确认。
- 优先使用 CLI/API 证据,不依赖人工猜测。
## Tabby MCP
需要通过已有终端或 SSH 会话操作真实服务器时,使用 Tabby MCP:
- 检查进程、端口、磁盘、CPU、内存和服务状态。
- 查看服务器上的应用、Nginx、systemd、Docker 或数据库客户端日志。
- 从服务器视角执行网络测试。
- 运维局域网生产服务器、测试服务器、代理服务器,以及云服务器。
- 用户确认后执行服务器侧变更。
## CDP/browser 文档查询
使用 CDP/browser 工具查看官方文档:
- 腾讯云:`https://cloud.tencent.com/document/product`
- 阿里云:`https://help.aliyun.com/`
- 火山引擎:`https://www.volcengine.com/docs`
当 API 名称、产品行为、命令参数、限制、计费规则或功能语义可能变化时,查询官方文档。当前产品行为以官方文档为准。
## dbx MCP
使用 dbx MCP 连接数据库:
- 只读的 schema、状态、慢查询、复制、锁和数据检查,在范围明确时不需要确认。
- 任何数据写入、DDL、权限变更、备份恢复、故障切换、迁移或参数修改,都必须得到明确确认。
- 数据库变更前必须说明备份/导出要求和回退可行性。
## 内部平台
AI 网关(newapi)、sub2api 等平台通常需要组合使用 Tabby MCP、dbx MCP 和文档/配置文件:
- 用 Tabby MCP 检查服务进程、日志、配置、反向代理和部署状态。
- 用 dbx MCP 检查数据库连接、账号、额度、路由、日志和异常数据。
- 修改模型路由、供应商配置、额度、密钥、账号权限或数据库记录前,必须得到确认。