📷 [图片 token=G14Ob8vCgojif1xVaktcgL2wnPt(未能下载,见飞书原文)]

规划-执行-重规划

运维Agent的核心目标是将运维人员的告警处理经验转化为自动化流程,通过 计划生成->工具执行->动态调整 的闭环,替代人工完成重复性告警排查工作。

整体架构可概括为:

  1. Planner生成结构化排查计划

  2. Executor调用监控/日志工具执行步骤

  3. Replanner评估结果,决定继续执行/调整计划/输出结论

📷 [图片 token=Nmb9bLOD2oH6ysxP07KcS2l3nDh(未能下载,见飞书原文)]

核心流程拆解

计划生成(Planner):将经验转化为结构化步骤

目标:基于告警类型和召回的运维手册,生成可执行的多步骤排查计划,替代人工凭经验梳理流程的过程。

核心逻辑

  • 输入:告警信息(alertname、description)+ 召回的处理文档

  • 输出:结构化计划(JSON格式),包含步骤描述、工具调用参数、预期结果

示例计划结构

{  
  "goal": "排查接口失败率过高问题",  
  "steps": [  
    {  
      "step_id": "1",  
      "action": "query_log",  
      "description": "根据接口名和'response'关键词搜索最近1小时日志",  
      "parameters": {"service": "ad_app", "keyword": "response error", "time_range": "1h"},  
      "expected_result": "返回包含error信息的日志片段"  
    },  
    {  
      "step_id": "2",  
      "action": "analyze_error",  
      "description": "解析日志中的error类型,判断是否为'context cancel'",  
      "parameters": {"log_content": "{{step1_result}}"},  
      "expected_result": "明确错误原因(如超时/下游异常)"  
    }  
  ]  
}  

计划执行(Executor):调用工具完成单步排查

目标:通过集成监控/日志工具,自动执行计划中的步骤,替代人工 查日志/查监控 的操作。

核心工具示例

  1. 告警查询工具(query_prometheus_alerts):从Prometheus API获取当前活跃告警详情

  2. 日志查询工具(query_log):通过腾讯云CLS的MCP服务,用自然语言查询日志(如 搜索ad_app最近1小时的response error日志 )

动态重规划(Replanner):评估进度并调整策略

目标:根据Executor的执行结果,判断是否需要调整计划(如增加步骤、终止排查),替代人工 持续关注/判断是否需进一步处理 的决策过程。

评估逻辑

  • 成功条件:当前步骤结果符合预期(如步骤1返回error日志,步骤2明确原因为 context cancel ),执行下一步

  • 调整条件:结果不符合预期(如日志查询无结果),触发计划修正(如扩大时间范围、更换关键词)

  • 终止条件:达到目标(如确认 下游发版导致临时超时,无需处理 )或无法继续(如需人工介入下游沟通)

示例重规划决策

// 步骤1执行结果:未查询到error日志  
Replanner判断:可能关键词不准确 -> 修正计划步骤1的parameters为{"keyword": "timeout OR cancel", "time_range": "2h"}  
// 步骤2执行结果:error类型为"context cancel"且持续时间<30分钟  
Replanner判断:符合 下游发版临时问题 案例 -> 终止计划,输出结论  

总结

运维Agent的自动化能力源于三方面协同:

  • 结构化规划:Planner将模糊的运维经验转化为可执行步骤,降低复杂告警的处理门槛

  • 工具化执行:Executor集成监控/日志系统,替代人工重复操作,提升响应速度

  • 动态的调整:Replanner根据实时结果修正计划,适配 下游发版/临时抖动 等不确定性场景

通过这套架构,运维Agent可接管80%的重复性告警排查工作,让工程师聚焦于根因分析和流程优化。