日常运维工作中,故障响应始终是最考验经验、也最消耗人力的环节。错误率突增、响应变慢、服务不可用、应用崩溃、页面卡顿……面对这些问题,运维人员往往需要先查看日志、分析堆栈、比对指标、梳理调用链,才能从分散的信息中拼出一个站得住脚的结论。这一过程高度依赖个人经验,排查路径长,且结论难以复现与验证。
Bonree ONE·Sage AI 运维智能体工作台中的「故障诊断助手」,将这一排查过程自动化。它基于 Bonree ONE 采集的全栈可观测数据——指标、日志、堆栈、调用链、拓扑,对企业实际运行的业务系统、应用与服务进行故障诊断,支持多维度下钻分析与指标关联分析,并能解析图片或纯文本中的堆栈信息、自动分类归因,最终输出诊断结论与修复建议。以下是一次真实告警的完整诊断过程。

一句话诊断告警,自动定位根因
“服务请求错误率较高-langchain_router_api-mcp-http-请求错误率-告警”——帮我诊断这个告警。
将告警原文直接提交给故障诊断助手,诊断随即启动。故障诊断助手先加载 alert-diagnosis 技能,调用工具解析告警画像文件,再执行分析脚本,还原问题发生的完整时间线。
不是笼统结论,而是返回可核验证据链
区别于“大概率是某处问题”的模糊判断,故障诊断助手输出的是可以逐条核验的证据链:它定位到问题集中在服务的 /mcp 请求路径上,将两次关键错误精确追溯至具体报错堆栈与代码路径,并按可信度对多条证据链排序,明确标注“主因候选、可信度最高”的结论。同时,它梳理出此次告警波及的六个关联实体,逐一标注健康状态,影响范围一目了然。
不止找到原因,更给出下一步行动
诊断并未止步于根因定位。故障诊断助手同步给出改进策略:优先排查项、可执行的二次验证命令均直接列出;此外补充长期监控与应急预案建议,例如告警阈值如何调整、哪些指标应联动观察,帮助团队降低同类问题再次发生的概率。对话结束后,界面还提供多个可一键追问的方向,方便运维人员沿诊断结果继续深挖。
原本需要人工翻查日志、逐一比对指标才能拼出的结论,就此压缩进一次对话之中。告警解析、日志排查、堆栈分析、指标比对、证据链构建等重复性排查操作由智能体自动执行,故障定位耗时大幅缩短,运维人员得以将更多精力投入根因复核、方案决策与修复验证。
一键触发,缩短排查路径
告警信息可直接粘贴或转发,自动启动诊断,省去打开日志、翻查监控面板逐项核对的过程。
深入代码堆栈,而非停留在指标猜测
可解析图片或纯文本中的堆栈信息,精确定位报错发生的具体代码路径,而不是仅凭指标异常做模糊推断。
输出可验证证据链,而非单一结论
针对同一告警构建多条候选证据链并按可信度排序,明确标注主因候选,判断过程全程可追溯。
同步评估影响范围
自动梳理告警关联的服务、实例、容器、进程、主机等实体,标注各自健康状态,故障波及范围清晰可见。
诊断之外,兼顾复核与预案
在给出根因结论的同时,附上可执行验证命令与长期监控建议,让诊断结果真正能落地执行,而不止于一份报告。
Bonree ONE·Sage AI 智能体工作台已覆盖系统巡检、故障分析、平台操作、智能客服、容量评估、数据库分析、系统变更等核心运维环节,将原本依赖专家经验的分析、判断与处置能力,逐步沉淀为企业可复用的智能运维能力。未来,随着更多智能体深入业务场景,运维团队获得的不只是更快的问题响应,而是一套能够持续学习、辅助决策、推动运维智能化升级的新型工作方式。

扫码或点击下方海报,即刻预约免费试用Bonree ONE·Sage AI

