
AIOps实战02AIOps能做哪些事能力全景与成熟度我是老计。上一篇讲清了 AIOps 是什么、为什么运维需要它。这一篇把视野拉高给你画一张 AIOps 的能力地图让你看清它到底能做哪些事再讲清它的成熟度阶段。看全景是为了不盲人摸象讲成熟度是为了让你想清楚自己该从哪一步切入而不是一上来就幻想全自动运维。一AIOps的能力全景AIOps 能做的事很多但杂乱地罗列没意义。我按运维数据的流动顺序把它的核心能力串成一条链你顺着这条链就能看清全貌。第一环数据接入与处理。这是一切的地基。AIOps 要工作先得把运维数据喂进来指标(metrics)、日志(logs)、链路追踪(traces),还有配置、事件、变更记录等等。把这些多来源、多格式的数据采集进来、清洗好、标准化是 AIOps 能力的入口。数据这块有多重要我下个板块会专门讲这里先记住没有好数据后面全是空谈。第二环告警管理与降噪。数据进来后最先能创造价值的往往是治告警。把海量告警去重、压制、按关联关系分组从几百条噪音里提炼出少数几个真正的问题。这是 AIOps 最成熟、最容易见效的场景之一也是很多团队的第一步。第三环异常检测。不再靠人拍脑袋定死阈值而是让系统从历史数据里学出正常的样子自动发现指标、日志里偏离正常的异常。它能发现那些人肉盯不过来、或者阈值定不准的问题。第四环根因分析。当一堆告警和异常同时出现,AIOps 试图帮你回答那个最要命的问题根子到底在哪。通过分析告警之间的关联、服务之间的依赖、时间上的先后把一片混乱收敛到少数几个最可能的根因。这是运维最费脑、也最有价值的环节。第五环预测。用历史数据预判未来容量还够用多久、磁盘什么时候满、某个趋势会不会演变成故障。从被动救火走向主动预防这是 AIOps 想带运维去的地方。第六环自动化与自愈。发现和定位之后更进一步是自动处置自动扩容、自动重启、自动执行预案。让一部分问题不用人介入就被解决。这一环最诱人但也最需要谨慎(乱自动化会闯大祸),是成熟度最高的部分。第七环智能交互(大模型带来的新环)。这是 LLM for Ops 带来的用自然语言就能查询系统状态、让大模型解释告警和日志、做成运维助手回答问题、甚至做成 Agent 辅助执行。它横跨在上面所有环之上让人和 AIOps 的交互方式发生了质变。把这七环连起来数据接入到告警降噪到异常检测到根因分析到预测到自动化再加上贯穿其上的智能交互就是 AIOps 的能力全景。一款完整的 AIOps 平台大体就是围绕这张地图来构建的(下个板块会从产品需求角度再细讲每一块)。你不用一次全做但心里要有这张地图。这张地图还有一个隐含的规律值得点出越靠前的环节(数据、告警降噪)越基础、越成熟、越容易做、见效越快越靠后的环节(预测、自动化)越高级、越难、风险也越大。这个规律直接决定了你该按什么顺序建设 AIOps不是从最酷炫的自动自愈开始而是从最基础的数据和告警治理开始。我见过太多团队被自动化、智能这些词吸引跳过前面直接冲最后一环结果地基不稳、全盘皆输。能力地图不只是告诉你 AIOps 能干什么更暗示了一条从易到难、从基础到高级的建设路径。二AIOps的成熟度阶段有了能力地图还得有一把尺子衡量一个团队的 AIOps 走到了哪一步、下一步该往哪走。我用一个从被动到主动到自治的三段式来讲朴素但实用。第一阶段被动响应人干活AI打杂。这是起点。AIOps 在这里主要做一些辅助人的活帮你把告警降降噪、做点基础的数据聚合和展示决策和处置还全靠人。AI 是个打下手的减轻点负担但运维的主体还是人肉。大多数刚起步的团队在这个阶段而且这个阶段就已经很有价值了别小看告警降噪省下的那些精力。第二阶段主动发现,AI帮着看和判断。往前一步,AIOps 开始主动地帮你发现和判断自动检测异常、提前预警、辅助定位根因、预测容量风险。它从被动打杂变成主动地帮你盯着系统、提前提醒你哪里可能有问题、帮你缩小排查范围。这个阶段,AI 真正开始体现智能是大多数团队努力的目标性价比也最高。第三阶段自治,AI能自己处理一部分。最高阶是部分自治一些明确的、风险可控的问题,AIOps 能自动处置、自愈不用人介入。人从执行者退到监督者和设计者的位置。要强调的是完全的自动运维在今天既不现实也不明智,AI 会出错把生产系统的处置权完全交给 AI 风险太大。现实的自治一定是限定在小范围、高确定性、可回滚的场景里并且带着人的监督。我做运维 AI 工具时对涉及写操作、危险操作的自动化极其克制原因就在这。关于自治这一阶段我想多说两句因为这是最容易被厂商话术误导的地方。营销里常把全自动无人运维说得天花乱坠但真到生产环境没有哪个负责任的团队敢把删除、重启、扩缩容这类写操作完全托管给 AI 无人值守。我做那个 K8s 运维工具时定的铁律是查询类操作可以让 AI 自由做但凡涉及改动集群状态的写操作一律要走人工确认AI 只能提议、不能擅自执行而且全程留审计。这不是保守是对生产环境应有的敬畏。所谓自治理性的理解是把人从重复的、低风险的执行中解放出来而不是把人彻底踢出决策环。谁把这条边界守不住迟早要出大事故。这三个阶段的关键启示:AIOps 是循序渐进的别想一步登天。我见过不少团队一上来就想搞全自动智能运维结果数据没打好、场景没选对做成了一个花架子。务实的路径是先从被动阶段的告警降噪这种见效快、风险低的做起把数据和信任积累起来再往主动发现走自治留到最后、且始终谨慎。一步一个脚印比好高骛远靠谱得多。三怎么看自己该从哪切入结合能力地图和成熟度给你一个务实的切入建议这也是我做落地时的思路。第一先看数据现状。如果你连指标、日志、链路都还没采全、没治理好那当务之急是先把数据地基打好而不是急着上 AI 算法。数据不行,AIOps 再花哨也是空中楼阁。第二选一个痛点最痛、见效最快的场景切入。对大多数团队告警降噪是首选痛点最普遍(谁都受够了告警轰炸)、技术相对成熟、见效快、风险低。用一个小胜利建立团队对 AIOps 的信任再往下扩。第三匹配自己的成熟度别越级。数据和经验都还在起步就老老实实从被动辅助做起别在没跑稳异常检测时就想搞自动自愈。AIOps 的能力和团队的成熟度要匹配越级容易翻车。我再把这套切入思路浓缩成一句我常跟人讲的话AIOps 不是一场豪赌而是一连串的小胜利。别指望一个大项目一步到位建成智能运维中台那种大干快上的做法我见过失败的比成功的多。真正走得通的路是先用告警降噪省下大家半夜被吵醒的痛苦、赢得信任再用异常检测帮大家提前发现问题、积累数据和经验一步步往上走。每一步都要能拿出看得见的价值让团队和老板都觉得这事值。这种把大目标切成一连串小胜利、稳扎稳打的节奏既是 AIOps 的落地智慧其实也是我这些年做任何技术转型和平台建设都信奉的方法论。看清全景是为了不盲目认清成熟度是为了不冒进。知道 AIOps 能做什么、也知道自己现在能做到哪一步才能走得稳。补一句给管理者的话评估 AIOps 建设时别只盯着技术炫不炫要看它当前这一步是否匹配团队的数据基础和运维成熟度是否能带来实打实、看得见的收益。脱离成熟度谈能力是纸上谈兵踩着成熟度一步步来才是真本事。小结这一篇画了两张图一张能力全景图,AIOps 的核心能力沿着运维数据的流动串成一条链数据接入、告警降噪、异常检测、根因分析、预测、自动化再加上大模型带来的贯穿其上的智能交互。一张成熟度阶梯从被动响应(AI 打杂)、到主动发现(AI 帮看帮判断)、到部分自治(AI 处理一部分但完全自动运维不现实、需人监督)。核心启示是:AIOps 循序渐进、别一步登天务实的切入是先打好数据、从告警降噪这类高价值低风险的场景做起、匹配自己的成熟度。下一篇我们深入讲两代 AIOps,传统机器学习和大模型它们各自擅长什么、又该怎么融合。延伸阅读Gartner Market Guide for AIOps PlatformsGartner 官网 gartner.com 检索 AIOps Platforms《Site Reliability Engineering》与《The SRE Workbook》Google 官方在线书sre.google/booksPrometheus 告警与告警管理 Alertmanager 官方文档prometheus.io/docs/alertingOpenTelemetry 官方文档指标日志链路统一采集opentelemetry.io/docs本文为技术经验分享旨在梳理AIOps的能力全景与成熟度。文中观点结合个人运维经验不构成具体产品或采购建议实际落地请结合自身环境评估。