AI + SRE ≠ AISRE:AI 如何真正进入生产运维闭环|QCon上海

携程大数据平台 SRE 总监周昕毅将在 2026 年 QCon 上海站分享《AI + SRE ≠ AISRE》,结合携程生产实践说明 AI 如何真正进入运维闭环,而非只是加一个 Copilot。这套方法论对正在评估 SRE 场景 AI 落地的团队有直接参考价值。

一句话看懂:携程大数据平台 SRE 总监周昕毅将在 2026 年 QCon 上海站分享《AI + SRE ≠ AISRE》,结合携程生产实践说明 AI 如何真正进入运维闭环,而非只是加一个 Copilot。这套方法论对正在评估 SRE 场景 AI 落地的团队有直接参考价值。

事件核心:发生了什么

2026 年 QCon 全球软件开发大会·上海站定于 10 月 22 日—24 日举办,主题聚焦 Harness AI 时代的工程实践。携程大数据平台 SRE 总监周昕毅已确认出席“理性驾驭 AI 的 SRE 可靠性工程”专题,发表题为《AI + SRE ≠ AISRE:AI 如何真正进入生产运维闭环》的演讲。

他的核心观点是:给 SRE 加一个 AI 不等于 AISRE。真正的 AISRE 要求 AI 从看懂告警、日志、指标,到关联上下文定位根因、生成处置方案、调用工具执行、验证结果并形成反馈,走完整个运维闭环。演讲将围绕三个来自携程生产环境的实践展开:告警自愈闭环使平台故障 MTTR 降低 50%;核心组件智能诊断工具缩短新人上手时间、降低 on-call 压力;Storage Insight 冷热数据识别使存储单价下降 20%。

为什么重要

当前大量团队把大模型接入运维面板,做的是“问答式辅助”,模型回答得不错,但没人敢让它动生产环境。这背后的瓶颈不是模型能力,而是信任机制、知识结构化和执行闭环。周昕毅的分享给出的正是一套分层判断框架——“数据友好→开发友好→运维友好”三层递进模型,帮助团队先判断自身基础设施是否成熟,再决定 AI 该落在哪一层,避免在错误层面投入资源。目前公开信息显示,其对自动化执行信任建立、知识库持续维护、效果量化归因三类难点的描述,也代表了行业普遍未解决的工程问题。

对用户/开发者/创作者的影响

对 SRE 和平台工程师来说,最直接的参考是告警自愈的渐进式信任路径:只看不动→人工确认后执行→低风险操作自动执行,以及自愈误操作的防护机制设计。对正在做智能诊断工具的团队,知识结构化不是一次性工程,案例库和规则库需要随组件版本迭代持续维护,否则容易“上线即过时”。对负责成本治理的开发者,冷热识别模型的误判补救机制比模型本身更值得关注,因为它直接关系到业务可用性。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是携程这套自愈闭环在低风险操作自动执行上的边界如何划定,是否形成可对外复用的工具或开源组件;二是 MTTR 降低 50%、存储单价下降 20% 的效果评估方法,是否会给出更细的归因口径;三是 QCon 上海站该专题其他讲师是否带来金融、电商等不同场景的对照实践,形成跨行业参照。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 27514

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注