中国信通院云大所发布《云上人工智能可靠性建设指南(2026年)》

来源:中国信通院

近年来,我国持续强化人工智能发展顶层设计。2025年《政府工作报告》提出持续推进“人工智能+”行动,国务院随后印发《关于深入实施“人工智能+”行动的意见》,明确强化智能算力统筹、提升安全能力水平,推动人工智能发展安全、可靠、可控。云上AI系统正由辅助工具演变为支撑业务创新与关键决策的新型基础设施。与此同时,模型幻觉、数据漂移、训练中断、推理拥塞及工具越权等风险不断涌现,传统以“服务不中断”为核心的可靠性方法面临新的挑战。

近日,在2026可信云大会暨首届Token云服务大会Agentic Cloud分论坛上,中国信息通信研究院(简称“中国信通院”)云计算与数字化研究所发布《云上人工智能可靠性建设指南(2026年)》,中国信通院云计算与数字化研究所王海清对报告进行了解读。

报告面向模型服务、AI平台和Agent系统,系统提出云上AI可靠性建设的总体框架、关键能力与实施路径,为相关组织开展规划、建设、运营和治理提供参考。


报告核心观点

1. AI可靠性正从“保障系统在线”迈向“保障智能可信”

传统软件的运行逻辑相对确定,可靠性主要关注系统能否持续提供服务。AI系统则基于数据和概率模型运行,即使基础设施始终在线,也可能因数据分布变化、模型能力退化或Agent决策偏差产生不可靠结果。

本报告认为,云上人工智能可靠性不仅要保障基础设施和服务的高可用,还要保障AI系统在全生命周期内持续输出满足准确性、公平性、鲁棒性且符合业务目标的可信结果。其内涵由系统可靠性进一步延伸至模型可靠性和业务可靠性,实现从“能否工作”向“能否正确、可信地工作”转变。

2. 应以“四高”为目标,构建全链条可靠性能力

本报告提出高可用性、高解释性、高鲁棒性和高可恢复性四项核心建设目标。

高可用性,保障基础设施、模型服务及Agent任务持续稳定运行;高解释性,使模型输出、决策路径和工具调用可追溯、可审计;高鲁棒性,提升系统应对数据漂移、资源波动、异常输入和潜在攻击的能力;高可恢复性,建立故障监测、自愈、灾备和回滚机制,推动可靠性由被动处置迈向主动修复。

3. 云上人工智能系统可靠性边界覆盖基础设施、数据、训练、推理和AI应用

云上AI系统各层之间高度耦合,任何局部异常都可能沿调用链向上扩散并影响业务。《指南》构建“基础设施层—数据层—训练层—推理层—AI应用层”五层技术架构:基础设施层重点保障异构算力、网络和存储稳定;数据层保障数据可用、可信、可追溯;训练层关注训练连续性、过程可复现和模型鲁棒性;推理层兼顾高并发、低时延、服务连续性与成本;AI应用层重点保障意图理解、任务规划、工具调用和结果交付安全可靠。

4. 应以“三阶段”路径推动能力持续演进

本报告提出由“基础高可用—弹性自愈—智能预判”构成的成熟度建设路径。起步阶段重点实现问题可感知、故障可恢复;进阶阶段通过自动扩缩容、MLOps流水线、灰度发布、熔断降级和混沌工程,实现主要故障场景下的自动处置;成熟阶段进一步引入AIOps、预测性维护和智能根因分析,在用户感知前识别风险并完成资源迁移、模型切换或策略调整。

与此同时,可靠性建设不只是技术团队的专项工作,还需要SRE、算法、数据、业务、安全与合规等角色协同,将可靠性目标嵌入系统设计、开发、发布、运营与治理全过程。


报告目录

一、背景与总体概述
(一)云上人工智能可靠性的内涵
(二)云上人工智能可靠性的核心价值
(三)应用边界与整体发展方向

二、云上人工智能系统的可靠性挑战
(一)基础设施层挑战
(二)数据层挑战
(三)训练层挑战
(四)AI应用层挑战

三、云上人工智能系统的可靠性设计
(一)可靠性工程的设计原则
(二)可靠性工程分层技术架构
(三)可靠性工程管理体系
(四)可靠性工程分层评估体系

四、云上人工智能可靠性实施路径与建设规划
(一)成熟度分阶段建设路径
(二)关键能力建设清单
(三)优化组织与治理机制

五、发展展望
(一)AI驱动下的可靠性技术:从单点保障走向智能协同
(二)企业AI可靠性管理:迈向治理、价值与韧性新形态
(三)跨行业AI可靠性:标准与生态协同新阶段


主要专家简介

陈屹力,中国信通院云计算与数字化研究所副总工程师,工程师
长期从事云计算领域产业发展、关键技术研究、标准制定等相关工作。牵头撰写云计算国家/行业标准20余项,重点支撑工信部等部委围绕云计算、软件工程、运行安全、智算服务、低空经济等领域开展相关工作,参与国家重大政策文件起草。

郑立, 中国信通院云计算与数字化研究所智能系统与工程部副主任,高级工程师
研究方向为智能计算、智能系统、大规模智算集群、软件工程智能化等。累计在国内外期刊、会议上发表论文近10篇,累计牵头编制CCSA行业标准逾15项、国家标准3项、ITU-T国际标准9项。

王海清,中国信通院云计算与数字化研究所工程师
深耕云服务稳定性保障与AI可靠性方向,围绕高可用架构、可观测性等关键技术领域持续开展标准研制与产业实践。牵头编制多项稳定性保障行业标准,撰写可观测性技术发展、分布式系统稳定性建设等相关行业报告,参与云服务运行安全相关政策研究。

雷舒心,中国信通院云计算与数字化研究所工程师
主要从事云计算、AI可靠性、Agentic Cloud及系统稳定性保障领域技术研究工作。牵头完成Agent可靠性相关标准编制。


版权声明:本报告版权属于中国信息通信研究院,并受法律保护。转载、摘编或利用其它方式使用本报告文字或者观点的,应注明“来源:中国信息通信研究院”。违反上述声明者,本院将追究其相关法律责任。

最新文章