智能运维体系（智能运维体系架构）

来源网友投稿 1027 2023-02-01

本站部分文章、图片属于网络上可搜索到的公开信息，均用于学习和交流用途，不能代表睿象云的观点、立场或意见。我们接受网民的监督，如发现任何违法内容或侵犯了您的权益，请第一时间联系小编邮箱jiasou666@gmail.com 处理。

本篇文章给大家谈谈智能运维体系，以及智能运维体系架构对应的知识点，希望对各位有所帮助，不要忘了收藏本站喔。今天给各位分享智能运维体系的知识，其中也会对智能运维体系架构进行解释，如果能碰巧解决你现在面临的问题，别忘了关注本站，现在开始吧！

本文目录一览：

1、智能运维是什么？
2、智能运维适合哪些场景？涉及哪些领域？
3、智能运维就是由AI代替运维人员
4、关于运维体系建设有没有什么好点的建议？

智能运维是什么？

得益于IT外包服务的发达，现在的运维已经不包括搬机器上架、接网线、安装操作系统等基础工作，运维人员一般会从一台已安装好指定版本的操作系统、分配好IP地址和账号的服务器入手，工作范围大致包括：服务器管理（操作系统层面，比如重启、下线）、软件包管理、代码上下线、日志管理和分析、监控（区分系统、业务）和告警、流量管理（分发、转移、降级、限流等），以及一些日常的优化、故障排查等。
随着业务的发展、服务器规模的扩大，才及云化（公有云和混合云）、虚拟化的逐步落实，运维工作就扩展到了容量管理、弹性（自动化）扩缩容、安全管理，以及（引入各种容器、开源框架带来的复杂度提高而导致的）故障分析和定位等范围。
听上去每一类工作都不简单。不过，好在这些领域都有成熟的解决方案、开源软件和系统，运维工作的重点就是如何应用好这些工具来解决问题。
传统的运维工作经过不断发展（服务器规模的不断扩大），大致经历了人工、工具和自动化、平台化和智能运维（AIOps）几个阶段。这里的AIOps不是指Artificial Intelligence for IT Operations，而是指Algorithmic IT Operations（基于Gartner的定义标准）。
基于算法的IT运维，能利用数据和算法提高运维的自动化程度和效率，比如将其用于告警收敛和合并、Root分析、关联分析、容量评估、自动扩缩容等运维工作中。
在Monitoring（监控）、Service Desk（服务台）、Automation（自动化）之上，利用大数据和机器学习持续优化，用机器智能扩展人类的能力极限，这就是智能运维的实质含义。
智能运维具体的落地方式，各团队也都在摸索中，较早见效的是在异常检测、故障分析和定位（有赖于业务系统标准化的推进）等方面的应用。智能运维平台逻辑架构如图所示。
智能运维平台逻辑架构图
智能运维决不是一个跳跃发展的过程，而是一个长期演进的系统，其根基还是运维自动化、监控、数据收集、分析和处理等具体的工程。人们很容易忽略智能运维在工程上的投入，认为只要有算法就可以了，其实工程能力和算法能力在这里同样重要。
智能运维需要解决的问题有：海量数据存储、分析、处理，多维度，多数据源，信息过载，复杂业务模型下的故障定位。这些难题是否会随着智能运维的深入应用而得到一定程度的解决呢？我们会在下一篇文章中逐步展开这些问题，并提供一些解决方案。
本文选自《智能运维：从0搭建大规模分布式AIOps系统》，作者彭冬、朱伟、刘俊等，电子工业出版社2018年7月出版。
本书结合大企业的智能运维实践，全面完整地介绍智能运维的技术体系，让读者更加了解运维技术的现状和发展。同时，帮助运维工程师在一定程度上了解机器学习的常见算法模型，以及如何将它们应用到运维工作中。

智能运维适合哪些场景？涉及哪些领域？

IT的智能运维AIOps，目前在国内落地比较多的是对IT故障容忍率更低的行业，比如金融、交通、互联网等等。各厂商主要的差异在于数据治理的能力和经验（当数据量越来越大时，一个好的运维数据中台可以保证运行性能）、产品线的覆盖度（告警、日志、指标等均可进行智能分析）、智能场景的丰富度。

对于智能运维来说，常见的智能场景有异常检测、根因定位、自动排障、容量预测、告警收敛、日志聚类等。随着应用的进一步广泛，智能场景也会不断更新、越来越多。

智能运维AIOps体系架构

智能运维就是由AI代替运维人员

现在新技术发展的特别快，各种语言、技术、理念让大家确实感到自顾不暇跟不上趟，但是有一点，在这里我要特别重申一下，AI 在目前这个阶段还是一种辅助大家来进行判断和学习、定位处理问题的工具，就像无人驾驶，现在可以做到完全没有人驾驶吗？肯定不行，未来无人驾驶是完全可以替代人的，但它还有很长一段路要走。AI 运维就像无人驾驶一样，未来前景很光明，但任重道远。

第一个 IT 部门的整体认可不足。虽然说IT在任何单位现在都是一个比较重要的部门，但是还有很多领导仍然认为它是一个成本中心，不是一个利润中心，认为这个部门是花钱的，而不是像业务部门创造业务价值和创造利润的。

第二个对于运维工作人员负荷比较大，工作模式不被员工认可。在没有自动化运维和平台之前，整个运维团队只有八个人，如果每个人一天处理六到十个故障，基本上没有时间去研究别的东西了。传统运维压力很大，疲于奔命和救火，必须要寻求改变，走向自动化、平台化、智能化。

第三运行的态势相关信息掌握不足。监控是多维度的，不同的业务会有不同的指标，所有加起来有上万个指标，但却没有整体态势变化图、很难成体系，不能实现智能感知和态势预测，整个运维态势就很难保持平稳。

第四依据业务需求调整服务和设置资源的能力不足。在业务故障处理的时候需要很长的过程，中间涉及到很多的相关技术部门，需要和业务方进行交互，仅靠较少的人力几乎做不到。

关于运维体系建设有没有什么好点的建议？

作为企业数字化转型的重要手段，IT运维效率的高低会直接影响到业务的正常运转，传统运维走向智能运维，其实就是运维数字化的过程。在智能运维建设过程中，先平台还是先场景，对于很多企业用户来说一直是个难题。如果用户对自身数据情况了解非常清晰，且希望打破数据孤岛以建立统一运维数据平台，那么可以优先选择平台建设；如果用户明确知道底层平台需要的能力，寄希望于能直接带来业务价值，可以优先选择场景建设。

例如一家城市商业银行，它目前最大的问题可能只是监控效能低下，误报漏报多，我们可以先从集中告警入手，利用算法去重降噪，再查看相关告警之间的有效告警场景，筛选出最可能影响业务问题的告警。在提高告警处理效率后，再通过分析告警的源头，进一步解决监控指标静态阈值设定不准确的问题，用智能异常检测替代之，从而根本上提升监控效能。这就是场景化方式导入智能运维的方法。

智能运维建设，可以根据用户实际运维情况，同步开展，循序渐进地进行建设。擎创根据以往经验，总结出三个原则六步走的最佳实践方案，我们首先可以通过集中监控智能化改造、指标监控智能化改造和日志异常检测（弥补监控手段不足）等提升实时性数据处理能力，再通过智能故障排查（根因分析和定位）、智能知识管理（知识图谱）和故障自愈提升数据事后分析和处理能力。

对于有些公司提出的，运维成熟度不高不敢考虑智能运维？

运维成熟度度高的的企业，可以按照数据处理能力的维度，统一规划、分层实施，实现从运维数据局部集中到跨域集中，也就是先建立运维大数据平台，通过加强数据治理、优化数据质量，而后再过渡到基于算法的统计分析乃至流式实时处理，构建多样化智能运维场景，逐层实现智能运维能力建设。

但这种方式并非放之四海而皆准，对于成熟度不高的企业，迫切需要解决的是实际运维问题，而智能运维这时应该能成为解决实际问题的工具，它可以根据客户当前的运维成熟度选择具体应用场景，按照不同的路线图进行建设，这才是智能运维的应有的能力。智能运维的本质就是逐步提升对运维数据的分析处理能力。

智能运维体系（智能运维体系架构）

关于智能运维体系和智能运维体系架构的介绍到此就结束了，不知道你从中找到你需要的信息了吗？如果你还想了解更多这方面的信息，记得收藏关注本站。智能运维体系的介绍就聊到这里吧，感谢你花时间阅读本站内容，更多关于智能运维体系架构、智能运维体系的信息别忘了在本站进行查找喔。

标签：智能运维智能运维智能运维平台系统

暂时没有评论，来抢沙发吧~

智能运维体系（智能运维体系架构）

智能运维是什么？

智能运维适合哪些场景？涉及哪些领域？

智能运维就是由AI代替运维人员

关于运维体系建设有没有什么好点的建议？

实时警报通知：微信告警通知的重要性解析

睿象云智能告警平台的分派策略

智能告警平台CA如何分组及邀请成员