全球知名的数据中心标准组织和认证机构Uptime Institute最近开展了第八次数据中心技术年度调查,其内容涵盖关于数据中心的技术应用、冗余级别、机架密度、人员配置和技能、气候变化准备等。这引起业界人士的关注和讨论。但即便是最详细权威的调查也会引发争议和怀疑,这也许是由于定义、样本量、偏差,甚至是偏见造成的,有时会看到数据中心高管对此束手无策,并试图解释或证明奇怪或无可辩驳的发现。

对Uptime Institute的调查结果很少有人提出异议,但人们一直在关注有关数据中心业务中断或停电问题的头条新闻,想知道其调查数据是否正确,或者它是否真的支持明显的结论。这个调查报告明确表明,与以往的调查相比,数据中心业务中断事件很常见,并且显然越来越多。但是有一些人对这一发现提出质疑,其中包括Uptime Institute一些内部人士。这可能是因为数据中心设备、专业知识、管理措施比五年或十年前更加先进完善。那么业务中断怎么可能更常见?

此外,人们还有一个争论的话题:数据中心能源效率是否以牺牲可靠性为代价?正如Uptime Institute调查报告的PUE数据显示,能源效率在过去五年中有明显改善,而数据中心可靠性似乎正在恶化。这是否意味着这二者之间有关联?这当然是可能的,围绕数据中心基础设施冗余的一些调查结果也表明了这一点。但Uptime Institute对此没有确定,并没有将这些问题联系在一起,因为就算有一定的相关性,也不是因果关系。

寻找答案

为了更接近事实,需要深入挖掘,包括采用一些新方式处理数据。为此,Uptime Institute提出了10个与数据中心可靠性相关的问题,其中包括两个或三个关键问题。在回答这个问题的644位企业高管、IT员工和关键设施经理中,近三分之一(30.8%)的受访者表示,在过去一年中经历过IT停机事件或“服务严重退化”,而在一年,只有26.9%的受访者这么认为。这看起来有明显的上升。

1

此外,还提出“在过去三年中遇到过业务中断吗?”这个问题,而这在前几年的调查中没有提出,但即便如此,数据中心中断/事故的发生率远高于Uptime Institute的预期(48.1%的受访者对此表示肯定)。这看起来并不像行业厂商广泛宣称的99.999%的可用性。但人们的争论并不止于此。Uptime Institute越来越多地将业务中断视为复杂且通常是多站点IT服务中断事件,而不仅仅是单站点设施事件。

Uptime Institute希望更好地了解导致数据中心停电的原因,例如电力、网络和IT甚至第三方服务的百分比,并改变了措辞。Uptime Institute在2018年对此描述为“IT服务中断或严重的服务质量下降。”而在2017年使用了“在自己的数据中心或服务提供商的数据中心中影响业务的数据中心中断”这一描述。不幸的是,这种变化并非如此(虽然这两个定义明确涵盖了一系列中断)。

对设施管理人员、IT管理人员和高管的调查中,又提出了一个问题,“数据中心工作人员是否会看到与高级IT经理或企业CIO相同的停机次数?”企业CIO很可能对在公共云(托管数据中心)中运行的所有服务负责,或者负责主要的企业设施,因此可能会遇到更广泛的中断(包括退化)。

Uptime Institute收集了有关工作角色的数据以及他们在2018年遇到业务中断的情况。2018年的调查数据确实表明企业CIO收到更多中断的报告。38%的IT经理表示,他们的组织在过去一年中经历了停电(三年中为57%)。数据中心关键设施工作人员报告的数字远低于此:22%的人表示在一年中经历业务中断(三年内为38%)。在这两种情况下,超过三分之二的受访者表示业务中断只影响一个站点。然而,IT管理部门报告说网络中断是最常见的问题,而设施管理人员报告说,现场电力中断是造成停电的主要原因。出于多种原因,业务经理往往会看到更少的业务中断。

那么这是否意味着数据中心停电事件正在增加?这有些令人担心,根据2017年的调查数据,关键设施管理人员在2017年遭遇了更多中断(2018年为28%,而2017年为22%)。但是,IT报告中,企业管理人员比例在2018年增加到38%,比2017年增加了5%。

总体而言,表示经历中断的调查受访者的百分比上升,但结果表明那些具有更广泛IT角色的人员会看到更多中断,甚至有一些模糊性和角色和定义的变化。这一发现似乎可能是出现更多的IT和网络故障。如果能够进一步进行调查和研究,期望数据中心业务中断的增加与能源效率无关。尽管如此,采用“N+1”冗余架构的数据中心设施中断的失败率高于成本更高、采用更少能源的高效的2N冗余架构。

所有这些发现都支持Uptime Institute的立场,即现在考虑IT和服务提供商的问题以及与站点相关的问题,从整体上看待数据中心的可靠性和故障率是有意义的。

在这个调查报告中,以及关于停电的更详细的报告中,Uptime Institute的数据表明数据中心停电仍然“普遍、昂贵、可预防的,甚至可能会增加。”抛开所有的细微差别,传达给数据中心和关键IT服务运营业务的组织的信息非常简单:需要关注所有服务和整个堆栈,否则将付出更大的代价。

【中国IDC圈编译 未经授权禁止转载】

相关阅读:

能够灵活配置的PDU如何助力现代数据中心变化?

以太网虚拟专用网络在现代数据中心的兴起

哪一个数据中心关键绩效指标(KPI)最有用?

关注中国IDC圈官方微信:idc-quan 我们将定期推送IDC产业最新资讯

查看心情排行你看到此篇文章的感受是:


  • 支持

  • 高兴

  • 震惊

  • 愤怒

  • 无聊

  • 无奈

  • 谎言

  • 枪稿

  • 不解

  • 标题党
2022-12-30 09:39:00
2022-09-08 16:24:00
运维管理 数据中心经理在解决人才短缺问题时必须考虑的5个原则
为了在求职者市场留住顶尖人才,雇主需要收集员工和候选人的反馈,以根据当今工人不断变化的需求和需求进行调整。 <详情>
2022-01-18 09:56:43
2022-01-12 10:21:57
国际资讯 因第三方数据中心停电,伦敦金属交易所受影响
因第三方数据中心停电的缘故,LME周一晚间遭遇(网络)连接问题。这至少使一些交易员无法进入为铜、铝等主要商品设定全球价格的场所。 <详情>