我们可以从最近五次 IT 中断中学到什么

Reatha

金融服务提供商安联集团发现业务中断和网络事件IT 故障、中断和数据泄露等是 2019 年全球两大主要商业风险。

对英国银行技术中断的一项研究发现,六家领先银行的日常 IT 故障很常见,每两周就会发生一起重大事件。

同样,美国审计总署 (GAO) 研究了 2015 年至 2017 年期间发生的 34 起航空公司 IT 中断事件,结果发现:85% 的此类中断造成航班中断、延误或取消。

2019 年是非同寻常的一年,组织所经历的 IT 中断数量之多、种类之多。似乎没有人能够免受性能下降的影响,包括大型航空公司、医院、商业银行、证券交易所,甚至云提供商。

今年发生的五起停电事件不仅造成了声誉受损、客户不满和财务损失,还为如何应对大规模事件提供了宝贵的经验教训。

2019 年 1 月:英国司法部

背景。2019 年 1 月,英国司法部 (MoJ) 遭遇了一次令人尴尬的 IT 中断,导致皇家检察署、刑事司法安全电子邮件系统 (CJSM) 和法庭听证信息记录系统等关键 IT 系统的性能中断了整整一周。

影响。英国的法律专业人士无法访问法庭 Wi-Fi 系统或司法部的电子邮件服务。这次故障影响了司法部数百个网站,导致陪审员无法登记,并将轻微罪行的听证会推迟了两周以上。

原因。司法部要求其供应商 Atos 对整个系统的中断负责。虽然司法部将源讯数据中心的基础设施故障归咎于可能的罪魁祸首,但司法部历史上对老化 IT 系统的投资不足也为法院技术系统的崩溃造成了一场完美风暴。

2019 年 3 月:Facebook、Instagram 和 WhatsApp

背景。Facebook 今年 3 月遭遇了最严重的宕机事件,其热门社交媒体应用程序(Facebook、Instagram、Messenger 和 WhatsApp)超过 14 小时无法访问。这次故障影响了全球超过 20 亿人,他们依赖 Facebook 的应用程序家族进行商务和娱乐。

影响。Facebook最近一个季度的收入为170亿美元,其中99%的收入来自其广告平台。第二天早盘,华尔街做空 Facebook 股票近 3%,而几家广告商在全天停电期间排队等待浪费广告支出的退款。

原因。Facebook 大规模宕机的原因是服务器配置更改引发了一系列问题。级联故障可能会在相互依赖的系统中产生一系列事件,从而导致大规模网络中断。

Facebook 前首席信息安全官 Alex Stamos最清楚的解释造成这次大规模停电的可能原因。

2019 年 5 月:Salesforce Pardot

背景。Salesforce 在 2019 年 5 月面临最大的服务中断,当时将数据库脚本部署到其Pardot 营销云最终向普通用户授予了提升的权限。

Salesforce 必须阻止对 Pardot 用户的访问,以防止员工窃取敏感的公司数据。但是,当此修复不起作用时,Salesforce 必须阻止对其他 Salesforce 服务(例如 Sales Cloud 和 Service Cloud)的网络访问。

影响。由于 Salesforce 工程师使受影响的系统脱机以解决用户访问权限问题,客户在 20 小时内无法访问 Pardot Marketing Cloud。虽然 Salesforce 能够在一天内恢复大多数客户的数据权限,但又花了 12 天的时间才推出其他 Salesforce 服务的修复程序。

原因。配置更改问题是导致领先云提供商 IT 中断的常见原因。错误的数据库脚本导致 Salesforce 几乎关闭了整个基础设施并解决了用户权限损坏的问题。

一旦公司解决了问题,Salesforce 客户就必须花费数小时来设置正确的访问权限级别。

2019 年 8 月:英国航空

背景。英国航空 (BA) 是英国最大的国际航空公司,每年为超过 4500 万乘客提供服务。由于航班登记和离港系统的性能问题,英国航空不得不取消希思罗机场、盖特威克机场和伦敦城市机场的 100 多个航班,并延误 200 多个国内和国际航班。

影响。事件发生期间,英航不得不手动为乘客办理登机手续,导致排队时间过长且等待时间过长。该航空公司向愤怒的乘客提供了两种选择:重新预订航班或获得退款以防止伦敦三个机场出现进一步的混乱和混乱。此次停电还导致英国和欧洲其他机场的航班延误。

原因。服务降级从 8 月 7 日星期三上午 8 点开始,直到下午 4 点左右才得到解决。用于在线办理登机手续和航班起飞的两个独立的 IT 系统造成了此次中断,影响了超过 25,000 名乘客。

2019 年 10 月:Chime 银行

背景。Chime 是一家纯数字银行,通过其移动应用程序为 500 万美国客户提供服务。 Chime 从 10 月 16 日星期三开始一直持续到 10 月 18 日星期五,导致会员无法在 ATM 机上提取现金、访问工资账户、借记卡购物和检查账户余额。

影响。在两天的停电期间,Chime 客户无法支付账单或履行其财务义务。 200名客户正式向联邦存款保险公司提出投诉,6000名客户签署了一份投诉书网上请愿要求Chime赔偿。经过多次投诉后,Chime 最终向所有在长期服务中断期间无法使用银行服务的活跃客户贷记了 10 美元。

原因。Chime 的第三方支付网关处理器 Galileo Financial Technologies 的数据库系统经历了一次“操作事件”,导致数百万 Chime 客户无法访问其在线帐户。由于没有实体分行,客户别无选择,只能耐心等待 Chime 恢复银行服务。

平均而言,一小时的停机成本组织 $126,000。考虑到备受瞩目的停机所带来的财务影响和客户信任问题,IT 从业人员需要仔细检查其当前的运营工作流程,并制定正确的应急计划来处理重大事件。技术领导者在处理意外中断时应牢记以下三个要点:

  1. 拥抱混沌工程。鉴于最先进的技术团队也无法免受网络中断的影响,企业应该投资进行实验,真正测试其 IT 基础设施的极限。新兴学科混沌工程提供了一个优秀的框架,通过为现实生产场景设计软件和底层基础设施来最大限度地降低系统性风险。
  2. 为人为错误制定计划。波奈蒙 2016 年报告数据中心中断的成本发现人为错误占计划外停机的 22%。尽管采用了软件定义的基础设施和按需云服务,IT 团队仍然需要人工操作员来保持正常运转。技术领导者需要建立一致的流程,促进开放的沟通,接受预防性维护,并创建一种无可指责的事后分析文化,以发现和防止破坏性中断。
  3. 将供应商系统纳入您的 IT 准备计划中。今年的几次中断说明了通过开放 API 运行的现代应用程序的相互依赖性质,包括美国航空和捷蓝航空(由于其技术提供商 Sabre)、Microsoft Office 365(由于 CenturyLink DNS 问题)等主要航空公司或 7 月份导致大部分互联网瘫痪几个小时的 Cloudflare 中断。首席信息官应仔细评估其数字服务所依赖的外部技术系统,并与供应商合作,以便在发生事件时快速恢复服务。

底线。频繁的技术中断充分提醒人们现代基础设施的脆弱性。虽然技术故障和系统停机是不可避免的,但构建正确的事件响应手册、投资现代绩效管理工具、在中断期间建立正确的沟通节奏并从现有事件中学习的 IT 运营团队将最有能力处理计划外中断。

本文由 Deepak Jannu 撰写,他是以下公司的产品营销总监行动斜坡