现代企业本质上就是数字化企业。从后台办公系统到生产车间,各种互联的系统和数字化服务构成了企业运营的支柱;所有业务流程都依赖于这些系统。因此,一旦出现故障或中断,企业可能会面临巨大的财务损失、声誉受损、生产力下降,甚至合规问题。这使得“事件的可观测性”(即能否及时发现并理解问题的本质)成为了一个关乎企业高层管理层的核心问题。NETSCOUT企业战略总监杰克·卡拉汉(Jack Callahan)解释道:“对于上市公司而言,一旦发生重大网络安全事件,企业就有义务立即公开相关信息。从发现该事件的那一刻起,企业只有四个工作日的时间来应对这一危机。无论是遭遇网络攻击、DDoS攻击,还是有人恶意向网络上传了有害程序,首要需要解决的问题都是:这个事件是否属于‘重大事件’(即是否会对企业造成实质性影响)。”由于各个技术部门之间常常互相推诿责任,事件的可观测性就成了企业识别问题根源、加快问题解决速度以及提升系统可靠性的关键依据。然而,在许多企业中,这一机制并未发挥应有的作用。虽然长期以来企业一直依赖各种指标、事件记录、日志数据等来构建数据基础,但这些数据本身难以跟上当今数字化基础设施的复杂性和规模变化。企业们通常会选择收集更多数据、增加数据采样频率、延长数据保留期限,但这样做并未带来预期的洞察力提升。卡拉汉继续说道:“那些期望拥有充足数据以辅助决策的高管们,往往发现这些数据并不像他们期望的那样具有决定性;因此,他们在做决策时更多地依赖直觉,而非基于数据做出的分析。”这种对数据收集的过度依赖所带来的成本正在不断累积。NETSCOUT的一项调查显示:81%的企业认为数据不足会延长事件解决的时间;超过五分之二(42%)的企业认为网络中断造成的损失每小时高达50万至99.9万美元。从经济角度来看,这些成本是不可持续的。
要充分发挥自主人工智能在运营中的潜力,组织需要一个值得信赖的数据基础。这需要一种全新的方法:该方法必须具备经济可行性,同时基于可观测性数据(这些数据需要具备一致性、全面性、丰富性以及实时性),并且要以一种能够补充而非取代现有可观测性基础设施的方式来实现——从而提升企业现有技术栈中的各类平台的价值。在那些传统可观测性工具无法提供足够信息的情况下,MELT(Measurement, Event, Logging, and Tracing)技术仍然是实现有效可观测性的关键工具。然而,MELT技术最初并不是为当今这种复杂、分布式且动态变化的运营环境而设计的。
各项指标能够说明某些情况随时间发生了变化;事件记录可以告诉团队具体在何时发生了什么;日志则能记录这些事件的具体时间点。但它们无法提供关于网络中实际发生了什么以及为何会发生这些事件的详细背景信息。分布式追踪技术(Distributed Tracing)在追踪请求在各个服务之间的传播过程方面表现较好,但它只能显示那些被主动监控(即被“标记”为需要被记录的)组件中的数据,而对于那些未被监控的组件、第三方依赖项以及系统间的基础设施则无法提供任何信息。而这恰恰是问题容易发生的环节——因为这些未被监控的部分会导致我们无法准确了解事件发生的真正原因及其背景。所谓“背景信息”,实际上是指能够重建一个完整、有序的事件链:包括事件是如何被引发的、它是如何传播的,以及每个环节中具体发生了什么。
然而,仅依赖MELT技术的可观测性方案往往存在诸多局限性:不同系统之间的时间戳可能不一致;标识符可能无法在系统架构的边界之间被正确传递;数据采样和聚合过程会丢失用于事件重建所需的关键细节;此外,数据可能存储在采用不同数据格式(即不兼容的数据结构)的各种工具中。研究表明,虽然96%的组织都在使用指标和日志工具,但仍有82%的组织存在可观测性方面的缺陷;几乎所有组织(96%)在遇到问题时都缺乏足够的数据来确定问题的根本原因。
在系统相互连接的环节(例如本地系统与云系统的交互、边缘计算设备的交互,以及服务之间的交互),这些问题的可见性往往会降低(分别为 58%、51% 和 39%)。人工智能(AI)的出现进一步加剧了这一挑战:在 AI 的应用场景下,这些问题变得更加严重。许多组织已经开始采用 AI 技术来提升运营效率、决策质量以及客户体验。然而,当系统开始自主运行、以极快的速度做出决策并执行操作时,它们需要具备高保真度的“取证级”数据(即能够准确反映系统运行状况的数据),才能确保决策的可靠性。这意味着需要持续收集、不进行数据抽样的记录,以完整地记录系统在各种环境中的交互过程。更高的系统自主性要求对网络数据有更高的信任度;但传统的遥测技术(如 MELT 技术)在处理大量数据时往往会通过数据抽样和抽象化处理来降低数据的保真度,从而导致数据不完整、碎片化。这些不完整的数据可能导致错误的关联判断、对问题根本原因的混淆、输出结果不一致,以及对部分数据的过度依赖。Callahan 表示:“自动化系统不会运用人类的智能来排查问题,而是会根据自身掌握的数据做出决策。因此,如果输入的数据不完整、是间歇性的或经过抽样的,那么系统出错的概率就会迅速增加。”许多组织才刚刚意识到这一挑战。根据 NETSCOUT 的调查,只有 41% 的组织认为 AI 提供的洞察结果“非常一致”或“极其一致”;38% 的组织承认缺乏用于验证自动化决策的可靠数据;29% 的组织表示无法实现跨环境的实时监控;28% 的组织对自动化系统的输出结果缺乏信任。
为解决这一问题,更好的方法是基于经过处理的 MELT 数据来构建系统的可观测性机制,从而为 IT 团队提供所需的完整信息,同时避免不必要的数据冗余和额外的成本开销。这一切都始于数据包本身——因为数据包才是记录网络中实际传输内容的权威依据。
该技术能够清晰地展示整个 IT 生态系统中的各种交易、依赖关系以及人机之间的交互行为。通过使用深度包检测(Deep Packet Inspection, DPI)技术,这些交互数据可以被转化为元数据;当这些元数据被整合到 NETSCOUT 的 MELT(Monitoring, Event Logging, and Tracing)系统中后,就形成了 NETSCOUT 所称的 “MELT+”。NETSCOUT 的现场营销经理 Steve Horneman 解释道:“借助这种技术,数字服务及其各组件之间的交互行为变得可被观测和分析。NETSCOUT 的智能数据分析功能将这些交互数据转化为具体的交易级证据:例如通信是否成功、交易的具体执行过程、出现延迟或故障的位置、受到影响的 services,以及在有用户身份信息的情况下,哪些用户实际受到了影响。这为运维团队和 AI 系统提供了更完整、更可靠的信息,帮助他们准确了解实际情况。”
“大多数传统的遥测技术仅能描述各个组件的状态,而 NETSCOUT 则专注于观察这些组件之间的交互行为,并在交互发生时立即从中提取有意义的信息。通过独立地分析网络流量(而非仅依赖各个系统的报告),我们为运维平台和 AI 系统提供了关于数字服务实际运行情况的更准确、更一致的数据。这正是‘收集更多遥测数据’与‘生成能够支持明智决策的可靠证据’之间的本质区别。”
一个实际案例充分体现了这种技术的优势:某产品制造商发现,其全球范围内的自动化引导车辆(AGVs)因无线连接问题而频繁出现故障,导致公司每小时损失 50 万美元的生产效率。此类故障大约每三周就会发生一次,而现有的机器人技术无法找到问题的根本原因。直到引入 NETSCOUT 后,问题根源才被彻底查明,并且该公司采用了主动监控机制,能够在几秒钟内检测到 AGV 的故障。故障排查时间从数小时缩短到了几分钟,每年为公司节省了数千万美元的成本。
霍恩曼(Horneman)继续说道,MELT+ 的优势不仅体现在应对网络中断和运营故障方面,还延伸到了网络安全领域。“其战略价值远不止于提升网络监控的可见性;同样的网络交互数据不仅可以用于保障企业网络的安全性,还可以揭示不同服务之间的交互行为以及潜在的内部攻击路径,同时为运维、安全及人工智能系统提供统一的数据支持。这样一来,各个团队就可以基于相同的事实进行分析和决策,而无需对事件有不同的解读。”NETSCOUT 的研究表明:那些将网络流量数据视为权威信息的组织,报告网络可见性问题的频率要低近三倍(50% 对 18%)。正是这种对网络活动的深入洞察能力,使得基于数据包的分析结果对取证分析团队来说具有极高的价值。卡拉汉(Callahan)指出:“一旦攻击者获得了对某台主机的访问权限,他们就能获取该主机生成的所有网络监控数据;而 sophisticated 攻击者正是通过这种方式来隐藏自己的攻击行为。不过,他们无法更改那些已经传输到网络中的数据包。”当元数据被转化为“智能数据”(Smart Data)时,NETSCOUT 采用了深度包检测(DPI)技术直接从网络中捕获未经过抽样的数据包,并通过自适应服务智能(Adaptive Service Intelligence, ASI)技术将其转化为高保真的元数据。这种技术旨在解决传统 MELT 技术所面临的主要问题——即扩展性、效率、成本以及数据质量的问题。NETSCOUT 从网络的关键节点进行流量监控,而非对每个应用程序或服务器进行单独监控,从而减少了数据采集量、处理成本以及系统的复杂性。它将数据包数据进行分析并转化为“智能数据”,这些元数据是在数据捕获时即时生成的,从而减少了需要传输、存储或长期保留的数据量。
客户获得的是一种与MELT互补的方法,但这种方法在经济上更具可持续性,能产生更完整、源自网络的数据,并可接入现有的可观测性平台,进一步降低总体拥有成本。它还提供了分析公司Futurum所称的自主AI运营的关键基础。这些数据捕捉的是可验证的网络行为和观测到的交互,而非抽象概念。这些数据确保无论单个应用是否被插桩,都能实现全面可见性,并提供没有采样缺口的完整视图。而且,这些数据在可观测性、安全和运营团队之间保持一致,同时展示跨服务边界的顺序和因果关系。“仅靠MELT不足以成为运行AIOps的数据基础,”Callahan说。“我们能够在流程更早的阶段生成包含更多所需上下文的数据,因此更丰富的数据会流入你的平台。”才刚刚开始尽管MELT+方法有明显好处,但NETSCOUT的数据显示,只有11%的组织将全保真网络数据视为权威数据。对于急于改变这一统计数字的CIO来说,第一步是根据NETSCOUT首席运营官Sanjay Munshi分享的五项关键标准来评估其当前的可观测性数据。它应当是全面的;覆盖任何云、服务、应用、网络或供应商。它应当是经过整理的;具有为存储和成本优化的专用数据流。它必须在提供可验证的交互链方面具有可信度,展示服务、应用和用户如何在上下文中表现。它必须在不同用例之间保持一致。而且它必须对运动中的数据提供持续的实时洞察。“如果你一直在优化以降低MELT成本,那么你所做的也在减少应用团队和代理所拥有的上下文。但你现在不必为了获得其中一个而牺牲另一个,”Callahan总结道。“如果你担心遥测成本。
如果你担心在当下做决策或进行合规报告时缺少所需的数据。如果你正在设法将AI试点项目投入生产:我们可以强化你日常所用平台中已经在做的事情。”由NETSCOUT赞助