“遭遇悖论恰是学术之幸,它往往预示着研究突破的曙光。”——尼尔斯·玻尔(Niels Bohr),诺贝尔物理学奖得主
数据蕴含着巨大的价值创造潜力,多年来持续为我们带来前所未有的价值。同时,我也强调企业需要一套系统化的方法来释放数据的价值。然而,一项调查显示,尽管有66%的企业自称是数据驱动型组织,实际上却仅有21%真正将数据视为战略资本加以运用。
这难道不是一个显著的矛盾吗?尽管企业能够捕获海量数据,却难以有效利用。究其根源,数据的3V特性(即规模性、高速性和多样性)正使企业陷入双重困境:既要应对不断激增的数据量,又难以充分利用现有数据以推动有效决策。这正是我所说的“数据悖论”(Data Paradox)。
事实上,它也揭示了当今企业在试图释放数据全部潜能时所面临的核心矛盾本质。接下来我们将深入解析这一悖论的具体构成与成因,并阐明为何破解该难题将成为在数据优先时代取得成功的关键。
1、悖论缘起:大数据引发双重挑战
悖论是指那些表面上逻辑荒谬或自相矛盾,但经过深入推敲却可能成立的陈述、命题或情境。一个经典的逻辑悖论是“我在说谎”——如果该陈述为真,则意味着说话者确实在说谎,构成矛盾;若该陈述为假,则说明说话者并未说谎,同样构成矛盾,最终陷入自我指涉的无限循环。对我而言,最令人着迷的悖论莫过于经典歌曲《加州旅馆》(Hotel California)中那一句耐人寻味的歌词:“你可以随时退房……但却永远无法离开。”
大数据领域正上演着类似的悖论:理论上,大数据蕴藏着解决众多难题的潜力,被视为帮助组织在VUCA环境中导航的关键洞察源,但现实情况往往与之相去甚远。2021年的研究显示,不到半数(47%)的数据决策者认为大数据确实提升了可执行洞察的质量。
与乐观预期相反,现实是:随着数据规模的急剧膨胀和复杂性的不断提升,众多组织正陷入一种双重困境——既要应对海量数据带来的3V挑战,又无法有效利用现有数据支持决策。我们将这种“数据洪流与洞察干旱并存”的矛盾现象称为“数据悖论”,绝大多数企业深陷“数据悖论”困局如图1所示。
图1 绝大多数企业深陷“数据悖论”困局
具体而言,“数据洪流”体现在:每日产生的2.5艾字节(EB)数据已远超组织的技术承载能力,使其在数据采集、存储和分析环节不堪重负。而“洞察干旱”则表现为:尽管捕获海量数据,管理层却因缺乏必要的数据素养和数据驱动文化,仍依赖直觉而非数据分析进行决策。这形成了一种恶性循环:组织在数据洪流中艰难挣扎,而决策者因无法有效挖掘现有数据价值,转而持续索求更多数据——恰如《加州旅馆》歌词所隐喻的困境:“你可以随时退房……但永远无法离开”。
更具讽刺意味的是:一方面,67%的组织抱怨数据供给不足;另一方面,70%的组织承认数据收集的速度已远超其分析处理的能力。接下来我们深入剖析这一悖论的形成机制。
2、数据洪流:无法回避的数据汪洋
研究显示,全球数据总量正以约每18个月翻一番的速度激增。在受访的科技行业领导者中,77% 将处理持续增长的数据量列为其前三大挑战之首。另一项调查显示,61%的高管坦言其团队已被现有数据压垮。
此外,鉴于非结构化数据占据主导地位,传统数据处理方法已不再适用。本质上专为处理静态结构化数据而设计的系统,难以应对实时非结构化数据的处理需求。数据来源日益多样化(涵盖内部生成与外部获取),导致其复杂性呈指数级上升。而传统的遗留系统在设计上难以应对如此大的数据规模性和多样性,致使数据整合工作面临巨大挑战。这一挑战预计将持续加剧,其根本原因在于数据的指数级增长速度持续超越数据处理技术的发展速度:过去24年数据量增长达10万至15万倍,属几何级增长;而同期大数据市场规模仅从2011年的76亿美元增至2023年的770亿美元,仅呈算术级增长。
数据的3V特性使得在汹涌的数据洪流中维持高质量的数据标准成为一项严峻挑战。随着数据点、数据类型和数据来源的激增,“垃圾进,垃圾出”的箴言在大数据时代愈发凸显。拥有海量存储空间并不等同于每个数据点都能及时、可用。传统的数据质量控制方法在应对数据洪流时已显得力不从心甚至失效。此外,多源数据环境下,持续生成与访问行为使安全合规保障成为艰巨任务。2023年数字信任调查(State of Trust Survey)显示,67%的受访企业承认亟须加强安全合规措施,其中身份访问管理(IAM)和数据处理被普遍视为最大风险盲区。正因如此,《破解数据困局》书中第12章将专章探讨数据质量对构建数据驱动组织重要性。
因此,组织不仅难以从庞杂数据中提取出有意义且全面的洞察,更可能面临足以吞噬其正常运营能力的“数据海啸”。更为棘手的是,从浩瀚的数据海洋中精准识别有效洞察所需的关键数据,正变得日益艰难。
3、洞察干旱:挖掘价值的多重挑战
与数据爆炸式增长形成强烈反差的是,组织对现有数据的利用效率普遍低下——更关键的是,许多投入最终被证明是无效的。数据显示,2022年全球数据生成、采集及消费总量已达97泽字节(ZB);研究证实,采用数据驱动决策模式的企业能获得超过同业30%的增长优势。尽管如此,坐拥海量数据的大多数企业依然难以最大化其数据价值。
正如《破解数据困局》书中第3章所述,当前组织产生的数据分析洞察数量虽多,但具备实际落地价值的却寥寥无几。一个核心症结在于,业务负责人未能深度参与并明确定义关键的业务问题,导致产生的数据洞察往往无法指向有效的解决方案。这令我想起一次经历:受邀做客时,主人热情展示其珍藏的名酒,而我却只需一杯清水——只因我不饮酒。这正是数据供给与业务需求错位的生动写照。以某《财富》100强客户为例,其开发的500余个分析模型中,实际投产的不足10%。行业调查显示,高达87%的数据科学项目最终未能实现投产,这意味着每8个项目中只有1个能够实现从开发到应用的跨越。
更深层次的问题在于,组织普遍缺乏一套系统性的方法论来理解和追踪数据价值生成的完整路径。尽管日夜分析海量数据,但产生的洞察大多难以转化为实际行动。即便少数可执行的洞察,也往往无法达成预期效果。这导致洞察生成沦为高成本、低回报的耗时活动。2019年的预测数据显示,到2022年将有80%的分析洞察无法带来实质性的商业成果。
在当今瞬息万变的商业环境中,持续演进的业务挑战对组织的敏捷响应能力和跨团队协同作战提出了更高要求。然而当前的数据和技术能力往往缺乏所需的灵活性。围绕数据访问和使用的烦琐流程,加上各自为政的系统,阻碍了业务、IT和运营部门之间的协作。数据显示,约有五分之三的组织正在艰难应对数据孤岛问题。这导致团队无法全面掌握所需数据来生成及时决策所需的洞察。而数据基础设施的渐进式改进仍不足以建立从数据中获取价值所需的能力。一项调查发现,67%的高层管理者对通过分析工具访问数据感到不适,这凸显了提升数据素养和用户体验的必要性和紧迫性。
更深层次的问题在于,本应依靠数据进行决策的企业高管们,既缺乏充分培训,也未被有效赋能,同时企业内部尚未形成鼓励或推动数据有效使用的文化氛围。首先,大多数非技术背景的业务负责人对数据的潜力及其应用方式认知有限。调查显示,61%的企业缺乏内部数据科学能力,57%缺乏内部技术能力。其次,分散而孤立的数据基础设施使得团队难以定位和获取所需数据。据统计,规模达千人以上的组织平均使用177个SaaS应用程序,同时还需维护既有的遗留系统。
这就是大数据世界创造的悖论。
问题在于,如何判断一个组织是否陷入了数据悖论?基于与多家机构合作开展数据项目的经验,我总结了若干明确表明组织正经历数据悖论的迹象,如图2所示,这些是组织深陷数据悖论的三大典型征兆。
图2 组织深陷数据悖论的三大典型征兆
4、问题诊断:数据悖论的典型征兆
组织可能呈现数据悖论的单一征兆或多种征兆组合,这种困境导致其无法从数据中获取完整价值。
数据计划成本过高且周期过长
当前全球组织正加速推进数字化转型,作为总体计划的一部分,组织正在更新或重新设计数据基础设施,以建立能够帮助改进业务流程或彻底重塑商业模式的能力。全球数据和分析解决方案的年投资额超过2150亿美元。与我们合作的大多数《财富》500强企业在数据方面的投入至少达数百万至数千万美元,部分项目甚至高达数亿美元。尽管这些巨额投资主要目标是构建高效、现代化的数据采集、存储与处理体系,但行业数据显示超过85%的大数据项目最终未能达成预期目标或宣告失败。此外,估计近60%的数据与人工智能项目遭遇严重延期。
团队未能获取所需的决策数据
组织耗费大量资源捕获、存储和处理尽可能多的数据,期望为决策者或业务负责人提供支持,使其能够在正确时间快速且高效地做出正确决策。然而,许多高管表示,他们很少能在需要时获得足够且适用的数据来支持有效的数据驱动决策。究其原因,生成的洞察往往并非决策者所需。此外,大多数情况下这些洞察仅具有描述性——分析仅能说明发生了什么,却无法解释原因或预测可能产生的结果。简而言之,它们缺乏预测性。事实上,只有30%的企业积极使用预测分析工具,使用规范性分析工具的企业更只有3%。由于大部分数据仍被困在不同部门或团队的孤岛中,高管无法顺畅获取这些数据。71%的高管认为其数据需求未能得到充分满足,另有调查显示63%的员工无法在必要时间内收集到所需的洞察,导致整个工作徒劳无功。此外,超过87%的企业被评估为商业智能(BI)和分析成熟度较低,这直接影响了团队的数据处理效率和效果。
团队无法有效利用现有的数据
尽管组织持续向团队提供数据,业务负责人却无法有效利用数据驱动决策或创造价值,且对自身运用数据的能力缺乏信心。一个关键问题在于,数据分析团队与业务部门在数据解决方案的设计初期就缺乏深度共识与协作,导致最终产出的洞察难以被业务负责人充分理解、信任并采纳。深层症结则在于,多数业务负责人缺乏技术背景,不具备有效运用数据的必要技能。前文提及,67%的高管不擅长通过工具获取和使用数据。数据获取途径的不便和数据驱动文化的缺失进一步加剧了问题。同时,组织也面临能够适应数据变化和角色演进的专业人才短缺困境。此外,当前环境下收集的大部分数据具有非结构化和实时特性,因此要么大部分从未被使用,要么保质期极短,往往在采取行动前就已失效。研究表明,企业超过50%的数据属于“暗数据”——被收集却从未分析使用。同样重要的是,迄今为止,组织中非结构化数据的利用率甚至不足1%。
5、技术发展:数据技术及其局限性
显然,意识到这些数据挑战严峻性的远不止我一人。在过去几年中,众多企业纷纷陷入类似的困境,这促使科技界不断探索应对之策。无论是大型科技企业还是初创公司,都在积极开发旨在破解“数据悖论”的技术方案。业界为应对这一问题所做出的持续探索如图3所示。近年来,数据领域的多项关键技术取得了显著进展,接下来将对其进行系统梳理。
图3 业界为破解“数据悖论”所做的持续探索
21世纪初,为应对互联网的爆发式普及,NoSQL应运而生,其设计目标是获取、处理和存储海量非结构化与半结构化数据。与传统数据库不同,NoSQL采用灵活的数据模型,适应数据结构变化,且能扩展处理持续增长的数据量。然而它仅实现了数据管理问题的渐进式改善。
2005年,Apache Hadoop登台亮相,支持多计算机集群的大规模数据集分布式处理。但管理和优化其性能仍具挑战性。同期问世的商业智能工具则普遍存在用户体验(UX)不佳、操作复杂且笨拙等问题。
2005年被许多人视为大数据时代的开启之年,随后涌现了MongoDB等支持非结构化数据灵活存储的解决方案,但对小数据集兼容性差且数据安全性薄弱。与此同时,并行计算技术的兴起提升了计算能力,支撑高级分析方法。随着SIEM(安全信息与事件管理)系统将持续监控纳入体系,数据安全开始受到重视。
Apache Kafka等实时数据流平台的诞生,为处理流数据提供了关键技术解决方案,但其在系统配置、参数调优和日常运维管理方面仍存在显著的复杂性。
2014年,Snowflake公开发布,提供基于云的数据仓库能力,支持跨多云平台(包括亚马逊AWS、微软Azure和谷歌GCP)的集成。然而该平台存在明显局限:持续数据加载性能不足,且对非结构化数据的支持直到2022年才得以实现。
2020年问世的Databricks基于湖仓一体架构,在数据湖基础上提供关系型数据处理能力,成为数据仓库、商业智能与数据科学的统一平台。尽管其旨在提供一体化方案,但存在集成多数据管道和管理复杂依赖的固有问题。在分析领域,AI已成为塑造竞争格局的关键力量。然而,缺乏充足的数据集仍是扩展这些AI解决方案的主要障碍。
各组织持续研发创新性解决方案以应对数据悖论——从优化实时与非结构化数据处理的方案,到支持高级分析的、实现多源数据端到端整合的“数据编织”(Data Fabric)架构。尽管这些技术进步拓展了数据能力,却仍未完全解决数据困局。前文所述的三大征兆在多数组织中依然可见,数据悖论持续存在且日益凸显。即便历经多年技术演进,2021年调研数据仍显示,高达83%的高管坦言难以有效捕获、管理、分析数据或驱动数据行动。
显然,单纯依赖技术方案来应对上述三大征兆(这仍是多数组织的默认策略)远不足以从根本上破解这一困局。要真正攻克数据挑战,必须穿透表层现象,触及核心问题。唯有从根源入手,组织才能彻底消除数据悖论,否则问题将持续反复出现,组织必将陷入进退两难的困境。
现在,让我们共同探寻表层之下的根源问题——那些长期被忽视的系统性症结。打开《破解数据困局》这本书,让我们一起开启这场根源分析之旅。
以上内容节选自《破解数据困局:AI时代如何让数据真正为你所用》作者:尼廷·赛思(Nitin Seth)译者:丛兴滋 马欢 李英俊 李金虎 等
推荐阅读
▊《破解数据困局:AI时代如何让数据真正为你所用》
尼廷·赛思(Nitin Seth)
在AI时代,数据既是驱动发展的燃料,也构成了现实中数据过载的困局。本书首先揭示了“数据悖论”的根本成因:面对数据的爆发式增长,仅依靠技术手段已难以应对。为此,作者创新性地提出了“统一解决方案框架(USF)”,系统性地构建了一套破解路径,借助DIAI(Data-Insights-Actions-Impact,数据-洞察-行动-影响)价值创造框架与双轨制执行策略等一系列实践方法,指导组织快速建立敏捷的数据体系,从而实现对数据悖论的系统性解决。
在超越企业层面的视角,本书还引导个人在信息过载的环境中如何洞悉背后的真相,同时深入探讨了数据在全球协作与国家竞争中所具备的战略意义。书中深刻论证了数据与AI之间递归增强的关系:优质数据能力可放大AI效用,而先进的AI技术又能持续反哺数据价值。
本书是一部系统性行动指南,面向所有希望驾驭数据洪流与AI浪潮、做出精准决策并赢得未来的组织与个人。
撰 稿 人:李杉
责任编辑:张淑谦
审 核 人:曹新宇
292