《数据分析通识》目录和简介
更新于 2026-08-29。第一篇自下而上:业务 → 数据 → 分析 → 决策。
全书结构总览(三篇十一章)
更新于 2026-08-29。
本文件是全书的结构底稿: 骨架,逻辑关系,每章约 200 字的知识要点
全书骨架
第一篇 认知篇
- CH01 “业务·数据·分析”:普适性业务分析认知框架
- CH02 “数字化企业”数据架构:企业数字化成长阶段
- CH03 数字化最佳实践:评估基准、数据文化与组织路径
- CH04 数字化转型的歧路:避免形式主义与教条主义
第二篇 概念篇
记录是分析的素材,模型是迈向高级分析的“阶梯”。
- CH05 指标与度量:连接业务、数据、分析的桥梁
- CH06 问题与可视化:从问题结构到可视化表达
- CH07 面向记录的数据模型:从业务事实到记录表与“属性表”
- CH08 面向分析的数据模型:从分析需求到关系模型
- CH09 面向业务自动化的算法模型:经验的固化、语义层与 AI
第三篇 案例篇
- CH10 从业务流程到敏捷分析:库存分析案例
- CH11 从需求到敏捷分析:航空旅客流失分析
逻辑关系
- 第一篇自下而上:业务 → 数据 → 分析 → 决策。
- 给的是认知框架与判断力,读者是决策者。
- 第二篇自上而下:指标 → 问题 → 记录 → 模型 → 算法。
- 给的是概念工具,读者是分析师。之所以反着走,是因为分析师的日常起点是问题和指标,而不是数据表——先给用得上的,再向下追问它凭什么成立。
- 第三篇两个方向各走一遍:两章合起来,正是第一篇框架的双向验证。
- 第10章库存案例自下而上(业务记录决定表结构),
- 第11章航空案例自上而下(分析需求倒推数据准备)。
章节要点
第一篇 认知篇
第1章 “业务·数据·分析”认知框架
全书的地图。本章立起“业务—数据—分析”三层认知框架,并落成一张可操作的“数据地图”:业务投影(1.2)→ 数据准备(1.3)→ 数据分析(1.4)→ 辅助决策(1.5)。
核心判断有三条:数据不是人造的表格,而是业务的投影,因此理解数据必先理解业务;业务可拆为业务对象、业务过程、业务规则三要素,这组划分贯穿全书,第7章的属性表与事实表正是它在数据层的对应;数据分析本身有四种由低到高的抽象形态——逻辑指标、问题与可视化、交互仪表板、假设验证与探索分析。1.4.1 提前埋下全书最硬的一条主张:逻辑指标不应被物化。
1.2.3 的民航“航节、航班、航段”案例,是全书第一次演示“同一业务、三种粒度”,第11章的 PNR/客票/航段之辨与它同源。
第2章 “数字化企业”数据架构
全书的载具。本章按“业务在线 → 交易与分析分家 → 分析独立”三个阶段讲三代数据架构:极简的 APPs+BI(2.2)、经典的 APPs/ODBs+DW/BI(2.3)、敏捷 BI 与 DW/BI 一体化(2.4),再到大型企业的三层架构与选型标尺(2.5),最后给出 AI 时代的形态 (APPs+DW+BI)×AI(2.6)。
关键判断是 2.4.2 的三个“不可物化”——它是第二篇“度量不可物化”在架构层的先声,第8章 8.6.2 与第9章 9.3 都从这里接力。2.3.3 的数据仓库分层设计与 2.3.4 的“数据仓库悖论”,解释了为什么越治理反而越远离业务。
本章留给读者两件可直接带走的工具:数据架构选型标尺(2.5.4),以及判断自己企业该停在哪一代、而不是盲目追最新一代的尺度。
第3章 数字化转型的正道
全书的正道。本章给出评估企业数字化水平的“不规则三角”模型——认知、组织、工具三边不等长,短板决定水位(3.1),并配了可直接打分的简化量表(3.1.4)。3.1.2 区分 Push 与 Pull 两种转型策略:由 IT 推动还是由业务拉动,决定了转型是完成任务还是产生价值。
3.2 讲“可实践的数据文化”,落点在“一切用数据说话”与“视数据为资产”,强调文化不是口号,而是认知与方法的整合体。3.3–3.4 追踪职能演进:信息部如何长成数据部,而数据部的核心职责应当是数据建模而非取数——这一判断在第8章得到完整的技术兑现。
3.5 给出业务主导转型的可行路径,3.6 作桥,转入下一章的歧路清单。
第4章 数字化转型的歧路
全书的歧路清单,与第3章互为镜像。4.1 列举五种形式主义:炫酷大屏、复杂报表、脱离逻辑模型的“指标平台”与“标签体系”、只盯末端表现而忽视数据治理,以及“AI 形式主义”——用智能的外衣掩盖数据的地基。
其中 4.1.3 是第二篇多处论证的靶子:第8章 8.6.2 从技术上证明脱离模型的指标平台不成立,第9章 9.3.3 则指出没有语义层的 ChatBI 只是它的 2.0 版本。4.2 转向教条主义:IT 部门的 SQL 垄断、对数仓分层的教条执行、照搬方法论的“技术懒惰”。
4.3 给分析师的职业建议——避免工具化,构建分析通识的护城河。全章态度是:不走弯路,就已经成功了一半。
第二篇 概念篇
第5章 指标与度量
第二篇的起点,主角是聚合。本章立起全书原则一:度量的本质是聚合。5.1 用“我写过几本书”与“我叫什么名字”区分分析型问题与查询型问题——前者的答案由聚合创造,本不存在于任何一行数据里;由此推出可加、半可加、不可加的三分,这是一切指标计算的前提。
5.2 指出指标的抽象水平就是管理水平。5.3 展开指标体系:一类直接聚合、二类条件聚合、三类组合运算,并用“单车均价”证明比率指标为何不可物化——这是全书论证力最强的一段。5.4 做正本清源:measure 兼有“计量”(过程1,记录)与“度量”(过程2,分析)两义,混用是分析世界最深的误解之源。
5.5 给出结论:度量不住在任何一张表里,它在数据表之上、在模型之中。
第6章 问题与可视化
承上启下的一章:问题的核心是指标(承上),问题的基础是模型(启下)。6.1 给出本质——一切分析型问题都是分组聚合。
6.2–6.4 把问题拆成跨工具通用的语法:第一字段角色(维度与度量)决定问题结构,第二字段角色(连续与离散)决定可视化表达,第三字段角色(行级计算与聚合计算)连同三类筛选(前置、后置、嵌套)决定计算逻辑。三组角色都是主观的,随问题而变,与客观的数据类型无关——这是第7章 7.2.1 的直接对手戏。
6.5 指出 Tableau 的 LOD 与 Power BI 的 CALCULATE 是两条路线、同一个模型。6.6 划出边界:本章所有例子都是单表的;问题一旦跨出单表就需要模型,库存周转率就是那个跨不过去的例子。
第7章 事实表与属性表
第二篇的地基之章,主角是记录。7.1 从一次真实销售交易讲到关系表的一行:行对应业务过程,列对应业务对象,5W2H 是识别核心字段的抓手;并对比关系表与 Excel,指出“单元格思维”是分析师要跨过的第一道墙。
7.2 讲两个客观约束:字段的数据类型约束数据值的一致性,数据表的详细级别约束记录的唯一性——它们先于分析而存在,与第6章那三组主观的字段角色恰成对照。7.3 讲组织:范式为什么抵制大宽表,而“维度建模”又为什么允许必要的冗余,第二范式是性能与完整性之间的平衡点。
7.4 是全章高地,处理三处最深的误解,共用同一个要害——分清过程1与过程2:事实表中无度量;“维度表”的维度是属性而非问题中的维度;物化的代价是逻辑意义的退化。
第8章 数据模型
第二篇的收束之章,主角是组织。8.1 把模型分为数据库模型、数据分析模型、算法模型三类(第三类由第9章兑现),并立起物理与逻辑两条主线。
8.2 沿“由实向虚”走一遍物理模型:物化宽表(有名有实)、View(有名无实)、物化视图(混合体),并给出全章最要紧的判断——物理还是逻辑不是绝对的,而是相对的,取决于观察的语境。8.3–8.4 转入逻辑关系模型:单事实星型、基数与引用完整性、雪花模型,以及跨主题多事实与共享维度,关键在“关联而不合并”,让星型保持立体而不是被压平。
8.5 讲无名无实的临时关系。8.6.2 给出第二篇的枢纽结论:度量必须建立在数据模型之上——这正是第5章 5.5 的标题,环由此闭合。
第9章 算法模型:经验的固化、语义层与 AI
第二篇的开口,主角是判断。前四章合上了环,本章向前开一道口:当“模型”一词越来越多地指向评分卡、排班算法和大语言模型时,前八章那套判断还够不够用。
9.1 给出算法模型的本性——它固化的是经验,不是智慧,价值在于可复制、可并发、不疲倦;企业需要它,不是因为决策变难了,而是因为决策的数量超过了人的注意力带宽。9.2 处理它与前两种模型的关系:既是递进,更是闭环;物化对分析模型是退化,对算法模型却是前提,算法输出重回分析世界时通常要先降格为计量。
9.3 指出算法与 AI 的底层是语义层——逻辑模型的对外契约,它物化的是规则而不是结果。9.4 落到分析师:入口不是 Python,而是判断力。
第三篇 案例篇
第10章 库存分析案例:从业务到数据、分析全流程
案例篇第一章,中型制造企业,走的是自下而上:业务记录如何决定数据表结构。三节恰是第二篇三章的缩影。10.1 从最简单的生产入库出发,逐步加入生产批次、分批入库、库位实时数量,演示业务复杂性如何一步步逼迫拆表——第7章回答“为什么应该拆”,本节回答“什么时候不得不拆”。
10.2 沿同一份库存数据搭出指标的抽象阶梯:直接聚合的平均在库金额 → 比率组合的周转率与周转天数 → 排序累计的 ABC 分类,结论是指标越抽象,对数据准备的要求越高;10.2.1 点破一处关键张力:实时余额会被覆盖,所以算不了平均,这正是必须另建快照表的理由。10.3 展示好的数据模型如何支撑即席分析,响应时间从数周缩短到半小时。
第11章 超大规模案例:航空旅客流失分析与运营决策
案例篇第二章,超大规模航空企业,走的是自上而下:分析需求如何倒推数据准备,与第10章方向相反、恰成一对。
11.1 先统一分析对象——PNR、客票、航段与旅客是四个不同的详细级别,混用一次整套指标就失真;并说明流失分析为何必须聚合到旅客粒度。
11.2 给出差异化标签体系与流失系数 CRC 的初始假设:用旅客自己的历史节奏做分母,判断他是否偏离了个人节奏。
11.3 讲超大规模下的数据准备,Doris 物化、Tableau 动态计算与关系模型三层分工,并在 11.3.5 给出物化的判据。
11.4 是全书唯一一次完整演示假设验证与探索分析:四轮修正把 CRC 从一个公式养成一套业务判断。
11.5 让标签回到业务流程,建立“策略—反馈—校准”闭环。