> ## Content Index
> Fetch the complete content index at: https://xilejun.com.cn/llms.txt
> Use this file to discover other available public pages before exploring further.

# 《数据分析通识》目录和简介
- URL: https://xilejun.com.cn/book-contents/
- Published: 2026-08-29T08:07:38.000Z
- Updated: 2026-08-31T13:30:36.000Z
- Description: 更新于 2026-08-29。第一篇自下而上：业务 → 数据 → 分析 → 决策。
- Author: 喜乐君分析知识库

#### 全书结构总览（三篇十一章）

> 更新于 2026-08-29。  
> 本文件是全书的结构底稿： 骨架，逻辑关系，每章约 200 字的知识要点

### 全书骨架

第一篇 认知篇 

- CH01 “业务·数据·分析”：普适性业务分析认知框架
- CH02 “数字化企业”数据架构：企业数字化成长阶段
- CH03 数字化最佳实践：评估基准、数据文化与组织路径
- CH04 数字化转型的歧路：避免形式主义与教条主义

第二篇 概念篇 

💡

指标是分析的核心，问题是分析的起点，  
记录是分析的素材，模型是迈向高级分析的“阶梯”。

- CH05 指标与度量：连接业务、数据、分析的桥梁
- CH06 问题与可视化：从问题结构到可视化表达
- CH07 面向记录的数据模型：从业务事实到记录表与“属性表”
- CH08 面向分析的数据模型：从分析需求到关系模型
- CH09 面向业务自动化的算法模型：经验的固化、语义层与 AI

第三篇 案例篇 

- CH10 从业务流程到敏捷分析：库存分析案例
- CH11 从需求到敏捷分析：航空旅客流失分析

### 逻辑关系

- **第一篇自下而上**：业务 → 数据 → 分析 → 决策。
  - 给的是认知框架与判断力，读者是决策者。
- **第二篇自上而下**：指标 → 问题 → 记录 → 模型 → 算法。
  - 给的是概念工具，读者是分析师。之所以反着走，是因为**分析师的日常起点是问题和指标，而不是数据表**——先给用得上的，再向下追问它凭什么成立。
- **第三篇两个方向各走一遍**：两章合起来，正是第一篇框架的双向验证。
  - 第10章库存案例自下而上（业务记录决定表结构），
  - 第11章航空案例自上而下（分析需求倒推数据准备）。

## 章节要点

### 第一篇 认知篇

### **第1章 “业务·数据·分析”认知框架**

全书的地图。本章立起“业务—数据—分析”三层认知框架，并落成一张可操作的“数据地图”：业务投影（1.2）→ 数据准备（1.3）→ 数据分析（1.4）→ 辅助决策（1.5）。

核心判断有三条：数据不是人造的表格，而是业务的投影，因此理解数据必先理解业务；业务可拆为业务对象、业务过程、业务规则三要素，这组划分贯穿全书，第7章的属性表与事实表正是它在数据层的对应；数据分析本身有四种由低到高的抽象形态——逻辑指标、问题与可视化、交互仪表板、假设验证与探索分析。1.4.1 提前埋下全书最硬的一条主张：**逻辑指标不应被物化**。

1.2.3 的民航“航节、航班、航段”案例，是全书第一次演示“同一业务、三种粒度”，第11章的 PNR／客票／航段之辨与它同源。

### **第2章 “数字化企业”数据架构**

全书的载具。本章按“业务在线 → 交易与分析分家 → 分析独立”三个阶段讲三代数据架构：极简的 APPs+BI（2.2）、经典的 APPs/ODBs+DW/BI（2.3）、敏捷 BI 与 DW/BI 一体化（2.4），再到大型企业的三层架构与选型标尺（2.5），最后给出 AI 时代的形态 (APPs+DW+BI)×AI（2.6）。

关键判断是 2.4.2 的**三个“不可物化”**——它是第二篇“度量不可物化”在架构层的先声，第8章 8.6.2 与第9章 9.3 都从这里接力。2.3.3 的数据仓库分层设计与 2.3.4 的“数据仓库悖论”，解释了为什么越治理反而越远离业务。

本章留给读者两件可直接带走的工具：数据架构选型标尺（2.5.4），以及判断自己企业该停在哪一代、而不是盲目追最新一代的尺度。

### **第3章 数字化转型的正道**

全书的正道。本章给出评估企业数字化水平的**“不规则三角”模型**——认知、组织、工具三边不等长，短板决定水位（3.1），并配了可直接打分的简化量表（3.1.4）。3.1.2 区分 Push 与 Pull 两种转型策略：由 IT 推动还是由业务拉动，决定了转型是完成任务还是产生价值。

3.2 讲“可实践的数据文化”，落点在“一切用数据说话”与“视数据为资产”，强调文化不是口号，而是认知与方法的整合体。3.3–3.4 追踪职能演进：信息部如何长成数据部，而**数据部的核心职责应当是数据建模而非取数**——这一判断在第8章得到完整的技术兑现。

3.5 给出业务主导转型的可行路径，3.6 作桥，转入下一章的歧路清单。

### **第4章 数字化转型的歧路**

全书的歧路清单，与第3章互为镜像。4.1 列举五种形式主义：炫酷大屏、复杂报表、脱离逻辑模型的“指标平台”与“标签体系”、只盯末端表现而忽视数据治理，以及“AI 形式主义”——用智能的外衣掩盖数据的地基。

其中 4.1.3 是第二篇多处论证的靶子：第8章 8.6.2 从技术上证明脱离模型的指标平台不成立，第9章 9.3.3 则指出没有语义层的 ChatBI 只是它的 2.0 版本。4.2 转向教条主义：IT 部门的 SQL 垄断、对数仓分层的教条执行、照搬方法论的“技术懒惰”。

4.3 给分析师的职业建议——避免工具化，构建分析通识的护城河。全章态度是：**不走弯路，就已经成功了一半。**

### 第二篇 概念篇

### **第5章 指标与度量**

第二篇的起点，主角是聚合。本章立起全书原则一：**度量的本质是聚合**。5.1 用“我写过几本书”与“我叫什么名字”区分分析型问题与查询型问题——前者的答案由聚合创造，本不存在于任何一行数据里；由此推出可加、半可加、不可加的三分，这是一切指标计算的前提。

5.2 指出指标的抽象水平就是管理水平。5.3 展开指标体系：一类直接聚合、二类条件聚合、三类组合运算，并用“单车均价”证明比率指标为何不可物化——这是全书论证力最强的一段。5.4 做正本清源：measure 兼有“计量”（过程1，记录）与“度量”（过程2，分析）两义，混用是分析世界最深的误解之源。

5.5 给出结论：**度量不住在任何一张表里，它在数据表之上、在模型之中。**

### **第6章 问题与可视化**

承上启下的一章：问题的核心是指标（承上），问题的基础是模型（启下）。6.1 给出本质——**一切分析型问题都是分组聚合**。

6.2–6.4 把问题拆成跨工具通用的语法：第一字段角色（维度与度量）决定问题结构，第二字段角色（连续与离散）决定可视化表达，第三字段角色（行级计算与聚合计算）连同三类筛选（前置、后置、嵌套）决定计算逻辑。三组角色都是**主观的**，随问题而变，与客观的数据类型无关——这是第7章 7.2.1 的直接对手戏。

6.5 指出 Tableau 的 LOD 与 Power BI 的 CALCULATE 是两条路线、同一个模型。6.6 划出边界：本章所有例子都是单表的；问题一旦跨出单表就需要模型，库存周转率就是那个跨不过去的例子。

### **第7章 事实表与属性表**

第二篇的地基之章，主角是记录。7.1 从一次真实销售交易讲到关系表的一行：行对应业务过程，列对应业务对象，5W2H 是识别核心字段的抓手；并对比关系表与 Excel，指出“单元格思维”是分析师要跨过的第一道墙。

7.2 讲两个客观约束：字段的**数据类型**约束数据值的一致性，数据表的**详细级别**约束记录的唯一性——它们先于分析而存在，与第6章那三组主观的字段角色恰成对照。7.3 讲组织：范式为什么抵制大宽表，而“维度建模”又为什么允许必要的冗余，第二范式是性能与完整性之间的平衡点。

7.4 是全章高地，处理三处最深的误解，共用同一个要害——分清过程1与过程2：**事实表中无度量**；“维度表”的维度是属性而非问题中的维度；物化的代价是逻辑意义的**退化**。

### **第8章 数据模型**

第二篇的收束之章，主角是组织。8.1 把模型分为数据库模型、数据分析模型、算法模型三类（第三类由第9章兑现），并立起物理与逻辑两条主线。

8.2 沿“由实向虚”走一遍物理模型：物化宽表（有名有实）、View（有名无实）、物化视图（混合体），并给出全章最要紧的判断——**物理还是逻辑不是绝对的，而是相对的，取决于观察的语境**。8.3–8.4 转入逻辑关系模型：单事实星型、基数与引用完整性、雪花模型，以及跨主题多事实与共享维度，关键在“**关联而不合并**”，让星型保持立体而不是被压平。

8.5 讲无名无实的临时关系。8.6.2 给出第二篇的枢纽结论：**度量必须建立在数据模型之上**——这正是第5章 5.5 的标题，环由此闭合。

### **第9章 算法模型：经验的固化、语义层与 AI**

第二篇的开口，主角是判断。前四章合上了环，本章向前开一道口：当“模型”一词越来越多地指向评分卡、排班算法和大语言模型时，前八章那套判断还够不够用。

9.1 给出算法模型的本性——**它固化的是经验，不是智慧**，价值在于可复制、可并发、不疲倦；企业需要它，不是因为决策变难了，而是因为决策的**数量**超过了人的注意力带宽。9.2 处理它与前两种模型的关系：既是递进，更是闭环；物化对分析模型是退化，对算法模型却是前提，算法输出重回分析世界时通常要先**降格**为计量。

9.3 指出算法与 AI 的底层是**语义层**——逻辑模型的对外契约，它物化的是规则而不是结果。9.4 落到分析师：入口不是 Python，而是判断力。

![](https://xilejun.com.cn/content/images/2026/08/---9-3-----------------------2.svg)

### 第三篇 案例篇

### **第10章 库存分析案例：从业务到数据、分析全流程**

案例篇第一章，中型制造企业，走的是**自下而上**：业务记录如何决定数据表结构。三节恰是第二篇三章的缩影。10.1 从最简单的生产入库出发，逐步加入生产批次、分批入库、库位实时数量，演示业务复杂性如何一步步逼迫拆表——第7章回答“为什么应该拆”，本节回答“什么时候不得不拆”。

10.2 沿同一份库存数据搭出指标的抽象阶梯：直接聚合的平均在库金额 → 比率组合的周转率与周转天数 → 排序累计的 ABC 分类，结论是**指标越抽象，对数据准备的要求越高**；10.2.1 点破一处关键张力：实时余额会被覆盖，所以算不了平均，这正是必须另建快照表的理由。10.3 展示好的数据模型如何支撑即席分析，响应时间从数周缩短到半小时。

### **第11章 超大规模案例：航空旅客流失分析与运营决策**

案例篇第二章，超大规模航空企业，走的是**自上而下**：分析需求如何倒推数据准备，与第10章方向相反、恰成一对。

11.1 先统一分析对象——PNR、客票、航段与旅客是四个不同的详细级别，混用一次整套指标就失真；并说明流失分析为何必须聚合到旅客粒度。

11.2 给出差异化标签体系与流失系数 CRC 的初始假设：用旅客自己的历史节奏做分母，判断他是否偏离了个人节奏。

11.3 讲超大规模下的数据准备，Doris 物化、Tableau 动态计算与关系模型三层分工，并在 11.3.5 给出物化的判据。

11.4 是全书唯一一次完整演示**假设验证与探索分析**：四轮修正把 CRC 从一个公式养成一套业务判断。

11.5 让标签回到业务流程，建立“策略—反馈—校准”闭环。