数据入库第二章笔记
第一部分 关系数据库设计
第一节 基础认知
1. 数据加工:对原始数据进行清洗、转换、整合,使其符合数据库存储要求,是数据入库的前置核心操作。
2. 数据模型:对现实世界数据特征的抽象,是数据库设计的核心,分为概念模型、逻辑模型、物理模型,用于规范数据结构与关联关系。
第二节 概念模型与E-R图设计
1. 概念模型:面向用户、反映现实世界事物及联系的数据模型,核心是E-R图(实体-联系图)。
2. E-R图构成:实体(矩形)、属性(椭圆形)、联系(菱形),联系分为一对一、一对多、多对多三种类型。
3. 设计实例:梳理业务实体(如学生、课程),明确各实体属性,定义实体间关联(如学生与课程是多对多选课联系),绘制完整E-R图。
4. E-R图转关系模式:将实体、联系转化为数据库表,实体对应独立表,属性对应字段,联系通过外键实现表间关联。
第二部分 数据库规范化
1. 关系数据库范式理论
核心是规范化,通过范式规则减少数据冗余、避免插入/删除/更新异常,常用范式:
- 第一范式(1NF):字段不可再分,保证原子性;
- 第二范式(2NF):满足1NF,且非主键字段完全依赖主键,消除部分依赖;
- 第三范式(3NF):满足2NF,且非主键字段间无依赖,消除传递依赖。
2. 规范化实例
结合实际业务表,依据范式理论拆分冗余表、调整字段依赖,优化表结构,提升数据存储效率与一致性。
第三部分 数据入库实操
1. 核心流程
数据源提取→数据预处理(清洗、转换、映射)→入库前校验→数据导入→入库后核对→日志归档
2. 入库方式
- 手动导入:少量临时数据,操作简便;
- 脚本导入:SQL/Python批量导入,灵活高效;
- 工具导入:ETL工具,适配大批量、周期性数据。
3. 常见问题解决
- 乱码:统一UTF-8编码;
- 入库失败:核对字段类型、主键约束;
- 数据重复:提前去重+设置唯一主键;
- 数据错位:修正字段映射关系。
第四部分 商业实例与实训
结合真实商业场景,完成E-R图设计→关系模式转化→数据库规范化→数据入库全流程实操,巩固理论与实操技能,掌握企业级数据入库标准操作。
章节核心总结
先完成关系数据库设计与规范化,夯实数据存储结构基础,再执行数据入库实操,遵循“先设计、先规范、再处理、后入库”原则,保障数据规范、无冗余、准确入库。
