数据库原理与应用 第 1 章 · 第六节
课程第 1 章第六节 过渡分布式仓库与挖掘大数据
第 1 章 数据库系统概述 · 第六节

数据库领域新技术

分布式数据库、数据仓库与数据挖掘、大数据
本 节 知 识 点
  1. 501.5 数据库领域新技术
  2. 51分布式数据库
  3. 52数据仓库与数据挖掘
  4. 53大数据技术
50
第 1 章 · 第六节

1.5 数据库领域新技术

最后看三个方向:数据分散在多台机器上怎么办,历史数据怎么用来做决策,数据大到传统数据库装不下怎么办。

第 50 页课件

重 点这一块看的时候抓一点

每一项新技术都是为了补前面某个“不够用”:一台机器装不下所有数据,就有了分布式数据库。天天处理交易的数据库不适合做多年的统计分析,就有了数据仓库和数据挖掘。数据量、种类、速度都超出关系数据库的设计范围,就有了大数据技术。这一板块了解即可,不涉及推导。

想一想

你觉得一个大网站的数据,是放在一台机器上还是很多台上?

51
第 1 章 · 第六节

分布式数据库

分布式数据库在逻辑上是一个系统,物理上分布在网络的多个结点上,靠四种透明性让用户感觉不到分布。

第 51 页课件

关键术语

分布式数据库Distributed Database
逻辑上属于同一系统、物理上分布在不同网络结点上的结构化数据集合。
透明性Transparency
用户不必知道也感觉不到某件事,就叫对这件事透明。

重 点四种透明性一句话

用户不用知道数据放在哪台机器上(分布透明),不用知道它存了几份(冗余透明),不用知道每台机器上怎么存(物理透明),也不用知道各机器上的数据怎样拼成整体(逻辑透明)。左边的特点里“分布事务执行的复杂性”是代价:一次操作牵涉多台机器,要么都成功要么都失败,做到这一点很难。

打个比方

连锁超市每家店有自己的库存系统,总部看起来像一个系统。你查“哪家店有货”,不需要知道数据存在哪家店的电脑里。

想一想

同一份数据在三台机器上各存一份,好处是什么,麻烦又是什么?

52
第 1 章 · 第六节

数据仓库与数据挖掘

数据仓库把多个来源的历史数据按主题集中起来供分析,数据挖掘从里面找出有用的模式。

第 52 页课件

关键术语

数据仓库Data Warehouse
面向主题的、集成的、相对稳定的、反映历史变化的数据集合,用于辅助决策。
数据挖掘Data Mining
从大量数据中找出有效、新颖、潜在有用、最终可理解的模式,也叫数据库中的知识发现 KDD。

重 点数据库和数据仓库的分工

数据库管当下的交易,一笔一笔地增删改。数据仓库管历史的分析,数据进去之后基本不再修改,只用来做统计。挖掘的方法分两类:直接挖掘有明确的目标变量,如分类、估值、预测。间接挖掘没有目标变量,只找数据之间的关系,如关联规则、聚类、可视化。

打个比方

超市的收银系统是数据库。把十年的小票按商品、季节、门店整理起来就是数据仓库。从里面发现“买尿布的顾客常顺手买啤酒”,这个流传很广的故事说的就是数据挖掘。

想一想

购物软件给你推荐商品,背后用到了这两样里的哪一样?

53
第 1 章 · 第六节

大数据技术

大数据的 4V 是量大、类型多、处理快、价值密度低,四个特点合起来让传统数据库力不从心。

第 53 页课件

关键术语

大数据Big Data
规模、种类、速度超出传统数据库处理能力的数据及相应的技术。

重 点4V 各一个例子

Volume:一个视频网站一天新增的数据以 PB 计,一块硬盘装不下。Variety:文字、图片、视频、日志混在一起,不再是整齐的表。Velocity:数据来得快,也要求处理得快,秒级出结果。Value:一天的监控录像里可能只有几秒钟有用。关键技术按数据的流向分四段:采集迁移、存储管理、处理分析、安全与隐私。

练一练

“一天的监控录像里可能只有几秒钟有用”,说的是大数据的哪个特点?
  1. A数据量大
  2. B数据类型繁多
  3. C处理速度快
  4. D价值密度低
答案 D

有用的部分在全部数据里占比很小,这是价值密度低。数据量大说的是总量,类型繁多说的是格式,速度快说的是产生和处理的节奏。

想一想

你一天产生的数据里,哪一类最多?

保山学院·人工智能教研室·曹鼎鼎