1.5 数据库领域新技术
最后看三个方向:数据分散在多台机器上怎么办,历史数据怎么用来做决策,数据大到传统数据库装不下怎么办。

重 点这一块看的时候抓一点
每一项新技术都是为了补前面某个“不够用”:一台机器装不下所有数据,就有了分布式数据库。天天处理交易的数据库不适合做多年的统计分析,就有了数据仓库和数据挖掘。数据量、种类、速度都超出关系数据库的设计范围,就有了大数据技术。这一板块了解即可,不涉及推导。
想一想
你觉得一个大网站的数据,是放在一台机器上还是很多台上?
最后看三个方向:数据分散在多台机器上怎么办,历史数据怎么用来做决策,数据大到传统数据库装不下怎么办。

每一项新技术都是为了补前面某个“不够用”:一台机器装不下所有数据,就有了分布式数据库。天天处理交易的数据库不适合做多年的统计分析,就有了数据仓库和数据挖掘。数据量、种类、速度都超出关系数据库的设计范围,就有了大数据技术。这一板块了解即可,不涉及推导。
你觉得一个大网站的数据,是放在一台机器上还是很多台上?
分布式数据库在逻辑上是一个系统,物理上分布在网络的多个结点上,靠四种透明性让用户感觉不到分布。

用户不用知道数据放在哪台机器上(分布透明),不用知道它存了几份(冗余透明),不用知道每台机器上怎么存(物理透明),也不用知道各机器上的数据怎样拼成整体(逻辑透明)。左边的特点里“分布事务执行的复杂性”是代价:一次操作牵涉多台机器,要么都成功要么都失败,做到这一点很难。
连锁超市每家店有自己的库存系统,总部看起来像一个系统。你查“哪家店有货”,不需要知道数据存在哪家店的电脑里。
同一份数据在三台机器上各存一份,好处是什么,麻烦又是什么?
数据仓库把多个来源的历史数据按主题集中起来供分析,数据挖掘从里面找出有用的模式。

数据库管当下的交易,一笔一笔地增删改。数据仓库管历史的分析,数据进去之后基本不再修改,只用来做统计。挖掘的方法分两类:直接挖掘有明确的目标变量,如分类、估值、预测。间接挖掘没有目标变量,只找数据之间的关系,如关联规则、聚类、可视化。
超市的收银系统是数据库。把十年的小票按商品、季节、门店整理起来就是数据仓库。从里面发现“买尿布的顾客常顺手买啤酒”,这个流传很广的故事说的就是数据挖掘。
购物软件给你推荐商品,背后用到了这两样里的哪一样?
大数据的 4V 是量大、类型多、处理快、价值密度低,四个特点合起来让传统数据库力不从心。

Volume:一个视频网站一天新增的数据以 PB 计,一块硬盘装不下。Variety:文字、图片、视频、日志混在一起,不再是整齐的表。Velocity:数据来得快,也要求处理得快,秒级出结果。Value:一天的监控录像里可能只有几秒钟有用。关键技术按数据的流向分四段:采集迁移、存储管理、处理分析、安全与隐私。
有用的部分在全部数据里占比很小,这是价值密度低。数据量大说的是总量,类型繁多说的是格式,速度快说的是产生和处理的节奏。
你一天产生的数据里,哪一类最多?