返回信息流我目前维护的数据仓库是teradata的产品,属于mpp架构的,具体的可以放狗了解一下。
数据仓库状况如下:
1.17个节点,裸容量149TB,用户可用容量98T,目前使用80T。
2.每日原始数据5亿条,遍历2亿条记录需要四个小时。
3.仓库中最大的表容量:4T。
4.每月备份数据量:10T左右。
5.目前已经连续运行4个月没有进行重启操作。
6.使用ETL automation进行批处理作业的调度,目前每日运行批处理作业3k多个,每月2k多个。
别的细节暂时想不到,有想了解的可以留言~~
写这个只是想给出一个数据仓库大概的规模,这个还不是全中国最大的,中国最大的teradata数据仓库大概有40个以上的节点机。全球最大的ebay大概有130个以上的节点机。
以上。
ps.据说南方某省有数据仓库有400t的生产数据...
这是一条镜像帖。来源:北邮人论坛 / database / #5412同步于 2011/4/9
该镜像源已超过 30 天没有更新,可能在源站已被删除。
Database机器人发帖
TERADATA数据库,大家可以交流一下
ipfox
2011/4/9镜像同步2 回复
订阅后,新回复会通过你的通知中心匿名送达。
2 条回复
在接口子系统中,首要任务是从数据通信服务器上将数据下载到ETL服务器上,以便ETL工具调度加载作业进行数据加载。
在接口子系统模块中针对不同的源数据平台要开发不同的数据下载程序,经分系统接口子系统要开发数套数据下载程序。
针对每个平台,FTP程序分两个功能模块:
 文件扫描:负责对通信服务器进行扫描。扫描程序负责检查数据文件和校验文件是否全部到达,以及数据文件是否符合校验文件的描述,同时对符合下载条件的数据文件和校验文件进行标记。
 文件下载:负责从通信服务器上下载数据。下载程序负责下载扫描程序已经作标记的数据,在下载过程中要保证下载的数据完整和正确。
1.2. 临时区逻辑模型及物理模型
为使源数据加载成为可能,需要开发临时区数据的逻辑模型和物理模型。并依据这些物理模型生成实际的数据库表定义。
本功能模块的最终可交付物为利用数据建模工具ERWin4.1生成和存储的临时数据加载区的逻辑数据模型及物理数据模型,以及以文本方式保存的物理表定义语句(SDDL)。
1.3. 接口加载程序
接口加载程序的功能是要将FTP下载到ETL服务器上的数据加载到数据仓库临时区中。每一个接口都会对应一套加载程序,每套加载程序分为执行环境初始化,数据加载,执行环境后处理三个功能模块,每个功能模块对应一个程序脚本。 每个接口的加载脚本都分为程序初始化,数据加载,执行环境后处理三个模块;
1.4. 基础数据区逻辑模型和物理模型
配合临时区数据的转换,整合和加载,需要开发基础数据区数据的逻辑模型和物理模型。并依据这些物理模型生成实际的数据库表定义。
1.5. 数据入库模块
数据入库是指将已经加入临时库的数据加载入数据仓库基础数据区。在这一阶段将对数据进行清洗,转化和整合,因此这一过程是接口子系统的核心功能模块。这一功能模块的一个主要过程就是进行SDM(SOURCE DATA MAPPING),即建立源数据到基础数据模型的映射,并生成数据清洗、转化和入库程序的过程。
1 体系架构设计思路关键因素
建设内蒙古移动经营分析系统数据仓库需要考虑的关键因素有:
1.1 如何获取源系统的数据
1.2 如何保证数据质量
1.3 如何保证在规定的时间窗口内完成数据加载
1.4 如何确保数据仓库的高效运行
1.5 如何高效地向最终用户提供数据