hive数仓分层

1.hive数仓分层,一般分几个层级,每层的作用是什么

Hive 数仓分层是构建数据仓库的经典方法论,其目的是规范数据流转过程,提升数据复用、易运维性和数据治理能力。通常,Hive 数仓分层主要分为 ODS(操作数据层)、DWD(明细数据层)、DWS(汇总数据层)、ADS(应用数据层),有的企业也会增加 DIM(维度层)、DML(中间层)、DMB(宽表层)等。下面详细说明:

1.1 常见分层及作用

(1)ODS 层(Operational Data Store,原始数据层)

  • 作用:存放从业务系统同步过来的原始数据,通常为业务表的全量或增量快照,最大化还原数据原貌。
  • 特点:与数据源表结构一致,未做复杂处理。
  • 数据来源:来自 OLTP 系统(如 MySQL、Oracle 等),一般通过定时同步(如 Sqoop、DataX)。
  • 用途:为后续数仓层清洗、加工提供数据保障。

(2)DWD 层(Data Warehouse Detail,明细数据层)

  • 作用:对 ODS 数据做清洗、解析、标准化,结构更规范、字段业务语义明确,且仍保留明细级别(不会丢失粒度)。
  • 特点:去重、格式统一、脏数据处理、字段口径规范化。
  • 数据来源:基于 ODS 层数据,经数据清洗加工得到。
  • 用途:作为数仓事实数据分析、统计的底层数据源。

(3)DWS 层(Data Warehouse Summary,汇总数据层)

  • 作用:基于 DWD 层,对明细数据进行多维度聚合、统计,形成中间宽表或多维分析表。
  • 特点:一般是按主题、业务过程、时间粒度做分组汇总(如日报、月报、周报)。
  • 数据来源:通常来源于 DWD 层。
  • 用途:数据服务于 OLAP 分析,支撑 BI、报表等多维分析,解决性能瓶颈。

(4)ADS 层(Application Data Store,应用数据层)

  • 作用:面向具体业务场景和应用需求,进一步加工生成最终报表、指标、接口、标签等。
  • 特点:粒度更粗、结构更简单,直接为业务方或应用系统服务。
  • 数据来源:通常基于 DWS 层,有时也引用维度表、事实宽表。
  • 用途:支撑业务监控、可视化大屏、接口数据输出等。

(5)DIM 维度层和其他

  • DIM:保存业务分析常用维度,如用户、商品、组织架构等,支持数据宽表和分析。
  • DMB/DML/TMP:部分企业还定义中间层、宽表层、临时层,作为特殊业务需要。

1.2 典型分层结构(示意图)

        应用数据层(ADS)   // 指标、标签、接口数据
               ↑
        汇总数据层(DWS)   // 各种汇总宽表
               ↑
        明细数据层(DWD)   // 清洗后标准化的明细表
               ↑
        原始数据层(ODS)   // 数据源原始快照
               ↑
         数据源(OLTP等)

1.3 总结表格

层级简称关键作用粒度说明建议存储周期原始层ODS保留原始业务数据明细15-30天/看磁盘明细层DWD清洗、标准化、去重明细1-2年汇总层DWS多维汇总宽表/指标表主题/部门/时间等长期应用层ADS报表、接口、直接应用维度表/标签/聚合按需维度层DIM辅助分析的维度字典维度唯一性长期

内容概要:本文介绍了ENVI Deep Learning V1.0的操作教程,重点讲解了如何利用ENVI软件进行深度学习模型的训练与应用,以实现遥感图像中特定目标(如集装箱)的自动提取。教程涵盖了从据准备、标签图像创建、模型初始化与训练,到执行分类及结果优化的完整流程,并介绍了精度评价与通过ENVI Modeler实现一键化建模的方法。系统基于TensorFlow框架,采用ENVINet5(U-Net变体)架构,支持通过点、线、面ROI或分类图生成标签据,适用于多/高光谱影像的单一类别特征提取。; 适合人群:具备遥感图像处理基础,熟悉ENVI软件操作,从事地理信息、测绘、环境监测等相关领域的技术人员或研究人员,尤其是希望将深度学习技术应用于遥感目标识别的初学者与实践者。; 使用场景及目标:①在遥感影像中自动识别和提取特定地物目标(如车辆、建筑、道路、集装箱等);②掌握ENVI环境下深度学习模型的训练流程与关键参设置(如Patch Size、Epochs、Class Weight等);③通过模型调优与结果反馈提升分类精度,实现高效自动化信息提取。; 阅读建议:建议结合实际遥感项目边学边练,重点关注标签据制作、模型参配置与结果后处理环节,充分利用ENVI Modeler进行自动化建模与参优化,同时注意软硬件环境(特别是NVIDIA GPU)的配置要求以保障训练效率。
内容概要:本文系统阐述了企业新闻发稿在生成式引擎优化(GEO)时代下的全渠道策略与效果评估体系,涵盖当前企业传播面临的预算、资源、内容与效果评估四大挑战,并深入分析2025年新闻发稿行业五大趋势,包括AI驱动的智能化转型、精准化传播、首发内容价值提升、内容资产化及据可视化。文章重点解析央媒、地方官媒、综合门户和自媒体四类媒体资源的特性、传播优势与发稿策略,提出基于内容适配性、时间节奏、话题设计的策略制定方法,并构建涵盖品牌价值、销售转化与GEO优化的多维评估框架。此外,结合“传声港”工具实操指南,提供AI智能投放、效果监测、自媒体管理与舆情应对的全流程解决方案,并针对科技、消费、B2B、区域品牌四大行业推出定制化发稿方案。; 适合人群:企业市场/公关负责人、品牌传播管理者、字营销从业者及中小企业决策者,具备一定媒体传播经验并希望提升发稿效率与ROI的专业人士。; 使用场景及目标:①制定科学的新闻发稿策略,实现从“流量思维”向“价值思维”转型;②构建央媒定调、门户扩散、自媒体互动的立体化传播矩阵;③利用AI工具实现精准投放与GEO优化,提升品牌在AI搜索中的权威性与可见性;④通过据驱动评估体系量化品牌影响力与销售转化效果。; 阅读建议:建议结合文中提供的实操清单、案例分析与工具指南进行系统学习,重点关注媒体适配性策略与GEO评估指标,在实际发稿中分阶段试点“AI+全渠道”组合策略,并定期复盘优化,以实现品牌传播的长期复利效应。
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
红包 添加红包
表情包 插入表情
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值