浅谈企业数据仓库架构的稳中有变

本文探讨了企业数据仓库(EDW)建设中的六个关键要素:层次清晰、模块化、元数据驱动、灵活的调度系统、自动监控系统及自动处理系统。通过这些要素,可以构建出能够有效应对业务变化的EDW。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

EDW的概念进入中国后,很多企业建了了企业数据仓库,银行,证券,电信,移动,互联网纷纷开展EDW的建设,EDW的建设基本上是分期进行,不过在EDW上线后是一个持续支撑业务发展的平台,随着时间的推移,业务的迅速发展,EDW的后期维护,优化和变化是一个持续的过程,业务变化越快的企业面临的EDW的架构压力越大,很多匆忙上马的edw项目生命周期很短暂,能在业务架构若干次调整后生存下来的edw项目少之又少,究其原因,大部分是上线初期架构设计不合理造成,那么一套成熟的EDW具备什么特征呢?

1.层次清晰,edw的各层之间紧密联系,但跨层的干扰要尽量小,这样有助于在业务架构变化的时候把变化控制在合适的层次上,而不是牵一发而动全身。

2.模块化。模块化是一个老生常谈的话题,模块化的精神实质是对业务的深度理解和业务底层逻辑架构的深度理解,合理的模块划分,控制模块的复杂度,模块内部原子级别的模块段形式上的统一,这些看似简单的原理,如果用的好,在业务变化迅速的情况下抗压和抗变化能力就能充分体现出来。

3.基于元数据驱动。技术元数据和业务元数据纳入一套edw metadata系统中,元数据的累积需要很好的规范和技术平台化,统一元数据的好处是什么呢?大家可以想一下如下场景,一个业务发生了变化,究竟edw里面有多少地方需要做修改?这个问题是建设edw过程中经常会遇到的一个问题,在一个实施多年的edw系统里面,如元数据不过硬,不完整,这个问题将会是一个灾难性的问题,因为无法全面准确的判断受影响面基本上就宣告了改动的无目的性和针对性。元数据的基本作用就是能在这样的情况下准确的判断出edw的受影响面,当然其他的深度作用很多,这里不做详细阐述。

4.灵活的调动系统。调度系统是一套edw系统的骨架和筋脉。调度系统把edw的各个模块根据元数据的相关性灵活的组织起来,是一个纯动态的系统。调动系统要能做到负载均衡,并行调动,最基本的一条是调度的准确性是数据准确性的一个非常重要的基础要求,调度的准确性和模块业务逻辑的准确性是产生完整准确的分析数据的两大基础性要素。合理灵活的调动系统能充分的利用机器的资源,最大化的减少etl时间窗口,一套好的调度系统对建设edw的ROI指标非常重要。

5.自动监控系统。既然edw是企业数据仓库,其中指标,kpi会非常多,这些指标往往是业务决策的重要来源,如何在最后一层上保障数据的准确性。一套数据预警系统是产生高质量数据结果和最早发现业务问题的一个重要基础。

6.自动处理系统。edw建设的复杂性之一是企业it环境的复杂,出现问题的点会非常多,人工处理的经验一定要合理的抽象出规则,耐入到edw的自动处理系统中,使得edw系统具备尽可能多的自我处理能力。

资源下载链接为: https://pan.quark.cn/s/140386800631 通用大模型文本分类实践的基本原理是,借助大模型自身较强的理解和推理能力,在使用时需在prompt中明确分类任务目标,并详细解释每个类目概念,尤其要突出类目间的差别。 结合in-context learning思想,有效的prompt应包含分类任务介绍及细节、类目概念解释、每个类目对应的例子和待分类文本。但实际应用中,类目和样本较多易导致prompt过长,影响大模型推理效果,因此可先通过向量检索缩小范围,再由大模型做最终决策。 具体方案为:离线时提前配置好每个类目的概念及对应样本;在线时先对给定query进行向量召回,再将召回结果交给大模型决策。 该方法不更新任何模型参数,直接使用开源模型参数。其架构参考GPT-RE并结合相关实践改写,加入上下文学习以提高准确度,还使用BGE作为向量模型,K-BERT提取文本关键词,拼接召回的相似例子作为上下文输入大模型。 代码实现上,大模型用Qwen2-7B-Instruct,Embedding采用bge-base-zh-v1.5,向量库选择milvus。分类主函数的作用是在向量库中召回相似案例,拼接prompt后输入大模型。 结果方面,使用ICL时accuracy达0.94,比bert文本分类的0.98低0.04,错误类别6个,处理时添加“家居”类别,影响不大;不使用ICL时accuracy为0.88,错误58项,可能与未修改prompt有关。 优点是无需训练即可有较好结果,例子优质、类目界限清晰时效果更佳,适合围绕通用大模型api打造工具;缺点是上限不高,仅针对一个分类任务部署大模型不划算,推理速度慢,icl的token使用多,用收费api会有额外开销。 后续可优化的点是利用key-bert提取的关键词,因为核心词语有时比语意更重要。 参考资料包括
内容概要:本文详细介绍了哈希表及其相关概念和技术细节,包括哈希表的引入、哈希函数的设计、冲突处理机制、字符串哈希的基础、哈希错误率分析以及哈希的改进与应用。哈希表作为一种高效的数据结构,通过键值对存储数据,能够快速定位和检索。文中讨论了整数键值和字符串键值的哈希方法,特别是字符串哈希中的多项式哈希及其优化方法,如双哈希和子串哈希的快速计算。此外,还探讨了常见的冲突处理方法——拉链法和闭散列法,并提供了C++实现示例。最后,文章列举了哈希在字符串匹配、最长回文子串、最长公共子字符串等问题中的具体应用。 适合人群:计算机科学专业的学生、算法竞赛选手以及有一定编程基础并对数据结构和算法感兴趣的开发者。 使用场景及目标:①理解哈希表的工作原理及其在各种编程任务中的应用;②掌握哈希函数的设计原则,包括如何选择合适的模数和基数;③学会处理哈希冲突的方法,如拉链法和闭散列法;④了解并能运用字符串哈希解决实际问题,如字符串匹配、回文检测等。 阅读建议:由于哈希涉及较多数学知识和编程技巧,建议读者先熟悉基本的数据结构和算法理论,再结合代码实例进行深入理解。同时,在实践中不断尝试不同的哈希策略,对比性能差异,从而更好地掌握哈希技术。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值