摩杜云开发者社区-摩杜云

文章 | 这篇 DolphinScheduler on k8s 云原生部署实践，值得所有大数据人看！

在当前快速发展的技术格局中，企业寻求创新解决方案来简化运营并提高效率成为一种趋势。 ApacheDolphinScheduler作为一个强大的工具，允许跨分布式系统进行复杂的工作流任务调度。本文将深入探讨如何将ApacheDolphinScheduler适配并整合进现代IT环境，提升其在云原生部署中的表现。前言 ApacheDolphinScheduler的高效云原生部署模式，比原始部署模式节省了95%以上的人力资源和工作时间，提升了部署效率和成本效益。通过集成GitOps技术，我们提升了ApacheDolphinScheduler的DevOps管理能力，改善了软件交付效率和安全审计能力。...

sFKdtsnoEZdx 22天前 31 0 0 大数据

文章 | 解密数仓的SQL ON ANYWHERE技术

本文分享自华为云社区《GaussDBDWS的SQLONANYWHERE技术解密》，作者：tooooooooooomy。 1.前言适用版本：【8.1.1（及以上）】查询分析是大数据要解决的核心问题之一，虽然大数据相关的处理引擎组件种类繁多，并提供了丰富的接口供用户使用，但相对传统数据库用户来说，SQL语言依然是使用最简单、最广泛和方便的一种接口。如果能在一个客户端中使用SQL语句操作不同的大数据组件，将极大提升使用各种大数据组件的效率。 2.什么是SQLOnAnywhere GaussDB(DWS)的SQLOnAnywhere，主要指对大数据的文件系统和与其他异构数据库的访问和交互，构筑...

YqbaJkf98QJO 2024年04月03日 45 0 0 大数据

文章 | 用海豚调度器定时调度从Kafka到HDFS的kettle任务脚本

在实际项目中，从Kafka到HDFS的数据是每天自动生成一个文件，按日期区分。而且Kafka在不断生产数据，因此看看kettle是不是需要时刻运行？能不能按照每日自动生成数据文件？为了测试实际项目中的海豚定时调度从Kafka到HDFS的Kettle任务情况，特地提前跑一下海豚定时调度这个任务，看看到底什么情况,也给大家提供一个参考！海豚调度任务配置（一）SHELL脚本配置 !/bin/bash source/etc/profile /opt/install/kettle9.2/data-integration/pan.sh-rep=hurys_linux_kettle_repositor...

sFKdtsnoEZdx 22天前 25 0 0 大数据

文章 | WhaleScheduler为银行业全信创环境打造统一调度管理平台解决方案

项目背景数字金融是数字经济的重要支撑和驱动力。近年来，我国针对数字金融的发展政策频频出台，《金融科技发展规划（2022-2025年）》、《“十四五”数字经济发展规划》、《关于银行业保险业数字化转型的指导意见》、《金融标准化“十四五”发展规划》等相继发布，顶层设计逐步完善。 2024年，政府工作报告也提出要大力发展科技金融、绿色金融、普惠金融、养老金融、数字金融，未来数字金融是我国金融发展重点之一。我国金融业正在步入数字化转型的关键阶段，同时在发展中面临着诸多挑战与难点，如数字基础设施建设不足、数字安全保障机制不健全等。某国有银行地区性分行（以下简称“银行”）主动融入数字经济新浪潮，抢...

sFKdtsnoEZdx 20天前 14 0 0 大数据

文章 | SeaTunnel JDBC DB2 Sink Connector支持的工作原理，快来学习吧！

DB2是IBM的一款关系型数据库管理系统，JDBCDB2SourceConnector是一个用于通过JDBC读取外部数据源数据的连接器。ApacheSeaTunnel如何支持JDBCDB2SinkConnector？请参考本文档。支持引擎 SparkFlinkSeaTunnelZeta 主要功能精确一次性 CDC（变更数据捕获）使用Xa事务来确保精确一次性。因此，只支持对支持Xa事务的数据库进行精确一次性操作。您可以设置is_exactly_once=true来启用它。描述通过JDBC写入数据。支持批处理模式和流式模式，支持并发写入，支持精确一次性语义（使用XA事务保证）...

NCZdV8CZSb34 20天前 16 0 0 大数据

文章 | 【安装部署】Apache SeaTunnel 和 Web快速安装详解

版本说明由于作者目前接触当前最新版本为2.3.4但是官方提供的web版本未1.0.0，不兼容2.3.4，因此这里仍然使用2.3.3版本。可以自定义兼容处理，官方提供了文档：https://mp.weixin.qq.com/s/Al1VmBoOKu2P02sBOTB6DQ 因为大部分用户使用SeaTunnelWeb都是基于SeaTunnel-2.3.3版本做的适配,而最新发布的SeaTunnel2.3.4部分API发生了改动导致直接升级的过程中会出现API不兼容的问题，所以本篇文章重点来了:我们需要对调用SeaTunnelAPl的SeaTunnelWeb源码部分进行修改，修改完之后，就能完全适...

sFKdtsnoEZdx 23天前 14 0 0 大数据

文章 | hive窗口分析函数使用详解系列一

1.综述 Hive的聚合函数衍生的窗口函数在我们进行数据处理和数据分析过程中起到了很大的作用在Hive中，窗口函数允许你在结果集的行上进行计算，这些计算不会影响你查询的结果集的行数。 Hive提供的窗口和分析函数可以分为聚合函数类窗口函数，分组排序类窗口函数，偏移量计算类窗口函数。本节主要介绍聚合函数类窗口函数的常见使用场景。 1.1.常见聚合类开窗函数 count()over(); sum()over(); max()over(); min()over(); avg()over(); 1.2.分析函数语法分析函数over(partitionby列名orderby列名rowsbetwe...

Ku3edDmxXuM9 2024年04月08日 38 0 0 大数据

文章 | 天翼云入选“2023年度数据要素价值创新标杆示范案例”！

近日，由新一代信息技术产业研究院、赛迪未来产业研究中心共同主办，中国电子学会区块链分会、至顶科技联合承办的“2024未来信息技术大会暨首届数据要素创新发展论坛”于北京成功举办。大会公布了“2023年度数据要素价值创新标杆示范案例”评选结果，天翼云“海南省数据产品超市公共数据资源开发利用平台”与“福州市公共数据要素流通平台”获此殊荣，为推动数据要素市场化配置、助力数据要素价值释放树立了行业标杆。   天翼云相关专家出席会议并分享了天翼云加速向智能云全面升级，在智算服务体系建设、数据要素平台技术创新方面的实践和成果。今年，“人工智能+”首次写入政府工作报告，全面驱动产业数智化升级。...

1H97ZBKLEqYv 23天前 36 0 0 大数据

文章 | 倒计时1天 | 袋鼠云春季发布会完整议程出炉！快快预约直播

在日新月异的数字化经济时代，企业和组织不断寻求利用先进技术构建自身的核心竞争力。其中，大数据与AI的深度融合正在成为推动企业实现新质生产力的关键路径。在此背景下，袋鼠云举办春季发布会，以“Data+AI，构建新质生产力”为主题，旨在深度探讨如何将数据与AI紧密结合，以期打破传统的生产力边界，赋能企业实现更高质量、更高效率的数字化发展。 2024袋鼠云春季发布会完整议程出炉，精彩看点抢先一步了解，欢迎大家预约直播间。 4月10日10:00，不见不散～《行业指标体系白皮书》下载地址：https://www.dtstack.com/resources/1057?src=szsm 《数栈产品白皮...

b5JnreLK4zaN 30天前 44 0 0 大数据

文章 | Apache SeaTunnel 社区 3 月月报

各位热爱SeaTunnel的小伙伴们，SeaTunnel社区3月月报来啦！这里将记录SeaTunnel社区每个月的重要更新，并评选出月度之星，欢迎关注。 SeaTunnel月度MergeStars 感谢以下小伙伴3月为ApacheSeaTunnel做的精彩贡献（排名不分先后）： @Carl-Zhou-CN,@ilsl1007,@loveyang1990,@dailai,@liugddx,@CheneyYin,@litiliu,@ShaunWuu,@hailin0,@rewerma,@wineternity,@lihjChina,@luohoufu,@lightzhao,@liunaijie,...

NCZdV8CZSb34 28天前 23 0 0 大数据

文章 | Apache DolphinScheduler 社区 3 月月报

各位热爱DolphinScheduler的小伙伴们，DolphinScheduler社区月报开始更新啦！这里将记录DolphinScheduler社区每月的重要更新。社区为DolphinScheduler3.2.x版本做了诸多功能改进和bug修复 DolphinScheduler月度MergeStars 感谢以下小伙伴3月为ApacheDolphinScheduler所做的精彩贡献（排名不分先后）： @abzymeinsjtu,@pinkfloyds,@zero-element,@liuchunhua,@SbloodyS,@Gallardot,@devosend,@caishunfen...

sFKdtsnoEZdx 28天前 24 0 0 大数据

文章 | EasyMR6.2 全面解读：四大功能深度优化，解锁全新大数据处理和计算体验

在刚刚过去的2024春季发布会上，袋鼠云带来了数栈产品V6.2版本的全新发布。其中，EasyMR作为数栈V6.2中的一项关键能力，代表了袋鼠云对大数据生态的深入理解和持续创新。 EasyMR（后文统称EMR）是袋鼠云基于Hadoop、Hive、Spark、Flink、HBase等开源组件，构建的弹性计算引擎，提供安全可靠、弹性伸缩、低成本的大数据存储与计算服务。其中自主研发的EasyManager企业级大数据运维管理平台支持Hadoop集群的一站式创建、管理、部署、运维与监控功能，提供高效搭建数据中台解决方案。面对企业日益增长的数据处理和分析需求，EMR6.2版本，将为用户提供更为出色的大数...

b5JnreLK4zaN 17天前 17 0 0 大数据

文章 | 袋鼠云春季发布会圆满落幕，构建Data+AI新质生产力

4月10日，以“Data+AI，构建新质生产力”为主题的袋鼠云春季发布会圆满落幕。大会中，袋鼠云带来了一系列“+AI”的数字化产品与最新行业沉淀，旨在将数据与AI紧密结合，打破传统的生产力边界，赋能企业实现更高质量、更高效率的数字化发展。 2部白皮书：聚焦行业沉淀《行业指标体系白皮书》：系统阐述了指标体系建设的基础理念、目标价值、建设实施路径、管理原则及规范落地的全过程。不仅构筑了扎实的理论框架，还详尽剖析了三大典型行业在指标体系建设上的实践案例，深度解读了金融、大宗贸易、零售、港口及制造五大关键领域的行业指标库，为企业建设指标体系提供理论+实践的全新参考。《数字孪生行业方案白皮书》：聚...

b5JnreLK4zaN 28天前 30 0 0 大数据

文章 | 裁员了！别错过2024年大数据工程师必备的10项技能

在当今快速发展的世界中，数据被视为新的石油。随着对数据驱动洞察的日益依赖，大数据工程师的角色比以往任何时候都更为关键。这些专业人员在管理和优化组织内的数据操作中扮演着至关重要的角色。在本文中，我们将探索2024年大数据工程师必须具备的十项技能。理解大数据工程师的角色在深入技能之前，了解大数据工程师不断演变的角色至关重要。传统上，数据工程师负责管理数据管道和基础设施。然而，随着DataOps的兴起，格局已经发生了变化。大数据工程师现在专注于自动化和简化数据操作，确保数据质量，并促进跨职能协作。他们在数据工程、数据科学和IT运维之间架起了桥梁，创建了一个高效且可扩展的数据生态系统。 Da...

sFKdtsnoEZdx 23天前 25 0 0 大数据

文章 | hive on spark内存模型

内容介绍 hiveonspark的调优,那必然涉及到这一系列框架的内存模型。本章就是来讲一下这些框架的内存模型。hiveonspark的任务，从开始到结束。总共涉及了3个框架。分别是：yarn、hive、spark其中，hive只是一个客户端的角色。就不涉及任务运行时的内存。所以这里主要讲的yarn和spark的内存模型。其中，由于spark是运行在yarn的container中。所以我们从外到内。先将yarn的资源分配。后讲spark的内存模型。 hiveonspark提交流程 hive阶段首先上场的是hive框架。当我们写了一个SQL语句的时候，会被hive进行解析（hive用的SQL解...

Gyz2GVSspoIi 23天前 27 0 0 大数据

文章 | 实时数仓构建：Flink+OLAP查询的一些实践与思考

今天是一篇架构分享内容。 1.概述以Flink为主的计算引擎配合OLAP查询分析引擎组合进而构建实时数仓，其技术方案的选择是我们在技术选型过程中最常见的问题之一。也是很多公司和业务支持过程中会实实在在遇到的问题。很多人一提起实时数仓，就直接大谈特谈Hudi，Flink的流批一体等，但实际上，实时数仓包括任何架构体系的构建如果我们抛开成本和稳定性谈技术，那都是有耍流氓的嫌疑。本文主要给大家进行实时数仓构建的技术选型提供一些经验与思考，面试中如果被问及，也可以谈谈。 2.实时数仓的现状目前大多数公司的实时数仓业务完全基于Flink计算引擎来搭建实时数据链路，尤其是大多数具有中大流量，或者业...

Ku3edDmxXuM9 23天前 28 0 0 大数据

文章 | 用海豚调度器定时调度从Kafka到HDFS的kettle任务脚本

在实际项目中，从Kafka到HDFS的数据是每天自动生成一个文件，按日期区分。而且Kafka在不断生产数据，因此看看kettle是不是需要时刻运行？能不能按照每日自动生成数据文件？为了测试实际项目中的海豚定时调度从Kafka到HDFS的Kettle任务情况，特地提前跑一下海豚定时调度这个任务，看看到底什么情况,也给大家提供一个参考！海豚调度任务配置（一）SHELL脚本配置 !/bin/bash source/etc/profile /opt/install/kettle9.2/data-integration/pan.sh-rep=hurys_linux_kettle_repositor...

sFKdtsnoEZdx 24天前 31 0 0 大数据

文章 | 环境的搭建

第4章Hadoop文件参数配置实验一：hadoop全分布配置 1.1实验目的完成本实验，您应该能够：掌握hadoop全分布的配置掌握hadoop全分布的安装掌握hadoop配置文件的参数意义 1.2实验要求熟悉hadoop全分布的安装了解hadoop配置文件的意义 1.3实验过程 1.3.1实验任务一：在Master节点上安装Hadoop 1.3.1.1步骤一：解压缩hadoop-2.7.1.tar.gz安装包到/usr目录下 [root@master]tarzvxfjdk-8u152-linux-x64.tar.gz-C/usr/local/src/ [root@ma...

YAWVsSrNsMIu 2024年04月07日 31 0 0 大数据

文章 | hive窗口分析函数使用详解系列二之分组排序窗口函数

1.综述我们讨论面试中各大厂的SQL算法面试题，往往核心考点就在于窗口函数，所以掌握好了窗口函数，面对SQL算法面试往往事半功倍。已更新第一类聚合函数类，点击这里阅读hive窗口函数聚合函数类本节介绍Hive聚合函数中的第二类聚合函数：分组排序窗口函数。这些函数的用法不仅仅适用于Hive，对于很多数数据库来说同样也适用，比如SparkSQL，FlinkSQL以及Mysql8，Oracle，MSSQL等传统的关系型数据库。如果论使用的广泛性，hive窗口函数中我们使用最广泛的就是排序类窗口函数，我们通常一提起窗口函数，想到的就是这类排序类窗口函数，它在我们进行数据去重中扮演了至关重要的...

Ku3edDmxXuM9 25天前 33 0 0 大数据

文章 | 【导师招募】Apache DolphinScheduler 社区又又又入选开源之夏啦！

很高兴和大家宣布，ApacheDolphinScheduler社区今年再次成功入选入选由中国科学院软件研究所开源软件供应链点亮计划发起的“开源之夏”活动。入选公示链接：https://mp.weixin.qq.com/s/9ExBWGoFPzZ0_SrpAcosZg 此活动旨在鼓励和引导在校学生积极参与开源软件的开发和维护，进而培养和挖掘更多优秀的开发人才，助力于开源社区的持续繁荣和发展。关于开源之夏 “开源之夏”活动提供了一个平台，使学生能够在暑期深入参与开源项目，通过实际操作获取宝贵的经验，并向优秀的开源社区贡献力量。ApacheDolphinScheduler社区的加入，旨在提供项...

sFKdtsnoEZdx 28天前 26 0 0 大数据