构建包含数据摄入、清洗和验证步骤的ETL管道。适用于摄入数据源、转换格式、验证数据或调度加载任务。
Extract-Transform-Load数据工具包(v2.0.0). 记录和管理整个ETL生命周期的数据管道活动——摄取,转换,查询,过滤,聚合,可视化,导是一项面向实际任务的技能。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
抽取-转换-加载(Extract-Transform-Load)数据工具包(v2.0.0)。记录并管理贯穿完整 ETL 生命周期的数据管道活动——包括数据摄入(ingest)、转换(transform)、查询(query)、过滤(filter)、聚合(aggregate)、可视化(visualize)、导出(export)、采样(sample)、模式定义(schema definition)、验证(validation)、管道编排(pipeline orchestration)以及数据画像(data profiling)。每条命令均将其操作记录到独立的日志文件中,并附带时间戳,为您提供结构化的全部数据操作记录。
| 命令 | 描述 |
|---|---|
etl ingest |
记录一次数据摄入事件(来源、格式、行数等)。不带参数时,显示最近的摄入记录。 |
etl transform |
记录一个转换步骤(列重命名、类型转换、归一化等)。不带参数时,显示最近的转换记录。 |
etl query |
记录一次查询操作或 SQL 语句。不带参数时,显示最近的查询记录。 |
etl filter |
记录应用于数据的过滤规则或条件。不带参数时,显示最近的过滤记录。 |
etl aggregate |
记录一个聚合步骤(如 GROUP BY、SUM、AVG 等)。不带参数时,显示最近的聚合记录。 |
etl visualize |
记录一次可视化请求或图表配置。不带参数时,显示最近的可视化记录。 |
etl export |
记录一次导出操作(目标地址、格式、行数)。不带参数时,显示最近的导出记录。 |
etl sample |
记录一次数据采样步骤(样本大小、采样方法、随机种子)。不带参数时,显示最近的采样记录。 |
etl schema |
记录一次模式定义或模式变更。不带参数时,显示最近的模式记录。 |
etl validate |
记录一条数据验证规则或结果。不带参数时,显示最近的验证记录。 |
etl pipeline |
记录一次管道配置或执行步骤。不带参数时,显示最近的管道记录。 |
etl profile |
记录一次数据画像结果(空值计数、分布特征、异常值等)。不带参数时,显示最近的画像记录。 |
etl stats |
显示汇总统计信息:各分类条目数量、总条目数、数据体积、最早记录日期。 |
etl export |
将所有日志数据导出为文件。支持格式:json、csv、txt。(注意:该命令路径与 export 日志命令不同——此处导出的是本工具自身的日志数据。) |
etl search |
在全部日志文件中搜索关键词(不区分大小写)。 |
etl recent |
显示活动历史日志中最近的 20 条记录。 |
etl status |
健康检查:版本号、数据目录路径、总条目数、磁盘占用、最后活动时间。 |
etl help |
显示内置帮助文档,列出所有可用命令。 |
etl version |
输出当前版本号(v2.0.0)。 |
所有数据均以纯文本日志文件形式存储于 ~/.local/share/etl/ 目录下:
.log 文件(例如:ingest.log、transform.log)。history.log 中。export.json、export.csv 或 export.txt。日志条目采用 timestamp|value 格式存储,便于使用 grep 检索、解析或通过管道传递给下游工具处理。
set -euo pipefail)date、wc、du、head、tail、grep、basename、cutschema 命令记录表结构;使用 validate 命令记录数据质量规则及其通过/失败结果。profile 记录字段统计信息、空值率及分布异常;使用 sample 记录采样参数,确保可复现性。pipeline 记录多步骤工作流配置、执行顺序,以及各 ETL 阶段间的依赖关系。stats 获取汇总计数,用 search 按关键词定位特定操作,或执行 export json 将管道日志共享给团队成员,或导入仪表板进行分析。# 记录一次来自 S3 的数据摄入 etl ingest "s3://data-lake/raw/users_2024.csv — 1.2M rows, CSV format" # 记录一个转换步骤 etl transform "Normalize email to lowercase, cast created_at to UTC timestamp" # 记录一条验证规则 etl validate "NOT NULL check on user_id: 0 violations out of 1,200,000 rows" # 记录一张新表的模式 etl schema "users_dim: id INT PK, email VARCHAR(255), created_at TIMESTAMP, country CHAR(2)" # 定义一个管道 etl pipeline "daily_user_load: ingest(s3) -> dedupe -> validate -> load(postgres)" # 搜索所有与 'users' 相关的内容 etl search users # 将全部 ETL 日志导出为 CSV 用于分析 etl export csv # 查看汇总统计信息 etl stats # 检查系统健康状态 etl status
etl ingest 显示最近 20 条摄入记录)。etl recent 快速概览所有类别下的全部活动记录。0 2 * * * etl pipeline "nightly_load completed at $(date)"~/.local/share/etl/ 到指定备份位置,完成数据备份。由 BytesAgain 提供支持 | bytesagain.com | hello@bytesagain.com
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.4万人学习
共49课时 | 82.2万人学习