MySQL から Redshift にデータをコピーする理由-mysql チュートリアル-php.cn

ホームページ

データベース

mysql チュートリアル

MySQL から Redshift にデータをコピーする理由

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 03, 2023 am 10:54 AM

mysqlredshift

MySQL から Redshift にデータをコピーする理由

MySQL を使用して Web アプリケーションを強化している多くの企業は、データ分析に Redshift を選択しています。これも行うべき理由がいくつかあります。

アプリケーションのパフォーマンスを維持するため。すでに述べたように、本番環境の MySQL データベースで分析クエリを実行すると、パフォーマンスに重大な影響を与える可能性があります。クラッシュする可能性もあります。分析クエリはリソースを非常に大量に消費するため、専用のコンピューティング能力が必要です。
すべてのデータを分析します。 MySQL は OLTP (オンライントランザクション処理) データベースであり、顧客記録や財務データなどの用途に使用されるため、トランザクションデータに重点を置いて設計されました。ただし、非トランザクションタイプを含むデータセット全体から洞察を得る必要があります。 Redshift を使用すると、すべてのデータを 1 か所でキャプチャして分析できます。
分析の高速化。 Redshift は超並列処理 (MPP) データウェアハウスであり、非常に短時間で大量のデータを処理できます。一方、MySQL は、大規模な最新の分析クエリに必要な計算能力を満たすことが困難です。 MySQL レプリカデータベースでさえ、Redshift と同じ速度を達成するのは困難です。
スケーラビリティ。 MySQL は、最新の分散クラウドインフラストラクチャ向けではなく、単一ノードインスタンス向けに設計されています。したがって、単一ノードを超えて拡張するには時間とリソースが大量に消費され、シャーディングやマスターノードのセットアップなどの技術を使用する必要があります。これらすべてにより、データベースの速度がさらに低下する可能性があります。

MySQL を Redshift にコピーする 4 つの方法

MySQL には固有の弱点があるため、多くの企業は分析ニーズを満たすために MySQL から Redshift にデータをコピーします。これを実現するには 4 つの方法があります。

#import
増分選択とコピー
#Use binlog Change Data Capture (CDC)
ETL

1. インポートとエクスポート

最新の Redshift へのコピー方法は、MySQL データ全体をエクスポートすることです。ただし、これは最も効率の悪い方法でもあります。 3 つのステップがあります:

エクスポート
変換
インポート

エクスポート

まず、MySQL の mysqldump コマンドを使用してデータをエクスポートします。典型的な mysqldump コマンドは次のようになります。

java:

$ mysqldump -h yourmysqlhost -u user mydatabase mytable1 mytable2 --result-file dump.sql

このコマンドの出力は、MySQL SQL ステートメントです。 Redshift 上で SQL をそのまま実行することはできません。ステートメントを Redshift インポートに適した形式に変換する必要があります。

変換

アップロードのパフォーマンスを最適化するには、SQL ステートメントを TSV (タブ区切り値) 形式に変換します。これは、Redshift COPY コマンドを使用して実行できます。

COPY コマンドは、SQL ステートメントを TSV 形式に変換します。次に、Redshift テーブル内の Amazon S3 にファイルをバッチアップロードします。たとえば、MySQL ダンプ内のデータ行は次のようになります:

java:

mysql> INSERT INTO `users` (`id`, `firstname`, `lastname`, `age`) VALUES (1923, ‘John’, ‘Smith’, 34),(1925,’Tommy’,’King’);

COPY を使用すると、次のようになります:

# ＃＃王＃＃＃＃＃＃＃＃＃＃＃＃

请注意，值由制表符分隔(\t)。

您可能还必须将数据值转换为与 Redshift 兼容。这是因为 MySQL 和 Redshift 支持不同的列和数据类型。

例如，DATE 值“0000-00-00”在 MySQL 中是有效的，但在 Redshift 中会抛出错误。您必须将该值转换为可接受的 Redshift 格式，例如“0001-01-01”。

进口

将 MySQL 语句转换后，最终步骤是将其从 S3 导入到 Redshift。为此，只需运行 COPY 命令：

java:

COPY users
FROM 's3://my_s3_bucket/unload-folder/users_' credentials  
'aws_access_key_id=your_access_key;aws_secret_access_key=your_secret_key';

进出口的弊端

尽管导入和导出是复制到 Redshift 的最简单方法，但它并不适合频繁更新。

大约需要30分钟，就能够通过100 Mbps的网络从MySQL导出18GB的数据。将该数据导入 Redshift 还需要 30 分钟。这假设您在导入或导出期间遇到零连接问题，这将迫使您重新开始该过程。

将 MySQL 复制到 Redshift 的更有效方法是增量 SELECT 和 COPY。

2.增量SELECT和COPY

如果导入和导出对于您的需求来说太慢，增量 SELECT 和 COPY 可能是您的答案。

SELECT 和 COPY 方法仅更新自上次更新以来已更改的记录。与导入和导出整个数据集相比，这花费的时间和带宽要少得多。SELECT 和 COPY 使您能够更频繁地同步 MySQL 和 Redshift。

要使用增量 SELECT 和 COPY，您的 MySQL 表必须满足几个条件：

表必须有一个updated_at列，每次更改行时都会更新其时间戳。
表必须有一个或多个唯一键。

和导入导出一样，这个方法也分三步：

1. 出口

增量 SELECT 仅导出自上次更新以来已更改的行。您在 MySQL 上运行的 SELECT 查询如下所示：

java:

SELECT * FROM users WHERE updated_at >= ‘2016-08-12 20:00:00’;

将结果保存到文件以进行转换。

2. 转型

此转换步骤与导入导出方法相同。将 MySQL 数据转换为 Redshift 的 TSV 格式。

3. 进口

您的MySQL TSV文件现在包括更新过的行和新插入的行。对于目标 Redshift 表，您必须采取其他措施而不能直接运行COPY命令。这将导致更新的行被复制。

为避免重复行，请使用 DELSERT（删除 + 插入）技术：

在 Redshift 上创建一个与目标表具有相同定义的临时表。
运行 COPY 命令将数据上传到临时表。
从目标表中删除临时表中也存在的行。它看起来像这样：
java:

DELETE FROM users USING users_staging s WHERE users.id = s.id;

id表的唯一键在哪里。
最后，将行从临时表插入到目标表：

java:

INSERT INTO users (id, firstname, lastname, updated_at) SELECT id, firstname, lastname, updated_at FROM users_staging s;

SELECT 和 COPY 的缺点

增量 SELECT 和 COPY 比导入和导出更有效，但它有其自身的局限性。

主要问题是从 MySQL 表中删除的行会无限期地保留在 Redshift 中。如果您希望在清理 MySQL 上的旧数据时保留在 Redshift 上的历史数据，那也没有问题。否则，在 Redshift 中删除的行会在数据分析过程中引起严重的头痛。

这种方法的另一个缺点是它不复制表模式更改。如果在MySQL表中添加或删除列，则需要手动更新Redshift表以进行相应更改。

最后，用于从 MySQL 表中提取更新行的查询会影响 MySQL 数据库的性能。

如果这些缺点中的任何一个是破坏者，那么下一个方法适合您。

3. 使用 Binlog 更改数据捕获

更改数据捕获 (CDC) 是一种技术，可捕获对 MySQL 中的数据所做的更改并将其应用于目标 Redshift 表。类似增量选择和复制，它只导入已更改数据，而非整个数据库。

然而，与增量 SELECT 和 COPY 不同，CDC 允许您实现 MySQL 到 Redshift 的真正复制。

为了使用CDC方法对MySQL数据库进行操作，必须启用二进制日志（binlog）。使用Binlog，您可以以流的形式记录数据的更改，从而实现接近实时的复制。

除了能捕获数据的变化（插入、更新和删除），Binlog 还能够记录表结构的变化，例如添加或删除列。它确保 Redshift 中已经删除的行也在 MySQL 中删除。

Binlog 入门

当您将 CDC 与 binlog 结合使用时，您实际上是在编写一个应用程序，该应用程序将流数据从 MySQL 读取、转换和导入到 Redshift。

要执行此操作，您可使用开源库 mysql-replication-listener。通过使用这个 C++ 库，我们可以实时从 MySQL binlog 中读取数据，而且支持流式 API。高级 API 也可用于多种语言：kodama (Ruby) 和python-mysql-replication (Python)。

1. 设置

首先，设置 MySQL 配置参数以启用 binlog。以下是binlog相关参数列表：

java:

log_bin = /file_path/mysql-bin.log

Binlog_format参数的设置影响着Binlog事件以何种方式存储在Binlog文件中的格式。支持 3 种格式：语句、混合和行。

语句格式将查询按原样保存在 binlog 文件中（例如UPDATE SET firstname=’Tom’ WHERE id=293;）。尽管它减小了 binlog 文件的大小，但在用于复制时却存在潜在问题。

要复制到 Redshift，请使用行格式。

行格式将更改的值保存在 binlog 文件中。它增加了 binlog 文件大小，但可确保 MySQL 和 Amazon Redshift 之间的数据一致性。log_bin设置存储binlog文件的路径。binlog file retention period is determined by expire_logs_days.。

指定要复制的表需要在replicate-wild-do-table参数中设置。只有那些指定的表才能进入 binlog 文件。

我们建议将 binlog 文件保留几天。这可确保您有时间解决复制过程中出现的任何问题。

如果您使用 MySQL 复制从服务器作为源，则将指定log-slave-updates为 TRUE很重要。否则，在复制主服务器上所做的数据更改将不会记录在 binlog 中。

此外，您的 MySQL 帐户需要具有以下权限才能执行复制相关任务：

复制从站
选择
重新加载
复制客户端
锁表

2. 导出和转换

使用 binlog 时，实际上“export”的是 MySQL binlog 文件的实时数据流。binlog 数据的交付方式取决于您使用的 API。

例如，对于 Kodama，binlog 数据以 binlog 事件流的形式交付。

Kodama 允许您为不同的事件类型（插入、更新、删除、更改表、创建表等）注册事件处理程序。您的应用程序将接收二进制日志事件。输出将被生成，以便用于针对 Redshift 导入的数据更改或者表结构更改。

数据更改导入类似于我们其他复制方法的转换步骤。然而，与其他的不同，binlog 允许您处理已删除的事件。您需要专门处理已删除的事件以维护Redshift 上传性能。

3. 进口

最后，是时候导入您的 binlog 数据流了。

问题是 Redshift 没有蒸汽上传功能。使用我们在增量 SELECT 和 COPY 方法中概述的 DELSERT 导入技术。

Binlog 的缺点

虽然Binlog是从MySQL复制到Redshift的理想方法，但它仍存在一些不足之处。构建您的 CDC 应用程序需要认真的开发工作。

除了我们上面描述的数据流之外，您还必须构建：

交易管理。您应该跟踪数据流性能，以避免错误导致您的应用程序停止读取二进制日志数据。事务管理确保您可以从上次中断的地方继续。
数据缓冲和重试。当数据被发送时，Redshift 可能会出现不可用的情况。您的应用程序需要缓冲未发送的数据，直到 Redshift 集群重新联机。如果此步骤操作不当，可能会导致数据丢失或重复数据。
表模式更改支持。表模式更改二进制日志事件（更改/添加/删除表）作为本机 MySQL SQL 语句出现，它不会按原样在 Redshift 上运行。为了使表架构更改得到支持，你需要将 MySQL语句转换成对应的Amazon Redshift语句。

4. 使用 ETL 即服务

借助 ETL 工具，您可以近乎实时地将数据复制到 Redshift。

与 CDC 方法不同，此类工具可以管理整个复制过程并自动将 MySQL 数据类型映射为 Redshift 使用的格式，因此您不必这样做。您可以将多个 MySQL 数据库（以及其他类型的数据库）同时同步到 Redshift。

此外，设置过程简单而简短。

使用 Amazon Redshift 充分利用 MySQL

即使您将 MySQL 用作业务的基础，但它在数据分析方面的限制是公认的。Redshift 为您的 BI 需求提供了一个简单、强大的解决方案。MySQL 和 Redshift 可以将您的业务推向新的高度。

多种方法可用于从 MySQL 复制数据到 Redshift，如您所见。方法从简单到复杂，从非常缓慢到接近实时。您选择的方法取决于几个因素：

复制频率
MySQL 数据集的大小
可用的开发者资源

记住：使用变更数据捕获（CDC）是最快、最真实的复制方法，它利用 MySQL 的 binlog。缺点是需要开发人员数小时来构建和维护应用程序。

1923 年	ジョン	スミス
1925 年	Tmmy

以上がMySQL から Redshift にデータをコピーする理由の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明

この記事は亿速云で複製されています。侵害がある場合は、admin@php.cn までご連絡ください。

MySQL Index Cardinalityはクエリパフォーマンスにどのように影響しますか？Apr 14, 2025 am 12:18 AM

MySQLインデックスのカーディナリティは、クエリパフォーマンスに大きな影響を及ぼします。1。高いカーディナリティインデックスは、データ範囲をより効果的に狭め、クエリ効率を向上させることができます。 2。低カーディナリティインデックスは、完全なテーブルスキャンにつながり、クエリのパフォーマンスを削減する可能性があります。 3。ジョイントインデックスでは、クエリを最適化するために、高いカーディナリティシーケンスを前に配置する必要があります。

MySQL：新規ユーザー向けのリソースとチュートリアルApr 14, 2025 am 12:16 AM

MySQL学習パスには、基本的な知識、コアの概念、使用例、最適化手法が含まれます。 1）テーブル、行、列、SQLクエリなどの基本概念を理解します。 2）MySQLの定義、作業原則、および利点を学びます。 3）インデックスやストアドプロシージャなどの基本的なCRUD操作と高度な使用法をマスターします。 4）インデックスの合理的な使用や最適化クエリなど、一般的なエラーのデバッグとパフォーマンス最適化の提案に精通しています。これらの手順を通じて、MySQLの使用と最適化を完全に把握できます。

実際のmysql：例とユースケースApr 14, 2025 am 12:15 AM

MySQLの実際のアプリケーションには、基本的なデータベース設計と複雑なクエリの最適化が含まれます。 1）基本的な使用法：ユーザー情報の挿入、クエリ、更新、削除など、ユーザーデータの保存と管理に使用されます。 2）高度な使用法：eコマースプラットフォームの注文や在庫管理など、複雑なビジネスロジックを処理します。 3）パフォーマンスの最適化：インデックス、パーティションテーブル、クエリキャッシュを使用して合理的にパフォーマンスを向上させます。

MySQLのSQLコマンド：実用的な例Apr 14, 2025 am 12:09 AM

MySQLのSQLコマンドは、DDL、DML、DQL、DCLなどのカテゴリに分割でき、データベースとテーブルの作成、変更、削除、データの挿入、更新、削除、複雑なクエリ操作の実行に使用できます。 1.基本的な使用には、作成可能な作成テーブル、INSERTINTO INSERTデータ、クエリデータの選択が含まれます。 2。高度な使用法には、テーブル結合、サブQueries、およびデータ集約のためのグループに参加します。 3.構文エラー、データ型の不一致、許可の問題などの一般的なエラーは、構文チェック、データ型変換、許可管理を介してデバッグできます。 4.パフォーマンス最適化の提案には、インデックスの使用、フルテーブルスキャンの回避、参加操作の最適化、およびデータの一貫性を確保するためのトランザクションの使用が含まれます。

InnoDBは酸コンプライアンスをどのように処理しますか？Apr 14, 2025 am 12:03 AM

INNODBは、ロックメカニズムとMVCCを通じて、非論的、一貫性、および分離を通じて原子性を達成し、レッドログを介した持続性を達成します。 1）原子性：Undologを使用して元のデータを記録して、トランザクションをロールバックできることを確認します。 2）一貫性：行レベルのロックとMVCCを介してデータの一貫性を確保します。 3）分離：複数の分離レベルをサポートし、デフォルトでrepeatable -readが使用されます。 4）持続性：Redologを使用して修正を記録し、データが長時間保存されるようにします。

MySQLの場所：データベースとプログラミングApr 13, 2025 am 12:18 AM

データベースとプログラミングにおけるMySQLの位置は非常に重要です。これは、さまざまなアプリケーションシナリオで広く使用されているオープンソースのリレーショナルデータベース管理システムです。 1）MySQLは、効率的なデータストレージ、組織、および検索機能を提供し、Web、モバイル、およびエンタープライズレベルのシステムをサポートします。 2）クライアントサーバーアーキテクチャを使用し、複数のストレージエンジンとインデックスの最適化をサポートします。 3）基本的な使用には、テーブルの作成とデータの挿入が含まれ、高度な使用法にはマルチテーブル結合と複雑なクエリが含まれます。 4）SQL構文エラーやパフォーマンスの問題などのよくある質問は、説明コマンドとスロークエリログを介してデバッグできます。 5）パフォーマンス最適化方法には、インデックスの合理的な使用、最適化されたクエリ、およびキャッシュの使用が含まれます。ベストプラクティスには、トランザクションと準備された星の使用が含まれます

MySQL：中小企業から大企業までApr 13, 2025 am 12:17 AM

MySQLは、中小企業に適しています。 1）中小企業は、顧客情報の保存など、基本的なデータ管理にMySQLを使用できます。 2）大企業はMySQLを使用して、大規模なデータと複雑なビジネスロジックを処理して、クエリのパフォーマンスとトランザクション処理を最適化できます。

Phantomの読み取りとは何ですか？Innodbはどのようにそれらを防ぐ（次のキーロック）？Apr 13, 2025 am 12:16 AM

INNODBは、次のキーロックメカニズムを通じてファントムの読み取りを効果的に防止します。 1）Next-KeyLockingは、Row LockとGap Lockを組み合わせてレコードとギャップをロックして、新しいレコードが挿入されないようにします。 2）実際のアプリケーションでは、クエリを最適化して分離レベルを調整することにより、ロック競争を削減し、並行性パフォーマンスを改善できます。

See all articles

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

SublimeText3 中国語版

中国語版、とても使いやすい

SublimeText3 Mac版

神レベルのコード編集ソフト（SublimeText3）

SAP NetWeaver Server Adapter for Eclipse

Eclipse を SAP NetWeaver アプリケーションサーバーと統合します。

EditPlus 中国語クラック版

サイズが小さく、構文の強調表示、コードプロンプト機能はサポートされていません

DVWA

Damn Vulnerable Web App (DVWA) は、非常に脆弱な PHP/MySQL Web アプリケーションです。その主な目的は、セキュリティ専門家が法的環境でスキルとツールをテストするのに役立ち、Web 開発者が Web アプリケーションを保護するプロセスをより深く理解できるようにし、教師/生徒が教室環境で Web アプリケーションを教え/学習できるようにすることです。安全。 DVWA の目標は、シンプルでわかりやすいインターフェイスを通じて、さまざまな難易度で最も一般的な Web 脆弱性のいくつかを実践することです。このソフトウェアは、