HBase 增量备份-MySQL 튜토리얼-php.cn

집

데이터 베이스

MySQL 튜토리얼

HBase 增量备份

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 07, 2016 pm 05:27 PM

hbaseo데이터 베이스

文中可能涉及到的API： Hadoop/HDFS:http://hadoop.apache.org/common/docs/current/api/ HBase: http://hbase.apache.org/apido

文中可能涉及到的API：

Hadoop/HDFS:

HBase: ?overview-summary.html

Begin！

一、概述

使用了HBase提供的Export与Import工具。

Export：

Import：

看到这两个类所在目录我们了解到，Export与Import的实质是MapReduce任务。

关于这两个工具API中写的很清楚：

Export an HBase table. Writes content to sequence files up in HDFS. Use Import to read it back in again.

将HBase的表导出为HDFS的sequence files。

Export如其名，只是导出工具，如何完成备份功能呢？

二、功能实验

测试过程涉及很多数据，这里仅提供重要结论：

1、Export是以表为单位导出数据的，若想完成整库的备份需要执行n遍。

2、Export在shell中的调用方式类似如下格式：

./hbase org.apache.hadoop.hbase.mapreduce.Export 表名备份路径（版本号）（起始时间戳）（结束时间戳）

Export [-D ]* [ [ []]]

括号内为可选项，例如

./hbase org.apache.hadoop.hbase.mapreduce.Export 'contentTbl' /home/codeevoship/contentBackup20120920 1 123456789

备份contentTbl这张表到/home/codeevoship/contentBackup20120920目录下（最后一级目录必须由Export自己创建），，版本号为1，备份记录从123456789这个时间戳开始到当前时间内所有的执行过put操作的记录。

注意：为什么是所有put操作记录？因为在备份时是扫描所有表中所有时间戳大于等于123456789这个值的记录并导出。如果是delete操作，则表中这条记录已经删除，扫描时也无法获取这条记录信息。

3、当不指定时间戳时，备份的就是当前完整表中的数据。

三、实施细节

1、如何在增量备份时体现出对数据的删除操作？

由于Export按时间戳备份只能反映出Put过的表项，若我在一个备份（增量包）时间区间内删除了某条已有记录，当数据库回档时，这条被删除的记录又会出现在我的表中。

因此，我将所有的删除操作替换为Put操作：

a、给每行数据添加了一个无效标志位，在删除记录时使用Put给该标志位写为1。

b、在单条查询时，根据rowKey取出记录后会根据这个标志位判断这条记录是否已被“删除”，以此决定是否返回这条记录。在多条查询时（scan），使用列值过滤器，过滤出所有这个标志位不为1的记录。（可参见我之前的《HBase 条件查询》）

2、在备份过程中新增的数据是否会影响备份内容的准确性？

可以指定小于等于当前时刻的结束时间戳，以便将需要备份的数据范围明确。

3、如何备份到其他机器？

a、Export支持提供地址的备份。最简单的方法，直接把远端存储挂载到本地，然后使用本地路径。

b、使用API调用时，Path如果使用file:///home/codeevoship/backup，代表使用本地文件系统。若直接写为/home/codeevoship 代表使用HDFS层的路径。在使用Shell调用时则相反。

4、如何使用API调用？

通过MapReduce的Job：

先通过Export类提供的方法创建Job实例，再调用Job的()或(boolean verbose)；异步与同步。

四、其他解决方案

1、HDFS层的HDFS Replication或DistCp

2、Cluster Replication

linux

성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

관련 기사

MySQL 문자열 유형 : 스토리지, 성능 및 모범 사례May 10, 2025 am 12:02 AM

mysqlStringTypESmpactStorageAndperformanceAsfollows : 1) charisfixed, adlaysamestoragespace.

MySQL 문자열 유형 이해 : Varchar, Text, Char 등May 10, 2025 am 12:02 AM

mysqlstringtypesincludevarchar, text, char, enum, and set.1) varcharisversatileforvariable-lengthstringsupciedlimit.2) textisidealforlargetextStorage whithoudfinedlength.3) charisfixed, witableforconsistentDatalikecodes.4)

MySQL의 문자열 데이터 유형은 무엇입니까?May 10, 2025 am 12:01 AM

mysqloffersvariousstringdatatatypes : 1) charfixed-lengthstrings, 2) varcharforvariable-lengthtext, 3) binaryandvarbinaryforbinarydata, 4) blobandtextforlargedata 및 5) enumandsetforcontrolledInput.achtolledinput.CheachorciCificusessandperististicatististicatististics

새로운 MySQL 사용자에게 권한을 부여하는 방법May 09, 2025 am 12:16 AM

TograntpermissionSt

MySQL에서 사용자를 추가하는 방법 : 단계별 가이드May 09, 2025 am 12:14 AM

ToadDuserSinMySqleFeffectially, 다음에 따르면, 다음 사항을 따르십시오

MySQL : 복잡한 권한이있는 새 사용자 추가May 09, 2025 am 12:09 AM

toaddanewuser와 함께 complexpermissionsinmysql, followthesesteps : 1) createShereuser'NewUser '@'localhost'Identifiedby'pa ssword ';. 2) grantreadaccesstoalltablesin'mydatabase'withgrantselectonmydatabase.to'newuser'@'localhost';. 3) GrantWriteAccessto '

MySQL : 문자열 데이터 유형 및 콜라주May 09, 2025 am 12:08 AM

MySQL의 문자열 데이터 유형에는 char, varchar, binary, varbinary, blob 및 텍스트가 포함됩니다. 콜라이트는 문자열의 비교와 분류를 결정합니다. 1. 차량은 고정 길이 스트링에 적합하고 Varchar는 가변 길이 스트링에 적합합니다. 2. 이진 및 바이너리는 이진 데이터에 사용되며 Blob 및 텍스트는 큰 객체 데이터에 사용됩니다. 3. UTF8MB4_UNICODE_CI와 같은 정렬 규칙은 상류 및 소문자를 무시하며 사용자 이름에 적합합니다. UTF8MB4_BIN은 사례에 민감하며 정확한 비교가 필요한 필드에 적합합니다.

MySQL : Varchars에는 몇 개의 길이를 사용해야합니까?May 09, 2025 am 12:06 AM

가장 좋은 mysqlvarchar 열 길이 선택은 데이터 분석을 기반으로하고, 향후 성장을 고려하고, 성능 영향을 평가하고, 문자 세트 요구 사항을 기반으로해야합니다. 1) 일반적인 길이를 결정하기 위해 데이터를 분석합니다. 2) 미래 확장 공간을 예약하십시오. 3) 성능에 대한 큰 길이의 영향에주의를 기울이십시오. 4) 문자 세트가 스토리지에 미치는 영향을 고려하십시오. 이러한 단계를 통해 데이터베이스의 효율성과 확장 성을 최적화 할 수 있습니다.

See all articles