hadoop - Hive:在执行选择和同时删除分区配置单元查询时出错

标签 hadoop amazon-s3 hive amazon-emr hive-partitions

同时运行两个查询时出现错误。

这是场景。

我正在使用 AWS EMR,下面是我的 Hive 表架构。

CREATE TABLE India (OFFICE_NAME STRING,
OFFICE_STATUS     STRING,
PINCODE           INT,
TELEPHONE   BIGINT,
TALUK       STRING,
DISTRICT    STRING,
POSTAL_DIVISION   STRING,
POSTAL_REGION     STRING,
POSTAL_CIRCLE     STRING
)
PARTITIONED BY (STATE   STRING)
ROW FORMAT SERDE       'org.apache.hadoop.hive.ql.io.parquet.serde.ParquetHiveSerDe' 
STORED AS INPUTFORMAT  'org.apache.hadoop.hive.ql.io.parquet.MapredParquetInputFormat' 
OUTPUTFORMAT   'org.apache.hadoop.hive.ql.io.parquet.MapredParquetOutputFormat'
LOCATION  's3a://mybucket/'
TBLPROPERTIES (  'parquet.compression'='SNAPPY',   'transient_lastDdlTime'='1537781726');

第一个查询:

SELECT count( distinct STATE ) FROM India;

第二个查询:

ALTER TABLE India DROP PARTITION (STATE='Delhi');

在运行第一个查询时,我同时执行了第二个查询,所以我在第一个查询中得到了这个错误

Error: java.io.IOException: java.lang.reflect.InvocationTargetException
at org.apache.hadoop.hive.io.HiveIOExceptionHandlerChain.handleRecordReaderCreationException(HiveIOExceptionHandlerChain.java:97)
  at org.apache.hadoop.hive.io.HiveIOExceptionHandlerUtil.handleRecordReaderCreationException(HiveIOExceptionHandlerUtil.java:57)
  at org.apache.hadoop.hive.shims.HadoopShimsSecure$CombineFileRecordReader.initNextRecordReader(HadoopShimsSecure.java:271)
  at org.apache.hadoop.hive.shims.HadoopShimsSecure$CombineFileRecordReader.next(HadoopShimsSecure.java:144)
  at org.apache.hadoop.mapred.MapTask$TrackedRecordReader.moveToNext(MapTask.java:200)
  at org.apache.hadoop.mapred.MapTask$TrackedRecordReader.next(MapTask.java:186)
  at org.apache.hadoop.mapred.MapRunner.run(MapRunner.java:52)
  at org.apache.hadoop.mapred.MapTask.runOldMapper(MapTask.java:455)
  at org.apache.hadoop.mapred.MapTask.run(MapTask.java:344)
  at org.apache.hadoop.mapred.YarnChild$2.run(YarnChild.java:164)
  at java.security.AccessController.doPrivileged(Native Method)
  at javax.security.auth.Subject.doAs(Subject.java:422)
  at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1698)
  at org.apache.hadoop.mapred.YarnChild.main(YarnChild.java:158)
Caused by: java.lang.reflect.InvocationTargetException
  at sun.reflect.GeneratedConstructorAccessor42.newInstance(Unknown Source)
  at sun.reflect.DelegatingConstructorAccessorImpl.newInstance(DelegatingConstructorAccessorImpl.java:45)
  at java.lang.reflect.Constructor.newInstance(Constructor.java:423)
  at org.apache.hadoop.hive.shims.HadoopShimsSecure$CombineFileRecordReader.initNextRecordReader(HadoopShimsSecure.java:257)
  ... 11 more
Caused by: com.amazon.ws.emr.hadoop.fs.consistency.exception.FileDeletedInMetadataNotFoundException: File 'mybucket/India/state=Delhi/000000_0' is marked as deleted in the metadata
  at com.amazon.ws.emr.hadoop.fs.consistency.ConsistencyCheckerS3FileSystem.getFileStatus(ConsistencyCheckerS3FileSystem.java:440)
  at com.amazon.ws.emr.hadoop.fs.consistency.ConsistencyCheckerS3FileSystem.getFileStatus(ConsistencyCheckerS3FileSystem.java:416)
  at sun.reflect.GeneratedMethodAccessor17.invoke(Unknown Source)
  at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
  at java.lang.reflect.Method.invoke(Method.java:498)
  at org.apache.hadoop.io.retry.RetryInvocationHandler.invokeMethod(RetryInvocationHandler.java:191)
  at org.apache.hadoop.io.retry.RetryInvocationHandler.invoke(RetryInvocationHandler.java:102)
  at com.sun.proxy.$Proxy34.getFileStatus(Unknown Source)
  at com.amazon.ws.emr.hadoop.fs.s3n2.S3NativeFileSystem2.getFileStatus(S3NativeFileSystem2.java:227)
  at com.amazon.ws.emr.hadoop.fs.EmrFileSystem.getFileStatus(EmrFileSystem.java:509)
  at org.apache.parquet.hadoop.ParquetFileReader.readFooter(ParquetFileReader.java:386)
  at org.apache.parquet.hadoop.ParquetFileReader.readFooter(ParquetFileReader.java:372)
  at org.apache.hadoop.hive.ql.io.parquet.ParquetRecordReaderBase.getSplit(ParquetRecordReaderBase.java:79)
  at org.apache.hadoop.hive.ql.io.parquet.read.ParquetRecordReaderWrapper.<init>(ParquetRecordReaderWrapper.java:75)
  at org.apache.hadoop.hive.ql.io.parquet.read.ParquetRecordReaderWrapper.<init>(ParquetRecordReaderWrapper.java:60)
  at org.apache.hadoop.hive.ql.io.parquet.MapredParquetInputFormat.getRecordReader(MapredParquetInputFormat.java:75)
  at org.apache.hadoop.hive.ql.io.CombineHiveRecordReader.<init>(CombineHiveRecordReader.java:99)
  ... 15 more

在谷歌搜索后我找到了这个链接

https://docs.aws.amazon.com/emr/latest/ManagementGuide/emrfs-files-tracked.html

是否有在运行时同步元数据或在第一个状态完成之前不会执行第二个查询。

请帮助我解决这个问题或任何建议,设置任何可以解决问题的参数。

最佳答案

一开始就计算了分区路径和拆分。您的映射器已开始读取分区位置中的文件,同时您删除了分区,这导致了删除文件,因为您的表是托管的。这会导致运行时 FileDeletedInMetadataNotFoundException 异常。

如果你仍然想在读取分区时删除它,试试这个:

如果您将表设置为 EXTERNAL,则 DROP PARTITION 不应删除文件,它们将保留并且不应导致异常,您可以稍后从文件系统中删除分区位置。或者使用 S3 生命周期策略删除旧文件,如所述 here .

不幸的是,已经启动的作业无法检测到包含文件的 Hive 分区已被删除并优雅地跳过读取它们,因为 Hive 元数据已经被读取,查询计划构建和拆分已经可以计算。

因此,解决方案是删除 Hive 分区并推迟删除文件。

顺便说一句,当您在查询表时添加分区时,它工作正常。

关于hadoop - Hive:在执行选择和同时删除分区配置单元查询时出错,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/53665134/

相关文章:

hadoop - mapper run() 方法如何处理最后一条记录?

hadoop - 在hadoop mapreduce中读取参数

amazon-web-services - 从 aws cp 中排除目录

php - 使用适用于 Amazon S3 的 PHP SDK 时出错

java - 有没有直接的方法将一个 s3 目录复制到 java 或 scala 中的另一个目录?

java - 从Hive中以 block 的形式获取同一Hive查询的数据

php - 从 php 运行一个用 java 编写的 hadoop 应用程序

hadoop - 如何在 VM 上永久存储 hbase 表

oracle - 在装载表时从Oracle表中卸载Sqoop

java - 在 hive-site.xml 中查找 _HOST 的值