【问题标题】:Reading GZIP File Causing Unexpected end of ZLIB input stream in java在java中读取GZIP文件导致ZLIB输入流意外结束
【发布时间】:2019-04-10 08:57:37
【问题描述】:

我正在将 GZIP 字节数组转换为 Java 中的字符串形式。这是一个相当大的文件,我的想法是将其转换为 JSON。

但是我得到的异常很奇怪,没有多大意义。

代码片段:

public static String convert(byte[] bytes) throws IOException {
        final byte[] BUFFER = new byte[16234];

        GZIPInputStream gzipInputStream = new GZIPInputStream(new ByteArrayInputStream(bytes));

        ByteArrayOutputStream byteArrayOutputStream = new ByteArrayOutputStream();

        int len;
        while ((len = gzipInputStream.read(BUFFER)) >= 0) {
            byteArrayOutputStream.write(BUFFER, 0, len);
          if(byteArrayOutputStream.size ()>60812918){
                System.out.println ( "stopping here" );
            }
        }

        byteArrayOutputStream.flush();
        byteArrayOutputStream.close();

        gzipInputStream.close();

        final byte[] dataPart = byteArrayOutputStream.toByteArray();

        String data = new String(dataPart, StandardCharsets.UTF_8);

        return data;
    }

异常跟踪:

java.io.EOFException: Unexpected end of ZLIB input stream
    at java.util.zip.InflaterInputStream.fill(InflaterInputStream.java:240)
    at java.util.zip.InflaterInputStream.read(InflaterInputStream.java:158)
    at java.util.zip.GZIPInputStream.read(GZIPInputStream.java:117)
    at java.io.FilterInputStream.read(FilterInputStream.java:107)
    at com.here.rcs.discoverkernels.testS3FileReader.convert(testS3FileReader.java:84)
    at com.here.rcs.discoverkernels.testS3FileReader.viewJson(testS3FileReader.java:45)
    at com.here.rcs.discoverkernels.testS3FileReader.main(testS3FileReader.java:21)

从 Coding 的角度来看,我不认为这段代码有什么问题。

任何建议如何继续前进。

添加到字节转换部分;

public static byte[] compress(final String data) throws IOException {

    final byte[] dataPart = data.getBytes( StandardCharsets.UTF_8 );

    ByteArrayOutputStream byteArrayOutputStream = new ByteArrayOutputStream();

    GZIPOutputStream gzipOutputStream = new GZIPOutputStream(byteArrayOutputStream);
    gzipOutputStream.write(dataPart);

    gzipOutputStream.flush();
    gzipOutputStream.close();

    byte[] bytes = byteArrayOutputStream.toByteArray();

    return bytes;
}

【问题讨论】:

  • 您的标题指的是一个 zip 文件;您问题的主体是指 gzip。这些是不同的格式 - 你能澄清一下你实际使用的是哪种格式吗?
  • 要么您到达stopping here,要么输入不完整。
  • 对不起,混淆了。它是 gzip
  • .gz 文件是否正确?可以用其他工具打开吗?
  • 是的,我可以。这个文件是从不同的 java 进程上传到 S3 的。S3 文件的 ETag 值(主要是 MD5,在某些情况下除外)与我在运行的应用程序中下载的相同。 MD5 (27654994_MEA_BW_1901-1-32.json.gz) = d611c8a45a6fbc23dcc870dcf9c770e1

标签: java json gzip


【解决方案1】:

我用一个小的 .gz 文件尝试了你的程序,它按预期工作。我猜是的

  1. 处理大文件时存在问题,或者更有可能是
  2. 您没有将文件中的数据正确加载到bytes 数组。你是怎么过的?我关注了这篇文章:https://netjs.blogspot.com/2015/11/how-to-convert-file-to-byte-array-java.html

【讨论】:

  • 它适用于小文件(这在生产中运行了一段时间)。数据正确加载到字节中。正如我所提到的,这发生在大文件的末尾。我不知道什么构成大文件。我在调试过程中观察到一种令人着迷的行为。我将很快更新我的发现
  • 我为调试代码的屏幕截图添加了图像链接。要弄清楚堆栈调用如何从 Manifest$FastInputStream 更改为 InflaterInputStream
  • 我发现了这个异常并暂时继续前进,但会保持问题开放
  • @MrWayne 你还没有回答他的问题。字节数组是如何填充的?您需要在此处在您的问题中发布该代码。您的所有四个链接都无关紧要。如果没有这些信息,您的问题是不完整的或无法回答的。
  • 压缩部分更新有问题。它很标准。正如我之前所说,这是在生产中运行
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2022-08-22
  • 2011-11-03
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多