Java，解压缩文件名中包含德语字符的文件夹-6ren

Java，解压缩文件名中包含德语字符的文件夹

转载作者：行者123 更新时间：2023-11-30 05:42:34

31

4

我正在尝试解压缩其中包含德语字符的文件夹，例如 Aufhänge 。我知道在Java 7中，它默认使用utf-8，并且我认为“ä”是utf-8字符之一。这是我的代码片段

public static void main(String[] args) throws IOException {
    ZipInputStream zipInputStream = new ZipInputStream(new FileInputStream(ZIP_PATH), StandardCharsets.UTF_8);
    ZipEntry zipEntry;
    while ((zipEntry = zipInputStream.getNextEntry()) != null) {
        System.out.println(zipEntry.getName());
    }
}

这是我收到的错误:java.lang.IllegalArgumentException: MALFORMED

它适用于 Charset.forName("Cp437")，但不适用于 StandardCharsets.UTF_8

最佳答案

您没有提及您的操作系统，也没有提及您如何创建 zip 文件，但我还是设法在 Windows 10 上使用 7-Zip 重现了您的问题:

创建一个包含一些琐碎内容的简单文本文件(例如，除了三个字符“abc”之外什么都没有)。
将文件另存为 D:\Temp\Aufhänge.txt。请注意文件名中的变音符号。
在 Windows 文件资源管理器中找到该文件。
选择文件并右键单击。从上下文菜单中选择7-Zip > 添加到“Aufhänge.zip” 以创建Aufhänge.zip。

然后，在 NetBeans 中运行以下代码来解压缩刚刚创建的文件:

import java.io.FileInputStream;
import java.io.FileNotFoundException;
import java.io.IOException;
import java.nio.charset.Charset;
import java.util.zip.ZipEntry;
import java.util.zip.ZipInputStream;

public class GermanZip {

    static String ZIP_PATH = "D:\\Temp\\Aufhänge.zip";

    public static void main(String[] args) throws FileNotFoundException, IOException {

        ZipInputStream zipInputStream = new ZipInputStream(new FileInputStream(ZIP_PATH), Charset.forName("UTF-8"));
        ZipEntry zipEntry;
        while ((zipEntry = zipInputStream.getNextEntry()) != null) {
            System.out.println(zipEntry.getName());
        }
    }

}

正如您所指出的，执行以下语句时，代码会抛出 java.lang.IllegalArgumentException: MALFORMED:zipEntry = zipInputStream.getNextEntry()) != null。

出现此问题的原因是默认情况下 7-Zip 使用 Cp437 对 zip 文件中的文件名进行编码，如 this comment from 7-Zip 中所述。 :

Default encoding is OEM (DOS) encoding. It's for compatibility with old zip software.

这就是为什么使用 Charset.forName("Cp437") 而不是 Charset.forName("UTF-8") 时解压缩有效。

如果您想使用 Charset.forName("UTF-8") 解压缩，则必须强制 7-Zip 以 UTF 格式对 zip 中的文件名进行编码-8。为此，请在运行 7-Zip 时指定 cu 参数，如链接评论中所述:

在 Windows 文件资源管理器中选择文件并右键单击。
从上下文菜单中选择7-Zip > 添加到存档...”。
在添加到存档对话框中，在参数字段中指定cu:
以 UTF-8 格式存储压缩文件名后，您可以将 Charset.forName("Cp437") 替换为 Charset.forName("UTF-8") 在你的代码中，解压时不会抛出异常。

此答案特定于 Windows 10 和 7-Zip，但一般原则应适用于任何环境:如果为 ZipInputStream 指定 UTF-8 编码，请确保zip 文件实际上是使用 UTF-8 编码的。您可以通过在二进制编辑器中打开 zip 文件并搜索压缩文件的名称来轻松验证这一点。

<小时/>

根据下面OP的评论/问题进行更新:

不幸的是.ZIP File Format Specification目前不提供一种方法来存储用于压缩文件名的编码(除了一个异常(exception))，如“附录 D - 语言编码 (EFS)”中所述:

D.2 If general purpose bit 11 is unset, the file name and comment SHOULD conform to the original ZIP character encoding. If general purpose bit 11 is set, the filename and comment MUST support The Unicode Standard, Version 4.1.0 or greater using the character encoding form defined by the UTF-8 storage specification. The Unicode Standard is published by the The Unicode Consortium (www.unicode.org). UTF-8 encoded data stored within ZIP files is expected to not include a byte order mark (BOM).
因此，在您的代码中，对于每个压缩文件，首先检查通用位标志的位 11 是否已设置。如果是，那么您可以确定该压缩文件的名称是使用 UTF-8 编码的。否则，编码就是创建压缩文件时使用的编码。在 Windows 上默认为 Cp437，但如果您在 Windows 上运行并处理在 Linux 上创建的 zip 文件，我认为没有一种简单的方法来确定所使用的编码。
不幸的是ZipEntry不提供访问压缩文件的通用位标志字段的方法，因此您需要在字节级别处理 zip 文件才能做到这一点。
更复杂的是，本文中的“编码”涉及每个压缩文件名使用的编码，而不是 zip 文件本身的编码。一个压缩文件名可以用UTF-8编码，另一个压缩文件名可以使用Cp437添加，等等。

关于Java，解压缩文件名中包含德语字符的文件夹，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/55393956/

31

4

0

文章推荐： c++ - 从 system() VC++ 调用时出现 WUSA 灾难性故障 0x8000ffff

文章推荐： javascript - 不使用拼接将现有数组的元素复制到新数组？

文章推荐： java - 使用ajax请求发布大型JSON对象

c - 反 C(字符 + 字符)
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。要求提供代码的问题必须表现出对所解决问题的最低限度理解。包括尝试过的解决方案、为什么它们不起作用，以及预
c# - 字符 + 字符 = 整数？为什么？
为什么在 C# 中添加两个 char 结果是 int 类型？例如，当我这样做时: var pr = 'R' + 'G' + 'B' + 'Y' + 'P'; pr 变量变为 int 类型。我希望它是
c++ - 字符!=(有符号字符)，字符!=(无符号字符)
下面的代码可以编译，但 char 类型的行为与 int 类型的行为不同。特别是 cout ::ikIsX >() ::ikIsX >() ::ikIsX >() using names
正则表达式匹配 1+ 字符，但不是 500 字符
我正在寻找一个正则表达式，它可以匹配长度为 1 个或多个字符但不匹配 500 的内容。这将在 Rails 路由文件中使用，特别是用于处理异常。路线.rb match '/500', to: 'err
C - 字符 *' differs in levels of indirection from ' 字符 (*)[200]
对于 C 编程作业，我正在尝试编写几个头文件来检查所谓的“X 编程语言”的语法。我最近才开始，正在编写第一个头文件。这是我编写的代码: #ifndef _DeclarationsChecker_h_
php - 为什么这个扩展的 ascii 字符(â、é 等)被替换为字符？
为什么扩展的 ascii 字符(â、é 等)被替换为字符？我附上了一张图片...但我正在使用 PHP 从 MySQL 中提取数据，其中一些位置有扩展字符...我使用的是 Arial 字体。您可以
r - 如何在 R 中的(字符/数字)和(字符/数字)类型之间进行换行
我有一个与 R 中的断线相关的简单问题。我正在尝试粘贴，但在获取(字符/数字)之间的断线时遇到问题。请注意，这些值包含在向量中(V1=81,V2=55,V3=25)我已经尝试过这段代码: cat(p
c++ - 如何将 ANSI 字符 (char) 转换为 Unicode 字符 (wchar_t)，反之亦然？
如何将 ANSI 字符 (char) 转换为 Unicode 字符 (wchar_t)，反之亦然？是否有用于此目的的任何跨平台源代码？最佳答案是的，在中你有mbstowcs()和 wcsto
javascript - 如何通过 JavaScript 将 ANSI 字符 ID 转换为 Unicode 字符 ID？
函数 fromCharCode 不适用于国际 ANSI 字符。例如，对于 ID 为 192 到 223 的俄语 ANSI (cp-1251) 字符，它返回特殊字符。如何解决这个问题？我认为，需要将A
mysql - 我想隐藏 id，如果不喜欢，但不起作用 SELECT * FROM 字符，character_actor WHERE 字符.id 不喜欢character_actor.character_id;
如果不喜欢，我想隐藏 id，但不起作用 SELECT * FROM character, character_actor WHERE character.id NOT LIKE character_a
c - "expected ' 字符 * ' but argument is of type ' 字符 ' "- 回文 + 反向
现在这个程序成功地反转了键盘输入的单词。但是我想在我反转它之前“保存”指针中的单词，所以我可以比较两者，反转的和“原始的”，并检查它们是否是回文。我还没有太多经验，可能会出现比我知道的更多的错误，但我
c - Memcpy func 获取指针变量？字符*p；字符* q； memcpy(p,q,10);会起作用吗？
Memcpy 和 memcmp 函数可以接受指针变量吗？ char *p; char* q; memcpy(p,q,10); //will this work? memcmp(p,q,10); //w
java - 在 Java 字符(16 位)中存储 UTF-8 字符(8 位)时如何避免内存浪费。二合一？
恐怕我对一个相当过饱和的主题的细节有疑问，我搜索了很多，但找不到一个明确的答案来解决这个特定的明显-imho-重要的问题: 使用UTF-8将byte[]转换为String时，每个字节(8bit)都变成
python不打印出“字符
我有一个奇怪的问题。我需要从 stat 命令打印输出字符串。我已经编写了获取一些信息的代码。 import glob import os for file in glob.glob('system1
Java使用正则表达式转义连字符 "-"字符
我正在使用 Java 并具有其值如下所示的字符串， String data = "vale-cx"; data = data.replaceAll("\\-", "\\-\\"); 我正在替换其中的“
Java如何转义url参数中的 "&"字符？
String urlParameters = "login=test&password=te&ff"; 我有一个String urlParams，& - 是密码的一部分，如何使其转义，从而不被识别为分
Java仅从字符串中提取第一个字母/字符
大家好，我只想从此字符串中提取第一个字母: String str = "使徒行傳 16:31 ERV-ZH"; 我只想获取这些字符: 使徒行傳并且不包括 ERV-ZH 仅数
字符 * 错误访问错误
这个问题已经有答案了: Crash or "segmentation fault" when data is copied/scanned/read to an uninitialized point
字符**到字符*
所以，我有一个字符**；它本质上是一个句子，带有指向该句子中每个单词的指针；即 'h''i''\0''w''o''r''l''d''\0''y''a''y''!''\0' 在这种情况下，我希望使用可
Python打印“字符
这个问题在这里已经有了答案: Using quotation marks inside quotation marks (12 个答案) 关闭 7 年前。如何打印 " 字符？我知道打印 % 符号

首页

博学

6Ren·AI

商城

Java，解压缩文件名中包含德语字符的文件夹