python - 如何在 Python 中处理不可解码的文件名？-6ren

python - 如何在 Python 中处理不可解码的文件名？

转载作者：太空狗更新时间：2023-10-29 20:24:46

26

4

我真的很想让我的 Python 应用程序在内部专门处理 Unicode 字符串。这对我来说最近进展顺利，但我遇到了处理路径的问题。文件系统的 POSIX API 不是 Unicode，因此文件有可能(实际上有点常见)具有“不可解码”的名称:文件名未按照文件系统规定的编码进行编码。

在 Python 中，这表现为从 os.listdir() 返回的 unicode 和 str 对象的混合。

>>> os.listdir(u'/path/to/foo')
[u'bar', 'b\xe1z']

在该示例中，字符 '\xe1' 以 Latin-1 或类似格式编码，即使(假设的)文件系统报告 sys.getfilesystemencoding() == 'UTF- 8'(在 UTF-8 中，该字符将是两个字节 '\xc3\xa1')。出于这个原因，如果您尝试将 os.path.join() 与 Unicode 路径一起使用，您将到处都是 UnicodeError，因为无法解码文件名。

Python Unicode HOWTO提供有关 unicode 路径名的建议:

Note that in most occasions, the Unicode APIs should be used. The bytes APIs should only be used on systems where undecodable file names can be present, i.e. Unix systems.

因为我主要关心 Unix 系统，这是否意味着我应该重构我的程序以仅处理路径的字节串？ (如果是这样，我怎样才能保持 Windows 兼容性？)或者有其他更好的方法来处理不可解码的文件名吗？它们“在野外”是否足够稀有，以至于我应该要求用户重命名他们该死的文件？

(如果最好只在内部处理字节串，我有一个后续问题:如何在 SQLite 中为一列存储字节串，同时将其余数据保持为友好的 Unicode 字符串？)

最佳答案

如果您愿意切换到 Python 3.1 或更高版本，Python 确实有解决问题的方法:

PEP 383 - Non-decodable Bytes in System Character Interfaces .

关于python - 如何在 Python 中处理不可解码的文件名？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/3409381/

26

4

0

文章推荐： c++ - 使用命名空间标准与其他替代方案

SSIS - 如何遍历文件夹中的文件并获取路径+文件名，最后执行存储过程，参数为路径+文件名
任何帮助深表感谢。我正在尝试创建一个 SSIS 包来遍历文件夹中的文件并获取路径+文件名，最后执行存储的过程，参数为路径+文件名。我不确定如何获取路径+文件名并将其作为参数插入到存储过程中。我附上了截
Powershell脚本来定位特定文件/文件名？
我想编写一个小脚本来搜索确切的文件名，而不是文件名中的字符串。例如，如果我使用资源管理器搜索“主机”，默认情况下我会得到多个结果。对于脚本，我只需要我指定的名称。我假设这可能吗？我才真正开始编写脚
Python字符串编码-文件名
str(文件.key) = '1011/101011/文件名' newFileName = str(file.key) 但是，当我运行代码时，我得到: UnicodeEncodeError: 'asc
文件名正则表达式提取方法
下面这段子程基本上可以算是比较不错的通用匹配了。(PS:我突然发现CODE_LITE把我的UBB转义了！！！晕,我只好自己转义了。。。) Dim objRegExp,Matc
PHP Unicode 文件名
PHP 无法处理带有 Unicode 字符的文件:当我在浏览器上访问 testSite/главная.php 时，它会抛出此错误。 Warning: Unknown: failed to open
VBA Vlookup 文件名
我正在尝试包含 Dim在 Vlookup 中。 Dim filename As String filename = Format(DateAdd("d", -6, Now()), "mm-dd-yy"
makefile 链接目录/文件名
在我的日常构建项目中，我们将其库存储到其版本名称目录中。 . 对于最新的，我们正在创建符号链接(symbolic link)作为“最新”。前任。- ls -ltr drw-r--r-- 1 4096
yeoman 。文件名、目录名或卷标语法不正确
重新安装了 Windows 10(版本 10.0.14393)。重新安装了以下内容: java java version "1.8.0_121" Java(TM) SE Runtime Environ
没有日期的 Jekyll 文件名
我想使用 Jekyll 和 GitHub Pages 构建文档站点。问题是 Jekyll 只接受 _posts 下的文件名具有精确的图案，如 YYYY-MM-DD-your-title-is-here
java - 按升序读取多个文件文件名
我不知道我发生了什么事。我想访问一个包含多个文件的目录，假设: folder\\1.txt 2.txt 3.txt.... 现在我想根据它们的出现情况来阅读它们，我的意思是首先是最低的，只是我想按升
unix - 你如何获得 a/into 文件名？
如何将/放入文件名(即/不分隔路径的组成部分)？最佳答案你不知道。 UNIX 文件名中不允许使用斜线。关于unix - 你如何获得 a/into 文件名？，我们在Stack Overflow上找
python - 递归复制文件夹并更改复制文件的文件夹/文件名
我需要复制一个大文件夹，并重命名其中的所有文件和文件夹(如果它们包含特定字符串)。基本上我想复制所有内容并将 10 的任何实例更改为 11。例如，如果我有一个结构如下的文件夹: mainfolder
python - 文件名、目录名或卷标语法不正确
我有一个简单的 python (2.7) 脚本，应该执行一些 svn 命令: def getStatusOutput(cmd): print cmd p = subprocess.Po
python - Genfromtxt 文件名
我正在尝试读取以字符串形式存储在数据文件中的文件名。那里没问题。如果我将它传递给 genfromtxt，我会收到错误“IOError:Z:\Python\Rb input.txt not found”
具有多个句点的 C 文件名
简单的问题。当我尝试打开名为 text.txt 的文件时，它可以正常工作。但是，如果我将文件重命名为 text.cir.txt，则会出现错误。我可以做什么来修复它？ FILE *fd; char
c# - 获取用我的应用程序打开的文件的路径+文件名
我是 c# 的业余爱好者，我一直无法找到这个问题的答案。也许我不知道要使用的正确术语。当一个视频文件被拖到我的 exe 应用程序上时，我希望应用程序知道它是用一个文件启动的，并且能够知道该文件的路径
c# - 如何使用子字符串删除字符串结尾(文件名)？
我知道我必须使用 Substring 来删除，但我不知道该怎么做。我需要像这样删除字符串的结尾来自 "C:\\Users\\myname\\Pictures\\shoeImage.jpg" 到 "C
java - 文件名、目录名或卷标语法不正确
运行 eclipse 时我收到此错误。但是当我运行我的项目时，它是在内部浏览器中执行的。但它不会在默认的系统浏览器中执行。对此任何一个答案。先谢谢您的回答最佳答案您可以从 eclipse 更改浏览
android - 提示用户输入路径/文件名
我想要求用户选择一个要从外部存储打开的文件并接收它的路径。最好我想避免过多的编码并使用一些标准方法(众所周知，系统提供的 Intent 或类似方法)。所说的文件是SpatiaLite db文件(*.s
Postgresql 全文搜索非常短的文档(文件名)
我有一个文件名数据库，我正在尝试使用 PG 的全文搜索工具在其中进行搜索。我在文件名表上运行搜索查询，问题是排名函数没有按照我希望的那样对结果进行排名。为了便于讨论，我们假设架构如下所示: creat

首页

博学

6Ren·AI

商城

python - 如何在 Python 中处理不可解码的文件名？