python - 在 Python 3 中使用 sys.stdin 进行文本处理时,我应该如何处理 BOM?

标签 python utf-8 text-processing byte-order-mark

注意:possible duplicate 涉及旧版本的 Python,此问题已经生成了唯一的答案。

我一直在编写一个脚本,用于将 Project Gutenberg Texts 文本处理为我正在开发的应用程序的内部文件格式。在脚本中,我使用 re 模块处理章节标题。这非常有效,除了一种情况:第一行​​。如果我的正则表达式包含 ^ 插入符以要求正则表达式匹配位于行的开头,那么我的正则表达式将始终在第一行的第一个章节标记上失败,因为 BOM 被用作第一个字符。 (例如正则表达式:^Chapter)。

我发现,如果我不包含插入符,它不会在第一行失败,然后在我处理完 <feff> 后,它会包含在标题中。一个例子:

<h1><feff>Chapter I</h1>

根据 this SO question(我从中了解到 BOM)的建议是修复您的脚本,使其不消耗/损坏 BOM。 Other SO questions 讨论使用编解码器解码文件但讨论我从未遇到的错误并且不讨论使用模板解码器打开文件的语法。

要清楚:

我通常使用以下格式的管道:

cat -s <filename> | <other scripts> | python <scriptname> [options] > <outfile>

我用以下语法打开文件:

import sys

fin = sys.stdin

if '-i' in sys.argv: # For command line option "-i <infile>"
    fin = open(sys.argv[sys.argv.index('-i') + 1], 'rt')

for line in fin:
    ...Processing here...

我的问题是处理这个问题的正确方法是什么?在处理文本之前是否删除 BOM?如果是这样,如何?还是在处理文件之前对文件使用解码器(我正在从标准输入读取,所以如何完成此操作?)

文件以 DOS 结尾的 UTF-8 编码 (\r\n) 存储。在使用 set ff=unix 处理之前,我在 vim 中将它们转换为 UNIX 文件格式(在运行脚本之前我必须执行几个手动预处理任务)。

最佳答案

作为对现有答案的补充,可以使用编解码器模块从标准输入中过滤 UTF8 BOM。只需使用 sys.stdin.buffer 访问底层字节流并使用 StreamReader

对其进行解码
import sys
import codecs

# trick to process sys.stdin with a custom encoding
fin = codecs.getreader('utf_8_sig')(sys.stdin.buffer, errors='replace')


if '-i' in sys.argv: # For command line option "-i <infile>"
    fin = open(sys.argv[sys.argv.index('-i') + 1], 'rt',
               encoding='utf_8_sig', errors='replace')

for line in fin:
    ...Processing here...

关于python - 在 Python 3 中使用 sys.stdin 进行文本处理时,我应该如何处理 BOM?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/51480423/

相关文章:

python - 在 Python 中从文本/PDF 生成 XML 的最佳 Python 库是什么?

c# - 如何使用 ctypes 访问 C# dll 中的方法?

python - 为什么这种复制列表的方法比其他方法快得多?

java - Core Java 如何将20字节字节数组转换为字符串

python - 在 Python 的 ASCII 文件中查找/替换带注释的子字符串

python - 比较两个文件

python - 如何检查字符串是否匹配特定模式?

python - Django post_save 在不覆盖模型 save() 的情况下防止递归

c++ - `std::u8string` 必须是 UTF-8 吗?

php - mysql 因某些字符而阻塞,而 mssql 不会