注意:possible duplicate 涉及旧版本的 Python,此问题已经生成了唯一的答案。
我一直在编写一个脚本,用于将 Project Gutenberg Texts 文本处理为我正在开发的应用程序的内部文件格式。在脚本中,我使用 re
模块处理章节标题。这非常有效,除了一种情况:第一行。如果我的正则表达式包含 ^ 插入符以要求正则表达式匹配位于行的开头,那么我的正则表达式将始终在第一行的第一个章节标记上失败,因为 BOM 被用作第一个字符。 (例如正则表达式:^Chapter
)。
我发现,如果我不包含插入符,它不会在第一行失败,然后在我处理完 <feff>
后,它会包含在标题中。一个例子:
<h1><feff>Chapter I</h1>
根据 this SO question(我从中了解到 BOM)的建议是修复您的脚本,使其不消耗/损坏 BOM。 Other SO questions 讨论使用编解码器解码文件但讨论我从未遇到的错误并且不讨论使用模板解码器打开文件的语法。
要清楚:
我通常使用以下格式的管道:
cat -s <filename> | <other scripts> | python <scriptname> [options] > <outfile>
我用以下语法打开文件:
import sys
fin = sys.stdin
if '-i' in sys.argv: # For command line option "-i <infile>"
fin = open(sys.argv[sys.argv.index('-i') + 1], 'rt')
for line in fin:
...Processing here...
我的问题是处理这个问题的正确方法是什么?在处理文本之前是否删除 BOM?如果是这样,如何?还是在处理文件之前对文件使用解码器(我正在从标准输入读取,所以如何完成此操作?)
文件以 DOS 结尾的 UTF-8 编码 (\r\n
) 存储。在使用 set ff=unix
处理之前,我在 vim 中将它们转换为 UNIX 文件格式(在运行脚本之前我必须执行几个手动预处理任务)。
最佳答案
作为对现有答案的补充,可以使用编解码器模块从标准输入中过滤 UTF8 BOM。只需使用 sys.stdin.buffer
访问底层字节流并使用 StreamReader
import sys
import codecs
# trick to process sys.stdin with a custom encoding
fin = codecs.getreader('utf_8_sig')(sys.stdin.buffer, errors='replace')
if '-i' in sys.argv: # For command line option "-i <infile>"
fin = open(sys.argv[sys.argv.index('-i') + 1], 'rt',
encoding='utf_8_sig', errors='replace')
for line in fin:
...Processing here...
关于python - 在 Python 3 中使用 sys.stdin 进行文本处理时,我应该如何处理 BOM?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/51480423/