python - 解码 RFC 2231 header

标签 python http mime multipartform-data

正在尝试解决 this issue ,我正在努力研究 Python 标准库中旨在支持 RFC 2231 的各种函数。 .该 RFC 的主要目标似乎有三个方面:允许在 header 参数中使用非 ASCII 编码、注明给定值的语言以及允许 header 参数跨越多行。 email.util library提供了几个函数来处理这个的各个方面。据我所知,它们的工作方式如下:

decode_rfc2231仅将此类参数的值拆分为其部分,如下所示:

>>> email.utils.decode_rfc2231("utf-8''T%C3%A4st.txt")
['utf-8', '', 'T%C3%A4st.txt']

decode_params负责检测 RFC2231 编码的参数。它收集属于一起的部分,并将 url 编码的字符串解码为字节序列。然而,这个字节序列随后被编码为 latin1。并且所有值都用引号引起来。此外,对第一个参数有一些特殊处理,它仍然必须是两个元素的元组,但是这两个元素未经修改就传递给了结果。

>>> email.utils.decode_params([
...   (1,2),
...   ("foo","bar"),
...   ("name*","utf-8''T%C3%A4st.txt"),
...   ("baz*0","two"),("baz*1","-part")])
[(1, 2), ('foo', '"bar"'), ('baz', '"two-part"'), ('name', ('utf-8', '', '"Täst.txt"'))]

collapse_rfc2231_value可用于将编码、语言和字节序列的三元组转换为适当的 unicode 字符串。但是,让我感到困惑的是,如果输入是这样的三元组,那么引号将被转移到输出中。另一方面,如果输入是单引号字符串,则这些引号将被删除。

>>> [(k, email.utils.collapse_rfc2231_value(v)) for k, v in
...  email.utils.decode_params([
...   (1,2),
...   ("foo","bar"),
...   ("name*","utf-8''T%C3%A4st.txt"),
...   ("baz*0","two"),("baz*1","-part")])[1:]]
[('foo', 'bar'), ('baz', 'two-part'), ('name', '"Täst.txt"')]

所以看来,为了使用所有这些机制,我必须再添加一个步骤来取消引用我遇到的任何元组的第三个元素。这是真的,还是我在这里遗漏了一些要点?我不得不在源代码的帮助下找出上面的很多内容,因为文档在细节上有点含糊。我无法想象这种选择性取消引用背后的意义是什么。有什么意义吗?

关于如何使用这些功能的最佳引用是什么?

目前我发现的最好的是 email.message.Message implementation .在那里,过程似乎大致与上面概述的过程相同,但每个字段都通过 _unquotevalue 取消引用。在 decode_params 之后,只有 get_filenameget_boundary折叠它们的值,所有其他的都返回一个元组。我希望有更多有用的东西。

最佳答案

目前email.utils 中的函数很少使用,除了在email.message 中。大多数用户似乎更喜欢直接使用 email.message.Message。甚至还有一个有点旧的issue report关于向 Python 添加单元测试(当然可以用作示例),即使我不确定它与 email.util 的关系。

我找到的一个简短示例是 this blogpost但是,其中只包含一次句子和一些有关 RFC2231 解析的信息的 SLOC。然而,作者指出,许多 MTA 使用 RFC2047反而。根据您的用例,这也可能是一个问题。

从我能找到的几个例子来看,我假设你使用 email.util 进行解析的方式是唯一的方法,即使长列表理解有些难看。

由于在某些方面缺少示例,编写一个新的 RFC2231 解析器可能是明智的(如果您确实需要更好、更快或更漂亮的代码库)。新的实现可以基于现有的实现,如 Dovecot RFC2231 parser出于兼容性原因(你甚至可以使用 Dovecot unit test 。因为 C 代码对我来说似乎很复杂,因为除了 email.util 的 Python2 backports 之外我找不到任何 python 实现email.util 移植到 Python 的任务并不容易(注意 Dovecot 是 LGPL-licensed ,这可能是您项目中的一个问题)

我认为 email.util RFC2231 API 并不是为了简单的独立使用而设计的,而是作为一堆实用方法在 email.message.Message 中使用。

关于python - 解码 RFC 2231 header ,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/18094309/

相关文章:

javascript - 将通知推送到 JavaScript?

javax.net.ssl.HttpsURLConnection 返回火星诗

java - HttpServletRequest.getParameterValues() 中的值排序

flash - 解析 X-amf mime 类型数据

HTML 格式的 Python 电子邮件 mimelib

python - 如何为 mongodb 配置 settings.py ?

python - Python 的 dict.pop 是原子的吗?

python - 通过遍历 Pandas 数据框中的行来创建新列

Python:要列出的字符串(不拆分)

linux - 如何在 Wanderlust 中查看备用 mime 内容