perl - 如何为 URL 编码西里尔字符然后解码它们？

标签 perl utf-8 character-encoding utf8-decode

我在一页上有一个表格:

<form method="POST" accept-charset="UTF-8" action="index.cgi" name="TestForm">

输入字段之一“search_string”可用于发送西里尔字符，如果发生这种情况，URL 字符串如下所示:

search_string=%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D

如何将其解码回我发布到的页面上的原始字符串？

最佳答案

正确的解决方案，包括空格:

use open ':std', ':encoding(UTF-8)';
use Encode;

my $escaped = '%41F%2F%424+%41F%41E%414%416%410%420%41A%410+%418%417+%421%412%418%41D';
(my $unescaped = $escaped) =~ s/\+/ /g;
$unescaped =~ s/%([[:xdigit:]]+)/chr hex $1/eg;
print $unescaped;
# П/Ф ПОДЖАРКА ИЗ СВИН

信用转至 Renaud Bompuis因为首先认识到这些是以 % 为前缀的 Unicode 代码点。 .

我想补充一点，问题中的编码方案非常不寻常，我以前从未见过。通常人们会期望字符串 П/Ф ПОДЖАРКА ИЗ СВИН编码为 %D0%9F%2F%D0%A4+%D0%9F%D0%9E%D0%94%D0%96%D0%90%D0%A0%D0%9A%D0%90+%D0%98%D0%97+%D0%A1%D0%92%D0%98%D0%9D ，也就是说，首先将字符编码为UTF-8，然后将八位字节进行百分比转义。此方案适用于 Dr.Kameleon 的答案.

关于perl - 如何为 URL 编码西里尔字符然后解码它们？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/9818988/

上一篇：swing - 我应该将 Java 用于为 clojure 应用程序设计的自定义 Swing 组件吗？

下一篇：scala - 从 Typesafe 安装的 Play 2.0 中缺少 'debug' 命令

相关文章：

java utils.Properties 如何忽略 BOM 字符

c# - 如何更改 XmlReader 的字符编码

sql-server - SQL Server 链接服务器到 PostgreSQL 土耳其语字符问题

regex - Perl:如何仅替换字符串的匹配部分？

perl - 为什么安装 Scrappy 时 CPAN 安装失败？

perl - 如何禁用子进程中的 END block ？

php - 使用 PHP mysql_* SET NAMES UTF 8 和 Mysql Table With utf8_unicode_ci 进行字符串比较

java - 将 UTF-8 转换为 Shift-JIS

java - 日语字符未正确显示转换 CSV 文件

regex - 使用存储在哈希中的正则表达式提取字符串