php - 如何获取 utf-8 字符串中给定字符的代码点编号？

我想获取给定 UTF-8 字符串的 UCS-2 代码点。例如“你好”这个词应该变成像“0068 0065 006C 006C 006F”这样的东西。请注意，字符可以来自任何语言，包括东亚语言等复杂脚本。

因此，问题归结为“将给定字符转换为其 UCS-2 代码点”

但是怎么办？拜托，任何形式的帮助都将非常非常感谢，因为我很赶时间。

作为答案发布的提问者回复的转录

感谢您的回复，但需要在 PHP v 4 或 5 而不是 6 中完成。

该字符串将是来自表单字段的用户输入。

我想实现 utf8to16 或 utf8decode 之类的 PHP 版本

function get_ucs2_codepoint($char)
{
    // calculation of ucs2 codepoint value and assign it to $hex_codepoint
    return $hex_codepoint;
}

你能帮我用 PHP 还是用上面提到的版本的 PHP 来完成？

最佳答案

使用现有的实用程序，例如 iconv ，或您使用的语言附带的任何库。

如果您坚持推出自己的解决方案，请阅读 UTF-8格式。基本上，每个代码点存储为 1-4 个字节，具体取决于代码点的值。范围如下:

U+0000 — U+007F:1字节:0xxxxxxx
U+0080 — U+07FF:2字节:110xxxxx 10xxxxxx
U+0800 — U+FFFF:3字节:1110xxxx 10xxxxxx 10xxxxxx
U+10000 — U+10FFFF:4字节:11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

其中每个 x 是一个数据位。因此，您可以通过查看第一个字节来判断每个代码点由多少字节组成:如果它以 0 开头，则它是一个 1 字节字符。如果它以 110 开头，则它是一个 2 字节字符。如果它以 1110 开头，则它是一个 3 字节字符。如果以 11110 开头，则为 4 字节字符。如果它以 10 开头，则它是多字节字符的非初始字节。如果以 11111 开头，则为无效字符。

一旦你弄清楚字符中有多少字节，这只是一个问题。另请注意，UCS-2 不能表示 U+FFFF 以上的字符。

由于您没有指定语言，这里有一些示例 C 代码(省略了错误检查):

wchar_t utf8_char_to_ucs2(const unsigned char *utf8)
{
  if(!(utf8[0] & 0x80))      // 0xxxxxxx
    return (wchar_t)utf8[0];
  else if((utf8[0] & 0xE0) == 0xC0)  // 110xxxxx
    return (wchar_t)(((utf8[0] & 0x1F) << 6) | (utf8[1] & 0x3F));
  else if((utf8[0] & 0xF0) == 0xE0)  // 1110xxxx
    return (wchar_t)(((utf8[0] & 0x0F) << 12) | ((utf8[1] & 0x3F) << 6) | (utf8[2] & 0x3F));
  else
    return ERROR;  // uh-oh, UCS-2 can't handle code points this high
}

关于php - 如何获取 utf-8 字符串中给定字符的代码点编号？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/395832/

php - 如何获取 utf-8 字符串中给定字符的代码点编号？

上一篇：php - 如何使用 yum 轻松地将 posix 支持添加到 PHP？

下一篇：php - 如何在 PHP 中找到两个字符串之间的最大公共(public)子字符串？