php - 如何获取 utf-8 字符串中给定字符的代码点编号?

标签 php unicode

我想获取给定 UTF-8 字符串的 UCS-2 代码点。例如“你好”这个词应该变成像“0068 0065 006C 006C 006F”这样的东西。请注意,字符可以来自任何语言,包括东亚语言等复杂脚本。

因此,问题归结为“将给定字符转换为其 UCS-2 代码点”

但是怎么办?拜托,任何形式的帮助都将非常非常感谢,因为我很赶时间。


作为答案发布的提问者回复的转录

感谢您的回复,但需要在 PHP v 4 或 5 而不是 6 中完成。

该字符串将是来自表单字段的用户输入。

我想实现 utf8to16 或 utf8decode 之类的 PHP 版本

function get_ucs2_codepoint($char)
{
    // calculation of ucs2 codepoint value and assign it to $hex_codepoint
    return $hex_codepoint;
}

你能帮我用 PHP 还是用上面提到的版本的 PHP 来完成?

最佳答案

使用现有的实用程序,例如 iconv ,或您使用的语言附带的任何库。

如果您坚持推出自己的解决方案,请阅读 UTF-8格式。基本上,每个代码点存储为 1-4 个字节,具体取决于代码点的值。范围如下:

  • U+0000 — U+007F:1字节:0xxxxxxx
  • U+0080 — U+07FF:2字节:110xxxxx 10xxxxxx
  • U+0800 — U+FFFF:3字节:1110xxxx 10xxxxxx 10xxxxxx
  • U+10000 — U+10FFFF:4字节:11110xxx 10xxxxxx 10xxxxxx 10xxxxxx

其中每个 x 是一个数据位。因此,您可以通过查看第一个字节来判断每个代码点由多少字节组成:如果它以 0 开头,则它是一个 1 字节字符。如果它以 110 开头,则它是一个 2 字节字符。如果它以 1110 开头,则它是一个 3 字节字符。如果以 11110 开头,则为 4 字节字符。如果它以 10 开头,则它是多字节字符的非初始字节。如果以 11111 开头,则为无效字符。

一旦你弄清楚字符中有多少字节,这只是一个问题。另请注意,UCS-2 不能表示 U+FFFF 以上的字符。

由于您没有指定语言,这里有一些示例 C 代码(省略了错误检查):

wchar_t utf8_char_to_ucs2(const unsigned char *utf8)
{
  if(!(utf8[0] & 0x80))      // 0xxxxxxx
    return (wchar_t)utf8[0];
  else if((utf8[0] & 0xE0) == 0xC0)  // 110xxxxx
    return (wchar_t)(((utf8[0] & 0x1F) << 6) | (utf8[1] & 0x3F));
  else if((utf8[0] & 0xF0) == 0xE0)  // 1110xxxx
    return (wchar_t)(((utf8[0] & 0x0F) << 12) | ((utf8[1] & 0x3F) << 6) | (utf8[2] & 0x3F));
  else
    return ERROR;  // uh-oh, UCS-2 can't handle code points this high
}

关于php - 如何获取 utf-8 字符串中给定字符的代码点编号?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/395832/

相关文章:

unicode - 在 Unicode 字符串中,平面是如何表示的(或者不是)?

mysql - 如何更改mysql数据库中的字体以存储unicode字符

php - WooCommerce 如何自定义显示订单字段的默认内容?

php - 某些数据库条目被忽略

python - 如何检查字符串是 unicode 还是 ascii?

python - 列表中的 'u' 是什么意思?

java - 强制用户仅添加希伯来字母

php - 向客户销售网站时如何保护我的 PHP 源代码?

php - 使用 Eloquent 选择具有值的最后一条记录

php - 在服务器(PHP)上存储文件的可扩展方式?