我想获取给定 UTF-8 字符串的 UCS-2 代码点。例如“你好”这个词应该变成像“0068 0065 006C 006C 006F”这样的东西。请注意,字符可以来自任何语言,包括东亚语言等复杂脚本。
因此,问题归结为“将给定字符转换为其 UCS-2 代码点”
但是怎么办?拜托,任何形式的帮助都将非常非常感谢,因为我很赶时间。
作为答案发布的提问者回复的转录
感谢您的回复,但需要在 PHP v 4 或 5 而不是 6 中完成。
该字符串将是来自表单字段的用户输入。
我想实现 utf8to16 或 utf8decode 之类的 PHP 版本
function get_ucs2_codepoint($char)
{
// calculation of ucs2 codepoint value and assign it to $hex_codepoint
return $hex_codepoint;
}
你能帮我用 PHP 还是用上面提到的版本的 PHP 来完成?
最佳答案
使用现有的实用程序,例如 iconv ,或您使用的语言附带的任何库。
如果您坚持推出自己的解决方案,请阅读 UTF-8格式。基本上,每个代码点存储为 1-4 个字节,具体取决于代码点的值。范围如下:
- U+0000 — U+007F:1字节:0xxxxxxx
- U+0080 — U+07FF:2字节:110xxxxx 10xxxxxx
- U+0800 — U+FFFF:3字节:1110xxxx 10xxxxxx 10xxxxxx
- U+10000 — U+10FFFF:4字节:11110xxx 10xxxxxx 10xxxxxx 10xxxxxx
其中每个 x 是一个数据位。因此,您可以通过查看第一个字节来判断每个代码点由多少字节组成:如果它以 0 开头,则它是一个 1 字节字符。如果它以 110 开头,则它是一个 2 字节字符。如果它以 1110 开头,则它是一个 3 字节字符。如果以 11110 开头,则为 4 字节字符。如果它以 10 开头,则它是多字节字符的非初始字节。如果以 11111 开头,则为无效字符。
一旦你弄清楚字符中有多少字节,这只是一个问题。另请注意,UCS-2 不能表示 U+FFFF 以上的字符。
由于您没有指定语言,这里有一些示例 C 代码(省略了错误检查):
wchar_t utf8_char_to_ucs2(const unsigned char *utf8)
{
if(!(utf8[0] & 0x80)) // 0xxxxxxx
return (wchar_t)utf8[0];
else if((utf8[0] & 0xE0) == 0xC0) // 110xxxxx
return (wchar_t)(((utf8[0] & 0x1F) << 6) | (utf8[1] & 0x3F));
else if((utf8[0] & 0xF0) == 0xE0) // 1110xxxx
return (wchar_t)(((utf8[0] & 0x0F) << 12) | ((utf8[1] & 0x3F) << 6) | (utf8[2] & 0x3F));
else
return ERROR; // uh-oh, UCS-2 can't handle code points this high
}
关于php - 如何获取 utf-8 字符串中给定字符的代码点编号?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/395832/