PHP正确解析UTF-8字符串

本文介绍了一种用于解析UTF-8编码字符串的PHP程序,该程序能够正确解码中英文混合的UTF-8字符串,并展示了解析过程的详细步骤。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

    在《学习PHP&MYSQL之——字符编码篇(一)》中介绍了Unicode与UTF-8的转换关系,总结了一个UTF-8的编码规则,根据这个编码规则,写一个UTF-8编码的解析程序,以下是PHP的实现:

 

View Code<?php
/*
程序功能,$str是中英文混合的UTF-8编码字符串,
将此字符串根据UTF-8的编码规则正确的解码并显示。
*/


$str = '今天非常Happy,所有决定去KFC吃可乐鸡翅!!!';

/*
$str 是待截取的字符串
$len 是截取的字符数
*/
function utf8sub($str,$len) {
	if($len <= 0){
		return '';
	}
	
	$offset = 0; // 截取高位字节时的偏移量
	$chars = 0;  // 截取到的字符数
	$res = '';   // 存放截取的结果字符串
	
	while($chars < $len){
		// 先取字符串的第一个字节
		// 将它转为十进制
		// 再转为二进制
		$high = ord(substr($str,$offset,1));
		
		// echo '$high='. $high .'<br />';

		if($high == null ){ // 如果取出高位为null,证明已经取到末尾,直接break
			break;
		}  
		if(($high>>2) === 0x3F){ // 将高位右移2位,和二进制111111比较,相同则取6个字节
			// 截取2个字节
			$count = 6;
		}else if(($high>>3) === 0x1F){ // 将高位右移2位,和二进制11111比较,相同则取5个字节
			// 截取3个字节
			$count = 5;
		}else if(($high>>4) === 0xF){ // 将高位右移2位,和二进制1111比较,相同则取4个字节
	
			// 截取4个字节
			$count = 4;
		}else if(($high>>5) === 0x7){ // 将高位右移2位,和二进制111比较,相同则取3个字节
		
			// 截取5个字节
			$count = 3;
		}else if(($high>>6) === 0x3){ // 将高位右移2位,和二进制11比较,相同则取2个字节
			// 截取6个字节
			$count = 2;
		}else if(($high>>7) === 0x0){ // 将高位右移2位,和二进制0比较,相同则取1个字节
			$count = 1;
		}
		// echo '$count='.$count.'<br />';
		
		$res .= substr($str,$offset,$count); // 取出一个字符与$res字符串连接
		$chars += 1;  // 截取到的字符数+1
		$offset += $count;  // 截取高位偏移量向后移$count字节 
	}
	return $res;
}

echo utf8sub($str,100);



转载于:https://www.cnblogs.com/giantpanda/archive/2012/11/04/2753398.html

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值