Mysql 的字符编码机制、中文乱码问题及解决方案_mysql varbinary字段乱码-程序员宅基地

技术标签: java  

 相信很多朋友都会对字符编码敬而远之,但一发生乱码问题却头大不已,本文结合前人的经验及Mysql手册中的解释,用具体的操作和例子,旨在了解mysql的字符编码机制以及乱码问题的解决。

【问题现象】

网页xxx.php用EditPlus另存为UTF8格式,

MySQL在my.ini(linux系统中配置文件为my.cnf)里设置[ client ] 和 [ mysqld ] 都设置为default-character-set=utf8,

建表时加了CREATE TABLE `xxx ` (myname varchar(255)) ENGINE=MyISAM DEFAULT CHARSET=utf8,

用xxx.php执行insert/update/select出来的都是中文,

貌似没问题,但是用phpMyAdmin看select是乱码,用第三方工具软件(如SQLyog)看select也是乱码,mysqldump也是乱码,很不爽。当然,如果你建表的时候,选择了binary/varbinary/blob类型,不会发现乱码,因为指定的是二进制保存,MySQL保存数据时就没有编码的概念了。

【查找问题】

虽然在my.ini里设置default-character-set=utf8,但是执行以下命令时有新发现:

mysql> SHOW VARIABLES LIKE 'character%';

+----------------------------------------+-------------------------

| Variable_name| Value

+----------------------------------------+-------------------------

| character_set_client | latin1

| character_set_connection | latin1

| character_set_database | utf8

| character_set_filesystem | binary

| character_set_results| latin1

| character_set_server| utf8

| character_set_system| utf8

| character_sets_dir| D:\mysql\share\charsets\

+----------------------------------------+-------------------------

8 rows in set (0.00 sec)

mysql> SHOW VARIABLES LIKE 'collation_%';

+---------------------------------------+------------------

| Variable_name| Value

+---------------------------------------+------------------

| collation_connection | latin1_swedish_ci

| collation_database| utf8_general_ci

| collation_server| utf8_general_ci

+--------------------------------------+------------------

3 rows in set (0.00 sec)

发现Value列里面不全是utf8,仍然有部分是latin1,比如其中的client和connection。

其中本文会多次提及以下几个概念:

character_set_client:客户端发送的查询中所使用的字符集,下文简称client

character_set_connection:服务器接收到查询后,会将查询从character_set_client系统变量所标识的编码转换到character_set_connection,下文简称connection

character_set_results:服务器发送结果集或返回错误信息到客户端所使用的字符集,下文简称results

而这几个字符集设置的关系为:

信息输入路径:client→connection→server
信息输出路径:server→connection→results

换句话说,每个路径要经过3次改变字符集编码。以出现乱码的输出为例,按照上表中的字符集设定:server里utf8的数据,传入connection转为latin1,传入results转为latin1,页面如果设定为UTF-8的话,又把results的latin1转为UTF-8。如果两种字符集不兼容,比如latin1和utf8,转化过程就为不可逆的,破坏性的。所以就转不回来了。

再来一个输入路径的例子:从xxx.php页面上输入汉字,因为xxx.php是UTF8编码的,所以xxx.php以UTF8格式转换输入的汉字,然后以UTF8提交给mysql,但是mysql的client和connection都是latin1的,而server是UTF8的,所以mysql存储时,先将xxx.php提交的汉字,转成latin1的格式,再转成UTF8字符格式存在表中。如果此时我们用第三方软件或者phpMyAdmin去select查看此表,而表中存储的数据是被latin1过的UTF8字符,出来的时候是以UTF8格式取的,当然看起来时乱码了。解决方法就是让所有过程都是UTF8的就可以了。

【解决问题】

一、从my.ini(linux系统为my.cnf)下手

[client]
default-character-set=utf8

[mysql]
default-character-set=utf8


[mysqld]
collation-server = utf8_unicode_ci
init-connect='SET NAMES utf8'
character-set-server = utf8

以上2个section都要加default-character-set=utf8,而默认这两项都为latin1

然后重启mysql,执行

mysql> SHOW VARIABLES LIKE 'character%';

mysql> SHOW VARIABLES LIKE 'collation_%';

确保所有的Value项都是utf8即可。

二、设置数据库(database)、表(table)或字段(column)的字符集(character set)及校对规则(collate)。

例如:建表时加utf8,表字段的Collation可加可不加,不加时默认是utf8_general_ci了。

CREATE TABLE `tablename4` (

`id` int(11) NOT NULL AUTO_INCREMENT,

`varchar1` varchar(255) DEFAULT NULL,

`varbinary1` varbinary(255) DEFAULT NULL,

PRIMARY KEY (`id`)

) ENGINE=MyISAM DEFAULT CHARSET=utf8

这里要说明一下:

1、在服务端,主要分为四个层次,由底到高依次为:server, database, table, column,每一次都可设定其字符集(character set)及校对(collate),如果高层的字符集有设置,则按高层的来进行字符编码,如果本层无设置编码,则采用下一层次的字符集。

因此,如果设置了database级的字符集,则table级的字符集可设可不设,如果既设置了database级又设置了table级,则按table级来存储。

2、字符集(character set)和校对的关系。

字符集是一套符号和编码。校对规则是在字符集内用于比较字符的一套规则。

用一个简单的例子来解释,如,有四个字母,A,B,C,D,我们为每个字母赋予一个数值:‘A’=0,‘B’= 1,‘a’= 2,‘b’= 3。字母‘A’是一个符号,数字0是‘A’的编码,这四个字母和它们的编码组合在一起是一个字符集。而针对某一字符集的校对规则可以有多种,例如按字母所代表的数值大小来排列,或者大小写不敏感的排列等等。

MySQL按照下面的方式选择字符集和 校对规则:

·        如果指定了CHARACTER SET X和COLLATE Y,那么采用CHARACTER SET X和COLLATE Y。

·        如果指定了CHARACTER SET X而没有指定COLLATE Y,那么采用CHARACTER SET X和CHARACTER SET X的默认校对规则。

          如果指定了COLLATE Y而没有指定CHARACTER SET X,那么采用COLLATE Y相对应的CHARACTER SET和COLLATE Y。

·        否则,采用低一级服务器字符集和服务器校对规则。

三、页面文件保存时选择utf-8编码,页面上加上utf-8的编码方式:

 

对于静态页面,在<head>内加上:<meta http-equiv="Content-Type" content="text/html; charset=utf-8" />

对于PHP文件:header('conten-type:text/html;charset=utf-8');

对于JSP、Servlet

a) 设置web容器的编码格式。为你的servlet的doGet或doPost方法开始处加入如下代码:
        request.setCharacterEncoding("utf-8");
        response.setCharacterEncoding("utf-8");
b) 为每个jsp页面指定其编码格式。<%@ page pageEncoding="utf-8"%>
c) 在连接数据库用的URL后加入:useUnicode=true;characterEncoding=utf-8 如:
                        url="jdbc:mysql:///db1?useUnicode=true&characterEncoding=utf-8",

如果是xml文件中     url="jdbc:mysql:///db1?useUnicode=true&amp;characterEncoding=utf-8",

四、在执行CRUD操作前先执行一下mysql_query("set names utf8");

网上很多人说要执行set names utf8,我想如果每次数据库连接都要set names一下,原本的一句sql语句变成了两句,很不合理嘛!到底要不要set names utf8还有待测试,因为我刚翻了Mysql5.1的文档,里边有写道:

SET NAMES 'x'语句与这三个语句等价:

mysql>SET character_set_client =x;

mysql>SET character_set_results =x;

mysql>SET character_set_connection =x;

而刚才在my.ini中所设置的CLIENT SECTION中的:default-character-set=utf8就已经同时修改了client、results及connection的值为utf8了。

今天刚实验了一下,页面也已经设置为UTF8的话,不需要再set names一下,在数据库客户端SQLyog也同样不需要!因为mysql初始化时已经从my.ini里读取到default_character_set=utf8并将以上三个变量都设置为utf8了。但如果页面是用别的编码的话,必须要set names为与之一致的编码

测试代码xxx.php如下:

<?php

header('conten-type:text/html;charset=utf-8');

mysql_connect("localhost", "root", "password") or die("Could not connect: " . mysql_error());

mysql_select_db("test");

mysql_query("set names utf8");//可以去掉这句!

$str = "CHN 软件开发有限公司,JPN ソフトウェア開発株式会社,KOR 소프트웨어 개발 유한 공사,RUS Суд программного обеспечения".time();

$sql = "insert into tablename4 (varchar1, varbinary1 ) values ('".$str."','".$str."')";

echo $sql."<hr>";

mysql_query($sql);

$result = mysql_query("SELECT id, varchar1 ,varbinary1 FROM tablename4");

while ($row = mysql_fetch_array($result, MYSQL_BOTH)) {

printf ("ID: %s , varchar1: %s, varbinary1: %s<br>", $row[0], $row["varchar1"], $row["varbinary1"]);

}

mysql_free_result($result);

?>

如此设置之后,无论是在php页面插入任何utf8字符,在php页面里取出来的,在phpMyAdmin里取出来的,在mysql的第三方客户端软件里取出来的,都是一样的汉字了,不会再发现乱码,mysqldump出来的也是汉字。OK,问题解决。

【CMD那些事儿】

        首先,在中文windows系统下,在cmd.exe里运行mysql.exe,有点特别。因为默认情况下,中文windows系统cmd.exe里的字符编码是cp936即GBK,不能显示全部UTF8字符,所以在字符终端里看到乱码是正常现象,不要奇怪,这个问题在类Unix系统的shell终端里可以解决的。

        其次,由于CMD的输入输出格式不能改变,中文系统为GBK(可以将CMD与网页浏览器对比一下,浏览器会根据网页文件的字符编码来改变输入输出的字符编码),因此,如果希望在CMD里敲insert、select等输入输出中带有中文字符的语句时,必须保证myqsl的client、connection和results的字符编码为GBK或gb2312,方法是输入命令:set names gbk。如果是从外部SQL文件以Source方式导入到数据库的话,则要保证client、connection的字符编码与外部SQL文件的编码方式一致(可用记事本打开-->另存为 来查看文件的编码格式),如果文件的编码格式不是GBK,例如UTF-8,则要在source之前先set names utf8; 这样,就能正确将中文数据导入至数据库了(但如果此时在CMD里select一下,仍然会显示乱码,原因是此时的results编码格式为utf8,不过没关系,保存在mysql的数据是正确的,只是查询结果集以utf8方式返回到编码格式为GBK的CMD中导致乱码而已),有点啰嗦,希望明白,呵呵!

        这里可是印象深刻啊,今天帮一个实习小妹子解决一个导入数据库乱码问题,我一拿到数据库文件,首先检查表语句,确认用的是UTF8编码,然后我开始用cmd命令行方式导入数据库(我的数据库中的client, connection, result, database, server的字符集都为UTF8),我先set names utf8; 然后source导入,没报错,select发现中文乱码。于是我查看SQL文件的编码格式为UTF-8,心想,没错了啦!

百思不得期解,于是上网得知中文Windows系统下的cmd.exe的输入格式都为GBK,于是我又set names gbk;再一次source导入,报错:

ERROR 1406 (22001): Data too long for column 'XXX' at row XX

ERROR 1366 (HY000): Incorrect string value: '\xAB\xA5...' for column 'XXX' at row XX

突然想起SQL文件为UTF-8格式,尝试将其改为ANSI,再次source, 无报错,SELECT也显示中文了。

细心想了一下,自认为的解释是:

第一次导入:set names utf8; 然后source导入,没报错,select发现中文乱码

原因:没报错是因为我的SQL文件本身为UTF-8编码,而我又set names utf8, 即client, connection, result 都为utf8, 编码一致,可以认为数据正确存储到数据库了,而CMD中select为乱码的原因为CMD的编码无法改变,仅为GBK,尽管这时候client, connection, result都为UTF8编码,但最终显示的格式却是GBK!编码不一致,当然出现乱码了,但我猜想这种情况下,数据库里的数据是没问题的!明天再实验一下!

经今早实验,我把数据库drop掉再重新按这种方式导入,没报错,虽然在CMD里select仍然发现乱码,但在SQLyog等客户端是正常显示的,证明我的猜想是对的!

第二次导入:set names gbk;再一次source导入,报错。

原因:这时SQL文件的编码格式为UTF-8,而由于set names gbk导致 client, connection, result都改变为GBK,你声明client的输入格式为GBK,却拿个UTF-8格式的文件给我导入,输入格式不一致导致报错!

第三次导入:先修改SQL文件编码为ANSI,最后source, 无报错,select也是正常的。

原因:我在第二次导入时set names gbk; 这时client, connection, result都为gbk,而且SQL文件格式也为兼容GBK,于是就成功了!

 

最后总结一下:同时多看看MYSQL手册,了解一下MYSQL的理论,这样遇到错误的时候分析也有理论基础。还有的是建议看英文文档的,并不是说中文的不好,只是认为人总会犯错的,翻译过程难免有错漏,哥今天看中文的手册就发现有一处翻译错误,而且是严重误导性的,上网翻英文版的又发现中文版的漏翻了一些……

版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/salonhuang/article/details/74000421

智能推荐

分布式光纤传感器的全球与中国市场2022-2028年:技术、参与者、趋势、市场规模及占有率研究报告_预计2026年中国分布式传感器市场规模有多大-程序员宅基地

文章浏览阅读3.2k次。本文研究全球与中国市场分布式光纤传感器的发展现状及未来发展趋势,分别从生产和消费的角度分析分布式光纤传感器的主要生产地区、主要消费地区以及主要的生产商。重点分析全球与中国市场的主要厂商产品特点、产品规格、不同规格产品的价格、产量、产值及全球和中国市场主要生产商的市场份额。主要生产商包括:FISO TechnologiesBrugg KabelSensor HighwayOmnisensAFL GlobalQinetiQ GroupLockheed MartinOSENSA Innovati_预计2026年中国分布式传感器市场规模有多大

07_08 常用组合逻辑电路结构——为IC设计的延时估计铺垫_基4布斯算法代码-程序员宅基地

文章浏览阅读1.1k次,点赞2次,收藏12次。常用组合逻辑电路结构——为IC设计的延时估计铺垫学习目的:估计模块间的delay,确保写的代码的timing 综合能给到多少HZ,以满足需求!_基4布斯算法代码

OpenAI Manager助手(基于SpringBoot和Vue)_chatgpt网页版-程序员宅基地

文章浏览阅读3.3k次,点赞3次,收藏5次。OpenAI Manager助手(基于SpringBoot和Vue)_chatgpt网页版

关于美国计算机奥赛USACO,你想知道的都在这_usaco可以多次提交吗-程序员宅基地

文章浏览阅读2.2k次。USACO自1992年举办,到目前为止已经举办了27届,目的是为了帮助美国信息学国家队选拔IOI的队员,目前逐渐发展为全球热门的线上赛事,成为美国大学申请条件下,含金量相当高的官方竞赛。USACO的比赛成绩可以助力计算机专业留学,越来越多的学生进入了康奈尔,麻省理工,普林斯顿,哈佛和耶鲁等大学,这些同学的共同点是他们都参加了美国计算机科学竞赛(USACO),并且取得过非常好的成绩。适合参赛人群USACO适合国内在读学生有意向申请美国大学的或者想锻炼自己编程能力的同学,高三学生也可以参加12月的第_usaco可以多次提交吗

MySQL存储过程和自定义函数_mysql自定义函数和存储过程-程序员宅基地

文章浏览阅读394次。1.1 存储程序1.2 创建存储过程1.3 创建自定义函数1.3.1 示例1.4 自定义函数和存储过程的区别1.5 变量的使用1.6 定义条件和处理程序1.6.1 定义条件1.6.1.1 示例1.6.2 定义处理程序1.6.2.1 示例1.7 光标的使用1.7.1 声明光标1.7.2 打开光标1.7.3 使用光标1.7.4 关闭光标1.8 流程控制的使用1.8.1 IF语句1.8.2 CASE语句1.8.3 LOOP语句1.8.4 LEAVE语句1.8.5 ITERATE语句1.8.6 REPEAT语句。_mysql自定义函数和存储过程

半导体基础知识与PN结_本征半导体电流为0-程序员宅基地

文章浏览阅读188次。半导体二极管——集成电路最小组成单元。_本征半导体电流为0

随便推点

【Unity3d Shader】水面和岩浆效果_unity 岩浆shader-程序员宅基地

文章浏览阅读2.8k次,点赞3次,收藏18次。游戏水面特效实现方式太多。咱们这边介绍的是一最简单的UV动画(无顶点位移),整个mesh由4个顶点构成。实现了水面效果(左图),不动代码稍微修改下参数和贴图可以实现岩浆效果(右图)。有要思路是1,uv按时间去做正弦波移动2,在1的基础上加个凹凸图混合uv3,在1、2的基础上加个水流方向4,加上对雾效的支持,如没必要请自行删除雾效代码(把包含fog的几行代码删除)S..._unity 岩浆shader

广义线性模型——Logistic回归模型(1)_广义线性回归模型-程序员宅基地

文章浏览阅读5k次。广义线性模型是线性模型的扩展,它通过连接函数建立响应变量的数学期望值与线性组合的预测变量之间的关系。广义线性模型拟合的形式为:其中g(μY)是条件均值的函数(称为连接函数)。另外,你可放松Y为正态分布的假设,改为Y 服从指数分布族中的一种分布即可。设定好连接函数和概率分布后,便可以通过最大似然估计的多次迭代推导出各参数值。在大部分情况下,线性模型就可以通过一系列连续型或类别型预测变量来预测正态分布的响应变量的工作。但是,有时候我们要进行非正态因变量的分析,例如:(1)类别型.._广义线性回归模型

HTML+CSS大作业 环境网页设计与实现(垃圾分类) web前端开发技术 web课程设计 网页规划与设计_垃圾分类网页设计目标怎么写-程序员宅基地

文章浏览阅读69次。环境保护、 保护地球、 校园环保、垃圾分类、绿色家园、等网站的设计与制作。 总结了一些学生网页制作的经验:一般的网页需要融入以下知识点:div+css布局、浮动、定位、高级css、表格、表单及验证、js轮播图、音频 视频 Flash的应用、ul li、下拉导航栏、鼠标划过效果等知识点,网页的风格主题也很全面:如爱好、风景、校园、美食、动漫、游戏、咖啡、音乐、家乡、电影、名人、商城以及个人主页等主题,学生、新手可参考下方页面的布局和设计和HTML源码(有用点赞△) 一套A+的网_垃圾分类网页设计目标怎么写

C# .Net 发布后,把dll全部放在一个文件夹中,让软件目录更整洁_.net dll 全局目录-程序员宅基地

文章浏览阅读614次,点赞7次,收藏11次。之前找到一个修改 exe 中 DLL地址 的方法, 不太好使,虽然能正确启动, 但无法改变 exe 的工作目录,这就影响了.Net 中很多获取 exe 执行目录来拼接的地址 ( 相对路径 ),比如 wwwroot 和 代码中相对目录还有一些复制到目录的普通文件 等等,它们的地址都会指向原来 exe 的目录, 而不是自定义的 “lib” 目录,根本原因就是没有修改 exe 的工作目录这次来搞一个启动程序,把 .net 的所有东西都放在一个文件夹,在文件夹同级的目录制作一个 exe._.net dll 全局目录

BRIEF特征点描述算法_breif description calculation 特征点-程序员宅基地

文章浏览阅读1.5k次。本文为转载,原博客地址:http://blog.csdn.net/hujingshuang/article/details/46910259简介 BRIEF是2010年的一篇名为《BRIEF:Binary Robust Independent Elementary Features》的文章中提出,BRIEF是对已检测到的特征点进行描述,它是一种二进制编码的描述子,摈弃了利用区域灰度..._breif description calculation 特征点

房屋租赁管理系统的设计和实现,SpringBoot计算机毕业设计论文_基于spring boot的房屋租赁系统论文-程序员宅基地

文章浏览阅读4.1k次,点赞21次,收藏79次。本文是《基于SpringBoot的房屋租赁管理系统》的配套原创说明文档,可以给应届毕业生提供格式撰写参考,也可以给开发类似系统的朋友们提供功能业务设计思路。_基于spring boot的房屋租赁系统论文