找回密码
 注册
搜索
查看: 697|回复: 0

【转载】万加雷、陶晓鹏:汉字编码字符集的现状和发展

[复制链接]
发表于 2005-11-20 12:45:44 | 显示全部楼层 |阅读模式
万加雷* [yuanjun1] 陶晓鹏
关键词:汉字编码字符集、汉字内部码、汉字编码

一、前言
相对西文字符集的定义,汉字编码字符集的定义有两大困难:选字难和排序难。选字难是因为汉字字量大(包括简体字、繁体字、日本汉字、韩国汉字),而字符集空间有限。排序难是因为汉字可有多种排序标准(拼音、部首、笔画等等),而具体到每一种排序标准,往往还存在不少争议,如对一些汉字还没有一致认可的笔画数。

二、汉字编码国家标准
1984年“全国计算机与信息处理标准化技术委员会”提出编码字符集的繁体字和简体字对应编码的原则,并做出了制定六个信息交换用汉字编码字符集的计划。这六个集分别命名为基本集、第一辅助集(辅一)、第二辅助集(辅二)、第三辅助集(辅三)、第四辅助集(辅四)、第五辅助集(辅五)。其中,基本集、辅二集、辅四集是简体字集,辅一集、辅三集、辅五集分别是基本集、辅二集、辅四集的繁体字映射集,且简/繁字在两个字符集中同码(个别简/繁关系为一对多的汉字除外)。
国家标准GB 2312-80《信息交换用汉字编码字符集基本集》已于1980年发布使用,它奠定了我国中文信息处理技术的发展。
这六个集均采用双七位编码方式,但为了避开ASCII表中的控制码,每个七位只选取了94个编码位置。所以每张代码表分94个区和94个位。其中前15区作为拼音文字及符号区或保留未用,16区到94区为汉字区。

1. 基本集GB 2312-80
收入汉字信息交换用的基本图形字符,采用一字一码的原则,具体包括:一般符号,序号,数字,拉丁字母,日文假名,希腊字母,俄文字母,汉语拼音符号,汉语注音字母及简化汉字6763个。总计7445个图形字符。

2. 其他五个辅助汉字集
辅二集(GB 7589-87)和辅四集(GB 7590-87)是作为基本集的补充而编制的,均收通用规范的简体汉字,分别收字7237和7039个,都以部首为序排,部首次序按笔画数排列,同部首字按部首以外的笔画数排列,同笔画数的字以笔形顺序(横、直、撇、点、折)为序。
这两个集都不收异体字,共约有4200多个字是经过类推简化得到的,提高了整个字符集的规范性,但降低了字符集的实用性。
比较而言辅二集所收汉字具有较高通用性和实用性。
辅一集(GB 12345-90)已于1990年发布,是与基本集对应的繁体字集,共收图形字符7583个,其中前15区除收集了GB2312中前15区内收的全部字符外,又增收了35个竖排标点符号和汉语拼音符号。从16区至91区共收6866个繁体汉字。一级汉字数和二级汉字数都与GB2312相同,另有103个繁体字是
属于简/繁为一对多的字。对于简/繁一对多的情况,则选一个最通用的繁体字码置于与基本集中该字相对应的码位,其余的则按拼音序编码于88和89区。
辅三集和辅五集分别是辅二集和辅四集的一一对应的繁体字符集,比辅二集和辅四集中的字有更多的使用机会。
三、中国台湾定义的汉字字符集
台湾、香港等地使用的汉字是繁体字,台湾已经定义的汉字字符集只收繁体字。
在台湾,用于中文信息交换的标准有:
CCCII:中文资讯交换码
CNS 11643:通用汉字标准交换码
其中,CNS 11643实用面更广,使用者更多。

四、日本和韩国定义的汉字字符集
日本和韩国使用的汉字大都与中国相同或相似,但都有一些汉字是它们国家特有的,编码标准分别是JIS和KS系列,也都采用双字节编码,主要有: 日本JISX 0208-1983:与GB 2312相似。共收字符6877个,1到15区为拼音字符及符号区;16到84区为汉字区,共收日本汉字6353个。分一级汉字区和二级汉字区,一级汉字区按拼音排序,二级汉字区按部首排序。
日本JISX 0212-1990:作为日本汉字交换码辅助集。共有6067个字符,日本汉字有5801个,按部首排列。
韩国KSC 5601-1987:共有8244个字符,韩国汉字有4888个,有200多个多音汉字分配了一个以上的码位。

五、ISO 10646通用多八位编码字符集(UCS)中的汉字字符集
1. ISO 10646简介
以上介绍的中国大陆、台湾、日本和韩国的汉字字符集编码原则相同,但具体编码不同,因此只能在各自国家或地区使用,不便于国际间的交流。
UCS则是于1992年通过的国际标准,采用肆八位规范形式(UCS-4)和UCS的双八位基本多文种平面形式(UCS-2),定义了一个用于世界范围各种文字及各种语言的书面形式的图形字符集,基本上收集全了上面四个国家(或地区)使用的汉字,这样一举解决了当前使用的单字节字符编码和双字节汉字编码给编码空间带来的限制和给软硬件设计带来的困难,为多文种的信息交换和混合处理提供了方便。

2. ISO 10646中的汉字字符集
在I区定义了按(康熙字典)部首序的20902个CJK(中日韩)统一汉字。
值得一提的是unicode标准,它是APPLE公司为彻底解决计算机处理多文种文本而发起制定的通用多文种字符集。对汉字集的处理与ISO 10646相似。
六、汉字内部码问题
用二进制代码来表示字符和汉字是现代信息交换中通用的手段,它除广泛应用于通信(电报、电传等数据通信,如GB8565-88信息处理文本通信用编码字符集)外,还在计算机中得到普遍使用。在计算机中使用的字符和汉字的代码,通常为内码。目前的计算机系统,无论是硬件还是软件都是基于西文字符集(如ASCII)设计生产的,而大多数汉字字符集中的汉字编码都与机内原有西文字符编码发生了冲突,有两种解决的方法:
(1)保持原有西文字符编码,修改汉字编码;
(2)将西文字符和汉字统一编码,即原有西文字符的编码也要修改。
如ISO 10646就采用了第二种方法,可以说彻底解决了各个文种的字符(包括汉字)的机内码问题。
但第二种方法无法继续使用已有的计算机系统,几乎全部工作都要从头开始。目前使用更多的是上述的第一种方法。
为了让更多的文字进入现有的计算机系统,可以采用“一码对多字”的技术:即同一个机内码在不同情况下表示不同的字符(这些不同的字符往往有密切的联系)。这样的系统大都设置了切换键,用来选取系统的当前环境。
您需要登录后才可以回帖 登录 | 注册

本版积分规则

手机版|小黑屋|中语书院

GMT+8, 2026-9-4 19:34 , Processed in 0.023419 second(s), 16 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表