使用Java将中文字符转换成Unicode编码

 

这两天操作XML使用到了Jdom,在创建XML文件并输出到硬盘的时候遇到一个中文编码的问题:Jdom默认输出的XML编码是UTF-8,但是文档中如果出现中文字符那么该中文字符就会变成乱码,造成XML文件无法被正确解析。

UTF-8应该是可以用来表示中文的吧?我不知道这是不是Jdom的一个BUG(Jdom 1.0,beta了10次的产物哦!)。我google了一下,大家解决这个问题的办法无非是把Jdom的输出字符集改为GBK或者GB2312,但是这样就会有一些副作用,如果在没有特定字符集(GBK或者GB2312)的操作系统上不是依然不能正确解析吗?一个比较好的解决办法是先把中文转换成Unicode编码在直接输出,程序解析XML后的时候再把Unicode编码转回中文就没有问题了。

于是我查看了JDK的文档,截至Java 5好像都没有做类似转换的类可以直接使用,但是我发现一个类 java.util.Properties,它的源代码里有两个私有(private)方法 loadConvert (char[] in, int off, int len, char[] convtBuf) 和 saveConvert(String theString, boolean escapeSpace) 其实就是做特殊字符和Unicode编码字符间转换的,我把它们提取出来,单独包装到一个类里就可以使用了。

下面是我包装的类 CharacterSetToolkit

/*
* CharacterSetToolkit.java
*
* Created on 2006年10月27日, 下午2:06
*
* To change this template, choose Tools | Template Manager
* and open the template in the editor.
*/

package mobi.chenwei.lang;

/**
* 进行字符操作的工具类
* @author Chen Wei
* @email chenwei.mobi@gmail.com
*/
public class CharacterSetToolkit {
    
     /** Creates a new instance of CharacterSetToolkit */
     public CharacterSetToolkit() {
     }
    
     private static final char[] hexDigit = {
         '0','1','2','3','4','5','6','7','8','9','A','B','C','D','E','F'
     };
    
     private static char toHex(int nibble) {
         return hexDigit[(nibble & 0xF)];
     }
    
     /**
      * 将字符串编码成 Unicode 。
      * @param theString 待转换成Unicode编码的字符串。
      * @param escapeSpace 是否忽略空格。
      * @return 返回转换后Unicode编码的字符串。
      */
     public static String toUnicode(String theString, boolean escapeSpace) {
         int len = theString.length();
         int bufLen = len * 2;
         if (bufLen < 0) {
             bufLen = Integer.MAX_VALUE;
         }
         StringBuffer outBuffer = new StringBuffer(bufLen);

         for(int x=0; x<len; x++) {
             char aChar = theString.charAt(x);
             // Handle common case first, selecting largest block that
             // avoids the specials below
             if ((aChar > 61) && (aChar < 127)) {
                 if (aChar == '\\') {
                     outBuffer.append('\\'); outBuffer.append('\\');
                     continue;
                 }
                 outBuffer.append(aChar);
                 continue;
             }
             switch(aChar) {
                 case ' ':
                     if (x == 0 || escapeSpace)
                         outBuffer.append('\\');
                     outBuffer.append(' ');
                     break;
                 case '\t':outBuffer.append('\\'); outBuffer.append('t');
                           break;
                 case '\n':outBuffer.append('\\'); outBuffer.append('n');
                           break;
                 case '\r':outBuffer.append('\\'); outBuffer.append('r');
                           break;
                 case '\f':outBuffer.append('\\'); outBuffer.append('f');
                           break;
                 case '=': // Fall through
                 case ':': // Fall through
                 case '#': // Fall through
                 case '!':
                     outBuffer.append('\\'); outBuffer.append(aChar);
                     break;
                 default:
                     if ((aChar < 0x0020) || (aChar > 0x007e)) {
                         outBuffer.append('\\');
                         outBuffer.append('u');
                         outBuffer.append(toHex((aChar >> 12) & 0xF));
                         outBuffer.append(toHex((aChar >>   8) & 0xF));
                         outBuffer.append(toHex((aChar >>   4) & 0xF));
                         outBuffer.append(toHex( aChar         & 0xF));
                     } else {
                         outBuffer.append(aChar);
                     }
             }
         }
         return outBuffer.toString();
     }
    
     /**
      * 从 Unicode 码转换成编码前的特殊字符串。
      * @param in Unicode编码的字符数组。
      * @param off 转换的起始偏移量。
      * @param len 转换的字符长度。
      * @param convtBuf 转换的缓存字符数组。
      * @return 完成转换,返回编码前的特殊字符串。
      */
     public String fromUnicode(char[] in, int off, int len, char[] convtBuf) {
         if (convtBuf.length < len) {
             int newLen = len * 2;
             if (newLen < 0) {
                 newLen = Integer.MAX_VALUE;
             }
             convtBuf = new char[newLen];
         }
         char aChar;
         char[] out = convtBuf;
         int outLen = 0;
         int end = off + len;

         while (off < end) {
             aChar = in[off++];
             if (aChar == '\\') {
                 aChar = in[off++];
                 if (aChar == 'u') {
                     // Read the xxxx
                     int value = 0;
                     for (int i = 0; i < 4; i++) {
                         aChar = in[off++];
                         switch (aChar) {
                         case '0':
                         case '1':
                         case '2':
                         case '3':
                         case '4':
                         case '5':
                         case '6':
                         case '7':
                         case '8':
                         case '9':
                             value = (value << 4) + aChar - '0';
                             break;
                         case 'a':
                         case 'b':
                         case 'c':
                         case 'd':
                         case 'e':
                         case 'f':
                             value = (value << 4) + 10 + aChar - 'a';
                             break;
                         case 'A':
                         case 'B':
                         case 'C':
                         case 'D':
                         case 'E':
                         case 'F':
                             value = (value << 4) + 10 + aChar - 'A';
                             break;
                         default:
                             throw new IllegalArgumentException(
                                     "Malformed \\uxxxx encoding.");
                         }
                     }
                     out[outLen++] = (char) value;
                 } else {
                     if (aChar == 't') {
                         aChar = '\t';
                     } else if (aChar == 'r') {
                         aChar = '\r';
                     } else if (aChar == 'n') {
                         aChar = '\n';
                     } else if (aChar == 'f') {
                         aChar = '\f';
                     }
                     out[outLen++] = aChar;
                 }
             } else {
                 out[outLen++] = (char) aChar;
             }
         }
         return new String(out, 0, outLen);
     }
}

时间: 2024-09-29 22:44:04

使用Java将中文字符转换成Unicode编码的相关文章

把中文字符转换成Utf8编码

编码|中文|转换 //--------把中文字符转换成Utf8编码------------------------// function EncodeUtf8(s1)  {      var s = escape(s1);      var sa = s.split("%");      var retV ="";      if(sa[0] != "")      {         retV = sa[0];      }      for(

php将中文字符转变成unicode编码方式

问题描述 php将中文字符转变成unicode编码方式 假设在PHP中: $test="select top(1) AGG_TABLE0.day,AGG_TABLE0.subNet,AGG_TABLE0.location,AGG_TABLE0.不支持中文relation,cast(100*pmHoPrepSucc /pmHoPrepAtt*(pmHoExeSucc/pmHoExeAtt) as decimal(18,2)) as 'eSrvcc不支持中文',cast(1...": 怎么

unicode编码转换:PHP将汉字转换成Unicode编码的函数

这是一个将汉字转换成Unicode编码的PHP函数,支持GBK和UTF8编码.function uni_decode ($uncode){$word = json_decode(preg_replace_callback('/(\d{5});/', create_function('$dec', 'return \'\\u\'.dechex($dec[1]);'), '"'.$uncode.'"'));return $word;}对 Unicode 转换为汉字function uni_

asp 过滤html 敏感字符转换成html编码函数

asp教程 过滤html 敏感字符转换成html编码函数 '本款函数是根据用户传入的参数然后一个个遍历再把html敏感字符转换成html编码形式,这样就过滤敏感html哦. function htmlencode2(str)     dim result     dim l     if isnull(str) then        htmlencode2=""        exit function     end if     l=len(str)     result=&qu

汉字转换成Unicode编码PHP程序

汉字转换成unicode方法  代码如下 复制代码 <?php //将utf8编码的汉字转换为unicode function htou($c){  $n = (ord($c[0]) & 0x1f) << 12;  $n = (ord($c[1]) & 0x3f) << 6;  $n = ord($c[2]) & 0x3f;  return $n; } //在代码中隐藏utf8格式的字符串 function my_utf8_unicode($str)

中文转换成Unicode编码和Unicode编码转换成中文,Java代码实现

  import java.util.Properties; public class Test { public static void main(String[] args) { String s = "简介"; String tt = gbEncoding(s); // String tt1 = "你好,我想给你说一个事情"; System.out.println(decodeUnicode("\\u7b80\\u4ecb")); // S

Java将简体中文转换成Unicode编码

public class ToUnicode { 07 08 /** 09 * main test methord 10 */ 11 public static void main(String[] args) { 12 // System.out.println(toUnicode("你好 世界!")); 13 } 14 15 /** 16 * A methord for Simple Chinese Lanuage to Unicode 17 * @param s Simple C

python将字符实体引用转换成 Unicode 字符

HTML Entities 的格式如:<,NCR 的格式如:< 或 <,均都表示"<" 字符. HTML 中规定了 Character entity references,在 "24.2.1 The list of characters" 列出了 HTML Entities 和 NCR 的对应关系,例如: <!ENTITY nbsp   CDATA " " -- no-break space = non-breaki

ios 字符转化-iOS 如何将一个字符转换成byte?最好能有代码

问题描述 iOS 如何将一个字符转换成byte?最好能有代码 比如 nssting* str = @"2"; 转化.... 解决方案 http://www.cnblogs.com/leipei2352/p/3722411.html 解决方案二: http://mobile.51cto.com/hot-404914.htm 解决方案三: NSString *str = @"2"; NSData *data = [str dataUsingEncoding:NSUTF8