微信公众号搜"智元新知"关注
微信扫一扫可直接关注哦!

Java UTF-8到ASCII转换与补充

我们接受UTF-8字符串中的各种国家字符输入,我们需要将它们转换成输出的ASCII字符串以供一些遗留使用. (我们不接受中国和日本的字符,只有欧洲语言)

我们有一个小的实用程序来摆脱所有的变音符号:

public static final String toBaseCharacters(final String sText) {
    if (sText == null || sText.length() == 0)
        return sText;

    final char[] chars = sText.tochararray();
    final int iSize = chars.length;
    final StringBuilder sb = new StringBuilder(iSize);

    for (int i = 0; i < iSize; i++) {
        String sLetter = new String(new char[] { chars[i] });
        sLetter = normalizer.normalize(sLetter,normalizer.Form.NFC);

        try {
            byte[] bLetter = sLetter.getBytes("UTF-8");
            sb.append((char) bLetter[0]);
        } catch (UnsupportedEncodingException e) {
        }
    }
    return sb.toString();
}

问题是如何替代所有德国锋利(ß,Đ,đ)和其他通过上述标准化方法的字符,其补充(在ß的情况下,补充可能是“ss”,如果odĐ补充将是“D”或“Dj”).

有没有一些简单的方法来做,没有百万的.replaceAll()调用

所以例如:Đonardan= Djonardan,Blaß= Blass等等.

我们可以用空格替换所有“有问题的”字符,但是要避免这样做,使输出与输入尽可能相似.

谢谢你的答案,

博佐

解决方法

Is there some simple way to do it,without million of .replaceAll() calls?

如果你只是支持欧洲,拉丁语的语言,大约100左右就够了这绝对可行:抓住Latin-1 SupplementLatin Extended-AUnicode charts,并开始String.replace派对.

原文地址:https://www.jb51.cc/java/123502.html

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。

相关推荐