python全角半角互换的实现示例

python全角半角互换的实现示例

在自然语言处理过程中,全角、半角的的不一致会导致信息抽取不一致,因此需要统一。

有规律(不含空格):

全角字符unicode编码从65281~65374 (十六进制 0xFF01 ~ 0xFF5E)
半角字符unicode编码从33~126 (十六进制 0x21~ 0x7E)

特例:

空格比较特殊,全角为 12288(0x3000),半角为 32(0x20)

除空格外,全角/半角按unicode编码排序在顺序上是对应的(半角 + 0x7e= 全角),所以可以直接通过用+-法来处理非空格数据,对空格单独处理。

注:

1. 中文文字永远是全角,只有英文字母、数字键、符号键才有全角半角的概念,一个字母或数字占一个汉字的位置叫全角,占半个汉字的位置叫半角。

2. 引号在中英文、全半角情况下是不同的

示例 # 全角转半角 def strQ2B(ustring): ss = [] for s in ustring: rstring = "" for uchar in s: inside_code = ord(uchar) if inside_code == 12288: inside_code = 32 elif (inside_code >= 65281 and inside_code <= 65374): inside_code -= 65248 rstring += chr(inside_code) ss.append(rstring) return ''.join(ss) # 半转全角 def strB2Q(ustring): ss = [] for s in ustring: rstring = "" for uchar in s: inside_code = ord(uchar) if inside_code == 32: inside_code = 12288 elif (inside_code >= 33 and inside_code <= 126): inside_code += 65248 rstring += chr(inside_code) ss.append(rstring) return ''.join(ss) if __name__ == '__main__': b = strQ2B('王大AA') print(b) a = strB2Q("王大AB") print(a) 库函数说明

chr()函数用一个范围在range(256)内的(就是0~255)整数作参数,返回一个对应的字符。
unichr()跟它一样,只不过返回的是Unicode字符。

ord()函数是chr()函数(对于8位的ASCII字符串)或unichr()函数(对于Unicode对象)的配对函数,它以一个字符(长度为1的字符串)作为参数,返回对应的ASCII数值,或者Unicode数值。

到此这篇关于python 全角半角互换的实现示例的文章就介绍到这了,更多相关python 全角半角互换内容请搜索易知道(ezd.cc)以前的文章或继续浏览下面的相关文章希望大家以后多多支持易知道(ezd.cc)!

推荐阅读

    git设置编码|git语言设置

    git设置编码|git语言设置,,git设置编码点击cap4j搜索从git直接链接上拉代码。git语言设置Git是一个开源的分布式版本控制系统,可以有效、高

    wps如何去掉自动编码

    wps如何去掉自动编码,WPS教程,1.在word中,如何取消自动编号?一、Ctrl+Z法 大多数的Windows程序都支持“Undo”功能,即允许用户进行撤销操作

    unicode编码是什么

    unicode编码是什么,字符,字节,本文目录unicode编码是什么Unicode是什么unicode 编码utf8和unicode编码究竟是什么关系有何区别unicode不能

    java设置编码格式|javaweb设置编码格式

    java设置编码格式|javaweb设置编码格式,,javaweb设置编码格式从网页登录邮箱,打开你要看的邮件,右键点击右键内容,里边有一项时邮件编码,选你

    response设置编码|response设置参数

    response设置编码|response设置参数,,1. response设置参数选BRequest常用的方法:getParameter(String strTextName) 获取表单提交的信息.re

    excel编码设置|excel 设置编码

    excel编码设置|excel 设置编码,,excel 设置编码excel插入页码总共分为3步,可以在页面设置选项里自定义页脚样式,以下是具体步骤:进入表格页面