Python中的字符串操作和编码Unicode详解

脚本专栏 2025/1/11 佚名

3 2 1

圆月山庄资源网 Design By www.vgjia.com

本文主要给大家介绍了关于 Python中的字符串操作和编码Unicode的一些知识，下面话不多说，需要的朋友们下面来一起学习吧。

字符串类型

str：Unicode字符串。采用''或者r''构造的字符串均为str，单引号可以用双引号或者三引号来代替。无论用哪种方式进行制定，在Python内部存储时没有区别。

bytes：二进制字符串。由于jpg等其他格式的文件不能用str进行显示，所以才用bytes来表示，bytes的每个字节为一个0-255的数字。如果打印的时候，Python会把能够用ASCII表示的部分显示为ASCII，这样方便阅读。bytes几乎支持除了格式化以外的所有str的方法，甚至包括了re模块

bytearray() ：二进制可原地变动的字符串。

utf-8编码范围

范围字节数存储格式 0x0000~0x007F (0 ~ 127) 1字节 0xxxxxxx 0x0080~0x07FF(128 ~ 2047) 2字节 110xxxxx 10xxxxxx 0x0800~FFFF(2048 ~ 65535) 3字节 1110xxxx 10xxxxxx 10xxxxxx 0x10000~1FFFFFF(65536 ~ 2097152) 4字节 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx 0x2000000~0x3FFFFFF 5字节 111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 0x4000000~0x7FFFFFFF) 6字节 1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx

字节顺序标记BOM

BOM是byte order marker的缩写，

指定编码写入时的规则

Python在使用'utf-8'编码写入文件时不会写入BOM头，但是如果指定编码'utf-8-sig'则会迫使Python写入一个BOM头。

使用'utf-16-be'不会写入一个BOM头，但是采用'utf-16'则会写入一个BOM头。

> open('h.txt','w',encoding='utf-8-sig').write('aaa')
3
> open('h.txt','rb').read()
b'\xef\xbb\xbfaaa'
> open('h.txt','w',encoding='utf-16').write('bbb')
3
> open('h.txt','rb').read()
b'\xff\xfeb\x00b\x00b\x00'
> open('hh.txt','w',encoding='utf-16-be').write('ccc')
3
> open('hh.txt','rb').read()
b'\x00c\x00c\x00c'
> open('h.txt','w',encoding='utf-8').write('ddd')
3
> open('h.txt','rb').read()
b'ddd'

读取时的规则

如果指定了正确的编码，那么BOM会忽略，否则BOM会显示为乱码或者返回异常。

> open('h.txt','r').read()
'锘縟dd'
> open('h.txt','r',encoding='utf-8-sig').read()
'ddd'

编码与解码

chr和ord

> ord('中') #20013
> chr(20013) #'中'

把Unicode硬编码进字符串中。

'\xhh'：用2位十六进制来表示一个字符

'\uhhhh'：用4位十六进制来表示一个字符：

'\Uhhhhhhhh'：用8位十六进制来表示一个字符

> s = 'py\x74h\u4e2don' #'pyth中on'

str和bytes， bytearray进行转换

str.encode(encoding='utf-8')

bytes(s,encoding='utf-8')

bytes.decode(encoding='utf-8')

str(B, encoding='utf-8')

bytearray(string, encoding='utf-8')

bytearray(bytes)

文档编码声明

Python默认使用utf-8编码。

# -*- coding: latin-1 -*- ：表示声明文档为latin-1编码。

帮助函数

sys.platform  #'win32'
sys.getdefaultencoding() # 'utf-8'
sys.byteorder  #'little'
s.isalnum()  #s表示字符串
s.isalpha()
s.isdecimal
s.isdigit()
s.isnumeric()
s.isprintable()
s.isspace()
s.isidentifier() #如果字符串可以用作变量名，那么返回True
s.islower()
s.isupper()
s.istitle()

总结

以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作能带来一定的帮助，如果有疑问大家可以留言交流。

python,unicode字符串,python中字符串操作,python,unicode,操作

标签：

python,unicode字符串,python中字符串操作,python,unicode,操作

圆月山庄资源网 Design By www.vgjia.com

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站文章均来自网站采集或用户投稿，网站不提供任何软件下载或自行开发的软件！如有用户或公司发现本站内容信息存在侵权行为，请邮件告知！ 858582#qq.com

圆月山庄资源网 Design By www.vgjia.com

评论“Python中的字符串操作和编码Unicode详解”

暂无评论...

www.vgjia.com 圆月山庄资源网

139,976互联网资源

144,792高清电影

21,817无损音乐

631,128技术资源

最新文章

转载一个别人收藏的精典网站Ruby,HIBERNATE

2025/1/11

可与Spreadsheets媲美的在线表格系统:EditG

2025/1/11

cygwin使用心得

2025/1/11

脚本的DVD开发

2025/1/11

局域网设置自动配置脚本文件的写法与用途

2025/1/11

一句话新闻

苹果官宣WWDC 2024！预计会有大批AI功能 - 2025/1/11

3月27日消息，苹果宣布2024年全球开发者大会（WWDC）将于6月10日至6月14日举行，巧合的是，这次大会与端午假期重合。

苹果官方表示：

在线参加 Apple 每年规模最大的开发者盛会。亲眼见证 Apple 最新平台、技术和工具的发布。了解如何创建和改进你的 App 和游戏。与 Apple 设计师和工程师互动交流，与全球开发者社区建立联系。以上活动均免费在线举行。

探索各种新的工具、框架和功能，助力你打造出理想的 App 和游戏。通过视频讲座学习新技能，与 Apple 专家进行一对一会面，以推进你的项目，完善你的构思。

Swift Student Challenge 旨在支持和鼓舞下一代开发者、创作者和企业家。太平洋时间 3 月 28 日，我们将公布今年的获奖者名单。获奖者将有资格参加在 Apple Park 举办的特别活动。我们还会选出 50 名杰出获胜者，他们将受邀前往库比提诺，获得为期三天的非凡体验，包括参加 Apple Park 的特别活动。

Python中的字符串操作和编码Unicode详解

python,unicode字符串,python中字符串操作,python,unicode,操作

python中实现迭代器（iterator）的方法示例

Python正则替换字符串函数re.sub用法示例

评论“Python中的字符串操作和编码Unicode详解”

RTX 5090要首发性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

Python中的字符串操作和编码Unicode详解

python,unicode字符串,python中字符串操作,python,unicode,操作

python中实现迭代器（iterator）的方法示例

Python正则替换字符串函数re.sub用法示例

评论“Python中的字符串操作和编码Unicode详解”

RTX 5090要首发 性能要翻倍！三星展示GDDR7显存

更新日志

友情链接

RTX 5090要首发性能要翻倍！三星展示GDDR7显存