软件科学-郝学胜头像
关注
Effective Python 条款 3:搞懂 bytes 与 str,别再被编码 BUG 折磨封面图

Effective Python 条款 3:搞懂 bytes 与 str,别再被编码 BUG 折磨

📖 出处:《Effective Python》第 3 条|了解 bytes 与 str 的区别
💡 阅读目标:彻底分清字节和字符串,避开 Python 编码解码的各种玄学报错

不知道写 Python 的你有没有遇到过这种崩溃时刻:
明明看着内容一模一样的两段文本,判断==却返回 False;
字符串拼接直接抛出TypeError;读取二进制文件突然蹦出UnicodeDecodeError;同样一段代码,在 Windows 跑正常,放到 Linux 直接炸锅😵。

绝大多数情况下,这些诡异的报错,根源都来自 **bytes**字节 和 **str**字符串 的混淆。很多新手甚至老开发都在这里踩坑,今天我们就把这两个 “长相相似但水火不容” 的类型讲明白。

Bilibili 同步视频

Effective Python 条款3:搞懂bytes与str,别再被编码BUG折磨

🔍 基础概念:bytes 和 str 到底是什么?

Python3 中将字符序列拆分成两种完全独立的类型:

  1. bytes****:原始 8 位字节序列
    bytes 存储的是机器看得懂的原始二进制 8 位无符号数字,打印时会以b'xxx'形式展示,大多对应 ASCII 原始字节。
a = b'hx65llo'
print(list(a))
print(a)

输出:

[104, 101, 108, 108, 111]
b'hello'

把它转列表,你看到的是每个字符对应的字节数字,这是计算机底层的原始数据。

  1. str****:Unicode 字符串(人类可读文本)
    str里面保存的是Unicode 码点,是专门给人类阅读的文本字符,支持全世界各国语言,汉字、拼音重音、emoji 都可以直接存。
a = 'au0300 propos'
print(list(a))
print(a)

输出:

['a', '`', ' ', 'p', 'r', 'o', 'p', 'o', 's']
à propos

✨重点划黑板:
strUnicode 文本本身没有绑定任何编码
bytes字节本身也不知道自己是什么编码

编码 encode / 解码 decode 是桥梁

  • str.encode(编码) → 把人类的 Unicode 字符串,编码成机器的bytes字节

  • bytes.decode(编码) → 把机器的原始字节,解码成人类可读的str字符串

编码解码必须手动指定编码(最常用 UTF‑8),千万不要无脑依赖系统默认编码,不同操作系统默认编码不一样,这就是跨平台 BUG 的元凶!

🥪 经典设计模式:Unicode 三明治(Unicode sandwich)

书中提出一个非常经典的工程实践方案 ——Unicode 三明治

🥪三明治结构:

  • 外层(面包):所有输入输出边界,做编码、解码。读网络、读文件、接收接口参数,立刻全部转成str;输出写入的时候,再编码成 bytes。

  • 内层(馅料):程序核心业务逻辑,全程只使用 str 类型的 Unicode 字符串,业务代码不要碰 bytes!

好处:

  1. 业务逻辑不用关心输入到底是 Latin‑1、Shift JIS、Big5 哪一种编码,全部统一转为 Unicode 处理;

  2. 对外输出统一使用 UTF‑8 编码,规避大量编码兼容问题;

  3. 从根源减少 bytes 和 str 混用带来的莫名其妙异常。

简单说:边界处理字节,业务只玩字符串。

🛠️ 写两个万能转换工具函数

现实开发中,接口、文件读取经常会拿到混合类型,一会 bytes 一会 str。与其到处写 if 判断,不如封装两个工具函数,保证输入输出类型可控。

to_str:不管输入是 bytes 还是 str,返回 str

def to_str(bytes_or_str):
    """统一转为Unicode字符串str"""
    if isinstance(bytes_or_str, bytes):
        value = bytes_or_str.decode("utf-8")
    else:
        value = bytes_or_str
    return value

print(repr(to_str(b'foo')))
print(repr(to_str('bar')))

输出

'foo'
'bar'

to_bytes:不管输入是 bytes 还是 str,返回 bytes

def to_bytes(bytes_or_str):
    """统一转为原始字节bytes"""
    if isinstance(bytes_or_str, str):
        value = bytes_or_str.encode("utf-8")
    else:
        value = bytes_or_str
    return value

print(repr(to_bytes(b'foo')))
print(repr(to_bytes('bar')))

输出

b'foo'
b'bar'

💡小提示:项目可以把这两个工具放到 common 公共工具模块,哪里需要直接调用,避免到处重复写编解码逻辑。

⚠️大坑一:bytes 和 str 不能混用!看着像,实际水火不容

很多人以为二者都是字符串,可以随便拼接、比较。大错特错!两者类型不兼容,很多操作直接报错,甚至静默出错。

1. 加法拼接 +

✅ bytes + bytes ✅ str + str
❌ bytes + str 直接抛异常

print(b'one' + b'two')   # b'onetwo'
print('one' + 'two')     # onetwo

# 下面两行全部报错!
# b'one' + 'two'
# 'one' + b'two'

执行会得到:TypeError: Can't concat str to bytes

2. 大小比较 > <

同类型可以比,跨类型直接报错

assert b'red' > b'blue'
assert 'red' > 'blue'

# 下面会报错
# assert 'red' > b'blue'

3. 相等判断 == 【最容易踩的隐形坑】

哪怕字面内容完全一样,bytes 和 str 互相比较永远 False!

print(b'foo' == 'foo')
# >>> False

这个不会抛异常,会悄悄返回 False,业务逻辑出错很难排查!

4. 格式化 % 占位符

  1. bytes 格式串,不能填 str
print(b'red %s' % b'blue') # ✔ b'red blue'
# print(b'red %s' % 'blue') # ❌报错,不知道用什么编码把str转字节
  1. str 格式串填 bytes 不会报错,但结果离谱!
print('red %s' % b'blue')
# 输出:red b'blue'

😱看到没有,输出直接带上了b''标记!
原理:Python 会调用 bytes 对象的__repr__(),打印对象的表示,而不是把字节解码成文本。这是静默 BUG,不会抛错,但是输出结果完全不符合预期。

✅总结:千万不要图省事 bytes 和 str 混着用,要么全部转 str,要么全部转 bytes。

⚠️大坑二:文件 open 模式,文本模式 vs 二进制模式

这是从 Python2 迁移过来的开发者高频踩坑点!
open()打开文件,模式分两大类:

  • 文本模式:r / ****w:读写str字符串,底层自动做编解码,会受系统默认编码影响

  • 二进制模式:rb / ****wb:读写原始bytes字节,不会做任何编解码

❌错误示范:文本模式写 bytes

with open("data.bin", "w") as f:
    f.write(b'xf1xf2xf3xf4xf5')

报错:TypeError: write() argument must be str, not bytes

“w” 是文本模式,只接受 str,字节数据请用wb

✅正确二进制写入

with open("data.bin", "wb") as f:
    f.write(b'xf1xf2xf3xf4xf5')

❌错误示范:用文本模式读取二进制文件

with open("data.bin", "r") as f:
    data = f.read()

报错 UnicodeDecodeError
r文本模式会拿系统默认编码(大多 UTF‑8)尝试把原始字节解码为字符串,而二进制数据根本不是合法 UTF‑8,直接解码失败。

✅正确二进制读取

with open("data.bin", "rb") as f:
    data = f.read()
assert data == b'xf1xf2xf3xf4xf5'

💡重要小技巧:文本模式务必显式指定 encoding

如果你操作的是文本文件,不要依赖操作系统默认编码!
不同平台默认编码不一样,可以用这条命令查看本机默认编码:

python3 -c 'import locale; print(locale.getpreferredencoding())'

打开文件的时候,把encoding参数写死,彻底消除跨平台差异:

# cp1252 老Windows编码示例
with open("data.bin", "r", encoding="cp1252") as f:
    data = f.read()

📝记住:
读写图片、压缩包、音频、原始二进制文件:rb/wb
读写 txt、csv 等文本文件:r/w,务必带上encoding="utf-8"

📝本篇要点总结(摘抄原书精华)

  1. bytes存储 8 位原始字节序列;str存储 Unicode 码点人类文本。

  2. 建议封装转换工具函数,保证输入类型可控,践行 Unicode 三明治原则:边界做编解码,业务内部只用 str。

  3. bytes 与 str 不能混用+>==%等运算符,混用要么报错,要么产生看不见的逻辑 bug。

  4. 读写二进制文件,使用rb/wb二进制打开模式。

  5. 读写文本文件,不要相信系统默认编码,open 函数显式传入encoding参数。

✍️写在最后

编码问题一直是 Python 里面很玄学的一块,很多人遇到报错就乱加.encode().decode()瞎试。
读完这篇希望大家记住核心逻辑:分清什么是字节,什么是文本,把编解码收敛在程序出入口,业务逻辑远离原始字节,就可以避开 90% 编码相关的坑。

后续继续更新 Effective Python 系列其他条款,欢迎一起交流踩坑经验~

Effective Python 条款 3:搞懂 bytes 与 str,别再被编码 BUG 折磨😭

这篇博客可以直接用于技术平台发布,工作任务模式还能帮你补充目录、文章标签、摘要以及拓展练习题,要不要使用?

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/2503_92624912/article/details/164107899

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--