python文本函数 python文本分析从入门到精通 _方法

python中isread函数么文件对象（open() 函数的返回值）提供了read()函数可以按字节或字符读取文件内容，到底是读取字节还是字符，取决于使用 open() 函数打开文件时，是否使用了 b 模式，如果使用了 b 模式，则每次读取一个字节；反之，则每次读取一个字符。
read() 函数的基本语法格式如下：
file.read([size])
其中，file 表示打开的文件对象；size 作为一个可选参数，用于指定要读取的字符个数，如果省略，则默认一次性读取所有内容。
【例 1】采用循环读取整个文件的内容。
# a.txt 文件内容为：C语言中文网
f = open("a.txt", 'r', True)
while True:
# 每次读取一个字符
ch = f.read(1)
# 如果没有读到数据，跳出循环
if not ch:
break
# 输出ch
print(ch, end='')
f.close()
运行结果为：
C语言中文网
上面程序采用循环依次读取每一个字符（因为程序没有使用 b 模式），每读取到一个字符，程序就输出该字符。
正如从上面程序所看到的，当程序读写完文件之后，推荐立即调用 close() 方法来关闭文件，这样可以避免资源泄露（后续章节会详细介绍 close() 函数）。
注意，在调用 read() 函数读取文件内容时，成功读取的前提是在 open() 函数中使用 r 或 r+ 的模式打开文件，否则（比如将上面程序中 open(）的打开模式改为 w），程序会抛出io.UnsupportedOperation异常：
Traceback (most recent call last):
File "C:\Users\mengma\Desktop\demo.py", line 4, in
ch = f.read(1)
io.UnsupportedOperation: not readable
【例 2】调用 read() 方法时不传入参数，该方法默认会读取全部文件内容。例如：
f = open("a.txt", 'r', True)
# 直接读取全部文件
print(f.read())
f.close()
运行结果为：
C语言中文网
read()函数抛出UnicodeDecodeError异常的解决方法
当使用 open() 函数打开文本文件时，默认会使用当前操作系统的字符集，比如 Windows 平台，open() 函数默认使用 GBK 字符集。因此，上面程序读取的 a.txt 也必须使用 GBK 字符集保存；否则，程序就会出现UnicodeDecodeError错误。
如果要读取的文件所使用的字符集和当前操作系统的字符集不匹配，则有两种解决方式：
使用二进制模式读?。缓笥?bytes 的 decode() 方法恢复成字符串。
利用 codecs 模块的 open() 函数来打开文件，该函数在打开文件时允许指定字符集。
例如，下面程序使用二进制模式来读取文本文件：
# 指定使用二进制方式读取文件内容，a.txt 以 utf-8 编码存储
f = open("a.txt", 'rb', True)
# 直接读取全部文件，并调用bytes的decode将字节内容恢复成字符串
print(f.read().decode('utf-8'))
f.close()
上面程序在调用 open() 函数时，传入了 rb 模式，这表明采用二进制模式读取文件，此时文件对象的 read() 方法返回的是 bytes 对象，程序可调用 bytes 对象的 decode() 方法将它恢复成字符串。由于此时读取的 a.txt 文件是以 UTF-8 的格式保存的，因此程序需要使用 decode() 方法恢复字符串时显式指定使用 UTF-8 字符集。
下面程序使用 codes 模块的 open() 函数来打开文件，此时可以显式指定字符集：
import codecs
# 指定使用utf-8 字符集读取文件内容
f = codecs.open("a.txt", 'r', 'utf-8', buffering=True)
while True:
# 每次读取一个字符
ch = f.read(1)
# 如果没有读取到数据，则跳出循环
if not ch : break
# 输出ch
print (ch, end='')
f.close()
上面程序在调用 open() 函数时显式指定使用 UTF-8 字符集，这样程序在读取文件内容时就完全没有问题了。

python文本函数 python文本分析从入门到精通

推荐阅读

张文宏|独家记录长假公卫大查房：组长张文宏很“心定”，专家也不“吵架”

oled|「数码晚报」努比亚 Z40 Pro 正式发布 3399元起

卡盟的提取卡密怎么用途

爱普生l4168打印机如何进行深度清洗？

论述如何培养良好的个性试论述教育教学中如何培养学生良好的思维品质心理学简答论述题，论述如何培养学生的品德

让我灵魂颤抖|让我灵魂颤抖（19）

5000以内最强游戏笔记本五千以内最好的笔记本电脑

西洋参是上火还是降火的

吃什么水果可以长高吃什么水果有助于长高

网络|被ddos攻击了怎么办，阿里云又太贵了

水煮蛋可以隔夜吃吗

广州花都南大旧货回收 2023广州南沙区年花回收点汇总

亚运会几年一次

有哪些没有整容过的美女明星？

孙悟空被装上紧箍咒后,还是齐天大圣吗？紧箍咒对猴哥来说,是好事还是坏事？

C语言课程设计|C语言课程设计——学生成绩管理系统

怎么运动瘦腿和屁股呢，怎么运动瘦腿和屁股呢图解

用户|荣耀V40极高配置的真实体验如何？看完这些真实评价你就懂了

一张白纸

申请确认劳动关系原因是什么