0

0

Python中如何操作内存映射文件?内存映射有哪些优缺点?

穿越時空

穿越時空

发布时间:2025-06-27 20:54:02

|

451人浏览过

|

来源于php中文网

原创

python 使用 mmap 模块通过内存映射文件实现高效文件操作。1. 创建或打开文件并获取文件描述符;2. 使用 mmap.mmap() 函数将文件映射到进程的虚拟地址空间,参数包括 fileno(文件描述符)、length(映射长度)和 access(访问模式);3. 像操作字节数组一样直接读写内容,支持索引、readline()、seek() 等方法;4. 完成后关闭 mmap 对象以释放资源。内存映射的优势在于避免内核与用户空间的数据拷贝,提升 i/o 效率,简化代码结构,并支持多进程共享文件数据。但需注意同步问题、文件大小限制及平台差异。相比传统 read/write 系统调用,内存映射减少了上下文切换和数据复制次数,尤其适用于大型数据库、日志处理、图像处理等需要频繁访问大文件的场景。例如,结合正则表达式可高效统计大型文本文件中单词出现的次数,且无需逐行读取。

Python中如何操作内存映射文件?内存映射有哪些优缺点?

内存映射文件,简单来说,就是把文件的一部分或者全部映射到进程的虚拟地址空间。这样,你就可以像访问内存一样访问文件,而不用像传统的文件I/O那样,需要read/write 系统调用。Python 提供了 mmap 模块来操作内存映射文件。

Python中如何操作内存映射文件?内存映射有哪些优缺点?
import mmap

# 创建一个文件 (或者打开一个已存在的文件)
with open("test.txt", "wb") as f:
    f.write(b"Hello, memory map!")

# 打开文件,并创建一个内存映射
with open("test.txt", "rb+") as f:
    mm = mmap.mmap(f.fileno(), length=0, access=mmap.ACCESS_WRITE)

    # 打印当前内容
    print(mm.readline())

    # 修改内容
    mm[0:5] = b"World"

    # 回到起始位置
    mm.seek(0)
    print(mm.readline())

    # 关闭内存映射
    mm.close()

Python 如何使用 mmap 模块?

Python中如何操作内存映射文件?内存映射有哪些优缺点?

mmap 模块的核心在于 mmap() 函数。它接受几个关键参数:

立即学习Python免费学习笔记(深入)”;

Python中如何操作内存映射文件?内存映射有哪些优缺点?
  • fileno: 文件的文件描述符,可以通过 file.fileno() 获取。
  • length: 映射的长度,默认为 0,表示映射整个文件。
  • access: 访问模式,例如 mmap.ACCESS_READ (只读), mmap.ACCESS_WRITE (读写), mmap.ACCESS_COPY (写时复制)。

一旦创建了 mmap 对象,你就可以像操作字节数组一样操作它。你可以使用索引来访问和修改内容,也可以使用 readline(), seek(), tell() 等方法。

内存映射的优势是什么?

  • 效率: 避免了内核空间和用户空间之间的数据拷贝,提高了 I/O 效率。特别是对于大文件,可以显著减少系统调用的次数。
  • 简单: 可以像访问内存一样访问文件,代码更简洁。
  • 共享: 多个进程可以同时映射同一个文件,实现进程间通信。

当然,它也有缺点:

Sesame AI
Sesame AI

一款开创性的语音AI伴侣,具备先进的自然对话能力和独特个性。

下载
  • 同步: 需要注意多进程访问时的同步问题。
  • 文件大小: 映射长度受到文件大小的限制。
  • 平台依赖: 不同操作系统对内存映射的实现可能有所差异。

内存映射与传统文件 I/O 的区别?

传统文件 I/O (例如 read()/write()) 需要进行系统调用,将数据从内核缓冲区复制到用户空间缓冲区,反之亦然。这个过程涉及上下文切换,开销比较大。

内存映射则直接将文件内容映射到进程的虚拟地址空间,避免了数据拷贝。进程可以直接访问映射的内存区域,而不需要系统调用。

举个例子,假设你要读取一个 1GB 的文件。使用传统 I/O,你可能需要多次调用 read(),每次读取一小部分数据。而使用内存映射,你可以一次性将整个文件映射到内存,然后像访问一个大数组一样访问它。

内存映射在哪些场景下特别有用?

  • 大型数据库: 数据库系统经常使用内存映射来访问数据文件,提高性能。
  • 共享内存: 多个进程需要共享数据时,可以使用内存映射来实现。
  • 日志处理: 快速读取和分析大型日志文件。
  • 图像处理: 处理大型图像文件,避免频繁的 I/O 操作。

例如,你可以使用内存映射来快速统计一个大型文本文件中某个单词出现的次数。

import mmap
import re

def count_word(filename, word):
    with open(filename, "r") as f:
        with mmap.mmap(f.fileno(), 0, access=mmap.ACCESS_READ) as mm:
            count = 0
            for match in re.finditer(word.encode('utf-8'), mm):
                count += 1
            return count

filename = "large_text_file.txt"
word = "example"
count = count_word(filename, word)
print(f"The word '{word}' appears {count} times in {filename}")

这个例子展示了如何使用 mmap 和正则表达式来快速查找大型文件中的单词。注意,我们需要将单词编码为字节串,因为 mmap 对象返回的是字节。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
js正则表达式
js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法,还有更多js正则表达式的相关文章、相关下载、相关课程,供大家免费下载体验。

530

2023.06.20

正则表达式不包含
正则表达式不包含

正则表达式,又称规则表达式,,是一种文本模式,包括普通字符和特殊字符,是计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列匹配某个句法规则的字符串,通常被用来检索、替换那些符合某个模式的文本。php中文网给大家带来了有关正则表达式的相关教程以及文章,希望对大家能有所帮助。

258

2023.07.05

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

766

2023.07.05

java正则表达式匹配字符串
java正则表达式匹配字符串

在Java中,我们可以使用正则表达式来匹配字符串。本专题为大家带来java正则表达式匹配字符串的相关内容,帮助大家解决问题。

219

2023.08.11

正则表达式空格
正则表达式空格

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。本专题为大家提供正则表达式相关的文章、下载、课程内容,供大家免费下载体验。

356

2023.08.31

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

正则表达式空格如何表示
正则表达式空格如何表示

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。想了解更多正则表达式空格怎么表示的内容,可以访问下面的文章。

244

2023.11.17

正则表达式中如何匹配数字
正则表达式中如何匹配数字

正则表达式中可以通过匹配单个数字、匹配多个数字、匹配固定长度的数字、匹配整数和小数、匹配负数和匹配科学计数法表示的数字的方法匹配数字。更多关于正则表达式的相关知识详情请看本专题下面的文章。php中文网欢迎大家前来学习。

547

2023.12.06

C# ASP.NET Core微服务架构与API网关实践
C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开,系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例,帮助开发者掌握构建高可用微服务系统的关键技术,提高系统的可扩展性与维护效率。

3

2026.03.11

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.5万人学习

Django 教程
Django 教程

共28课时 | 4.9万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号