0

0

C++如何处理大文件读写?(内存映射与分块策略)

裘德小鎮的故事

裘德小鎮的故事

发布时间:2026-02-18 18:17:16

|

812人浏览过

|

来源于php中文网

原创

内存映射(mmap/mapviewoffile)比fread快2–5倍,但需满足随机访问、少修改、容忍缺页延迟;小文件或未优化io设置时反而更慢;须注意页对齐、跨平台释放差异及返回值校验。

c++如何处理大文件读写?(内存映射与分块策略)

内存映射比 fread 快,但不是所有场景都适用

直接用 mmap(Linux/macOS)或 CreateFileMapping(Windows)读大文件,本质是让内核把文件页“挂”进进程虚拟地址空间,避免用户态缓冲区拷贝。但前提是文件可随机访问、不频繁修改、且你愿意承担页面错误带来的延迟抖动。

  • 只读场景下,mmap + 指针偏移访问通常比循环 fread 快 2–5 倍;写入时若用 MAP_SHARED,脏页回写由内核异步完成,但崩溃可能丢数据
  • 小文件(mmap 启动开销反而更高;fread 配合 64KB–1MB 缓冲区更稳
  • Windows 上 CreateFileMapping 要求先用 CreateFile 打开文件,且 dwMaximumSizeHigh/Low 必须精确——传 0 会失败,得用 GetFileSize 先查大小

分块读写必须自己控制缓冲区边界

fread/fwrite 处理 GB 级文件时,系统默认 libc 缓冲(如 8KB)完全不够看,频繁 syscall 是性能杀手。关键不是“要不要分块”,而是“块大小和对齐怎么定”。

  • 推荐块大小设为 1MB(1024 * 1024),既避开大多数文件系统块大小(4KB/64KB),又适配 CPU cache line 和 TLB 容量
  • 读取时务必检查 fread 返回值:它可能少于请求字节数(EOF 或磁盘错误),不能假设“调用一次就读满”
  • 写入前用 fseek 定位时,若文件未提前 ftruncate 到目标长度,空洞区域在 Linux 上会填 0,在 Windows 上可能报错 Invalid argument

std::ifstream 在大文件上默认很慢,必须关同步

C++ 标准库流默认与 C stdio 同步(std::ios_base::sync_with_stdio(true)),每次 operator>> 都要锁 stdin/stdout,GB 文件可能慢 10 倍以上。

  • 开头加一句 std::ios_base::sync_with_stdio(false),再禁用 cin.tie(nullptr),能逼近 fread 性能
  • std::ifstream::read 仍走 libc 缓冲,别用 getline 或格式化输入(>>)解析二进制数据——它会逐字节扫描换行符,O(n) 变成 O(n²)
  • 若需按行处理文本大文件,改用 fgets + 自己管理缓冲区,或用 mmapstrchr 扫描,别信 std::getline 的“简洁”

跨平台 mmap 封装要注意页对齐和错误码

Linux 的 mmap 要求 offset 是页大小(getpagesize())整数倍;Windows 的 MapViewOfFile 要求 offset 是 64KB 对齐。硬写死 4096 会崩在 Windows 上。

立即学习C++免费学习笔记(深入)”;

  • Linux 下用 sysconf(_SC_PAGESIZE) 获取真实页大小;Windows 下用 GetSystemInfo(&si); si.dwAllocationGranularity(通常是 64KB)
  • mmap 失败返回 MAP_FAILED(即 (void*)-1),不是 nullptr;Windows 下 MapViewOfFile 失败才返回 nullptr
  • 释放时,Linux 用 munmap,Windows 用 UnmapViewOfFile + CloseHandle(两次调用),漏掉任意一个都会泄漏句柄或内存

真正卡住人的从来不是“选 mmap 还是 fread”,而是 mmap 的 offset 对齐、Windows 句柄生命周期、以及 fread 返回值校验——这些点错一个,程序就静默出错或内存暴涨。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
fgets在c语言中的用法
fgets在c语言中的用法

本专题整合了c语言中fgets用法介绍,阅读专题下面的文章了解更多详细内容。

17

2025.08.27

javascriptvoid(o)怎么解决
javascriptvoid(o)怎么解决

javascriptvoid(o)的解决办法:1、检查语法错误;2、确保正确的执行环境;3、检查其他代码的冲突;4、使用事件委托;5、使用其他绑定方式;6、检查外部资源等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

183

2023.11.23

java中void的含义
java中void的含义

本专题整合了Java中void的相关内容,阅读专题下面的文章了解更多详细内容。

115

2025.11.27

windows查看端口占用情况
windows查看端口占用情况

Windows端口可以认为是计算机与外界通讯交流的出入口。逻辑意义上的端口一般是指TCP/IP协议中的端口,端口号的范围从0到65535,比如用于浏览网页服务的80端口,用于FTP服务的21端口等等。怎么查看windows端口占用情况呢?php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1160

2023.07.26

查看端口占用情况windows
查看端口占用情况windows

端口占用是指与端口关联的软件占用端口而使得其他应用程序无法使用这些端口,端口占用问题是计算机系统编程领域的一个常见问题,端口占用的根本原因可能是操作系统的一些错误,服务器也可能会出现端口占用问题。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1150

2023.07.27

windows照片无法显示
windows照片无法显示

当我们尝试打开一张图片时,可能会出现一个错误提示,提示说"Windows照片查看器无法显示此图片,因为计算机上的可用内存不足",本专题为大家提供windows照片无法显示相关的文章,帮助大家解决该问题。

820

2023.08.01

windows查看端口被占用的情况
windows查看端口被占用的情况

windows查看端口被占用的情况的方法:1、使用Windows自带的资源监视器;2、使用命令提示符查看端口信息;3、使用任务管理器查看占用端口的进程。本专题为大家提供windows查看端口被占用的情况的相关的文章、下载、课程内容,供大家免费下载体验。

460

2023.08.02

windows无法访问共享电脑
windows无法访问共享电脑

在现代社会中,共享电脑是办公室和家庭的重要组成部分。然而,有时我们可能会遇到Windows无法访问共享电脑的问题。这个问题可能会导致数据无法共享,影响工作和生活的正常进行。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

2361

2023.08.08

pixiv网页版官网登录与阅读指南_pixiv官网直达入口与在线访问方法
pixiv网页版官网登录与阅读指南_pixiv官网直达入口与在线访问方法

本专题系统整理pixiv网页版官网入口及登录访问方式,涵盖官网登录页面直达路径、在线阅读入口及快速进入方法说明,帮助用户高效找到pixiv官方网站,实现便捷、安全的网页端浏览与账号登录体验。

561

2026.02.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
C# 教程
C# 教程

共94课时 | 9.7万人学习

C 教程
C 教程

共75课时 | 4.8万人学习

C++教程
C++教程

共115课时 | 18.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号