0

0

怎样用C++开发词频统计程序 文本分析与map容器应用

P粉602998670

P粉602998670

发布时间:2025-08-30 08:25:01

|

990人浏览过

|

来源于php中文网

原创

答案:C++利用map容器实现词频统计,通过stringstream分割单词,normalize函数统一大小写并去除标点,processText读取文本并统计,wordCount自动计数,最后printResults输出结果。

怎样用c++开发词频统计程序 文本分析与map容器应用

词频统计是文本分析中的基础任务,C++ 提供了强大的标准库支持,特别是 map 容器,非常适合用来统计每个单词出现的次数。下面介绍如何用 C++ 实现一个简单的词频统计程序。

读取文本并分割单词

程序的第一步是读取输入文本。可以从文件读取,也可以从标准输入获取。使用 std::stringstream 可以方便地按空格分割单词。

示例代码:

#include <iostream>
#include <fstream>
#include <sstream>
#include <string>
#include <map>
#include <cctype>

std::map<std::string, int> wordCount;

std::string normalize(const std::string& word) {
    std::string cleaned;
    for (char c : word) {
        if (std::isalpha(c)) {
            cleaned += std::tolower(c);
        }
    }
    return cleaned;
}

void processText(std::istream& in) {
    std::string line;
    while (std::getline(in, line)) {
        std::stringstream ss(line);
        std::string word;
        while (ss >> word) {
            std::string cleaned = normalize(word);
            if (!cleaned.empty()) {
                wordCount[cleaned]++;
            }
        }
    }
}

使用 map 统计词频

std::map<std::string, int> 会自动按键(单词)排序,并且每个键唯一。当插入一个已存在的单词时,map 会更新其对应的计数。

立即学习C++免费学习笔记(深入)”;

map 的 operator[] 在键不存在时会自动创建并初始化为 0,因此可以直接使用 wordCount[word]++ 进行累加。

Cardify卡片工坊
Cardify卡片工坊

使用Markdown一键生成精美的小红书知识卡片

下载

优点:

  • 自动去重和排序
  • 插入和查找平均时间复杂度为 O(log n)
  • 代码简洁,逻辑清晰

输出结果

遍历 map 并输出每个单词及其出现次数:

void printResults() {
    for (const auto& pair : wordCount) {
        std::cout << pair.first << ": " << pair.second << std::endl;
    }
}

如果想按频率从高到低排序,可以把 map 内容导入 vector,然后按值排序。

完整调用示例

主函数中可以选择从文件或标准输入读取:

int main() {
    std::ifstream file("input.txt");
    if (file.is_open()) {
        processText(file);
        file.close();
    } else {
        std::cout << "无法打开文件,使用标准输入:" << std::endl;
        processText(std::cin);
    }

    printResults();
    return 0;
}

基本上就这些。通过 map 容器,C++ 能高效、清晰地完成词频统计任务。处理时注意忽略标点、统一大小写,结果会更准确。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
string转int
string转int

在编程中,我们经常会遇到需要将字符串(str)转换为整数(int)的情况。这可能是因为我们需要对字符串进行数值计算,或者需要将用户输入的字符串转换为整数进行处理。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1051

2023.08.02

string转int
string转int

在编程中,我们经常会遇到需要将字符串(str)转换为整数(int)的情况。这可能是因为我们需要对字符串进行数值计算,或者需要将用户输入的字符串转换为整数进行处理。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1051

2023.08.02

int占多少字节
int占多少字节

int占4个字节,意味着一个int变量可以存储范围在-2,147,483,648到2,147,483,647之间的整数值,在某些情况下也可能是2个字节或8个字节,int是一种常用的数据类型,用于表示整数,需要根据具体情况选择合适的数据类型,以确保程序的正确性和性能。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

615

2024.08.29

c++怎么把double转成int
c++怎么把double转成int

本专题整合了 c++ double相关教程,阅读专题下面的文章了解更多详细内容。

335

2025.08.29

C++中int的含义
C++中int的含义

本专题整合了C++中int相关内容,阅读专题下面的文章了解更多详细内容。

235

2025.08.29

golang map内存释放
golang map内存释放

本专题整合了golang map内存相关教程,阅读专题下面的文章了解更多相关内容。

77

2025.09.05

golang map相关教程
golang map相关教程

本专题整合了golang map相关教程,阅读专题下面的文章了解更多详细内容。

40

2025.11.16

golang map原理
golang map原理

本专题整合了golang map相关内容,阅读专题下面的文章了解更多详细内容。

67

2025.11.17

TypeScript类型系统进阶与大型前端项目实践
TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开,深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析,帮助开发者构建类型安全、结构清晰、易维护的前端工程体系,提高团队协作效率与代码质量。

49

2026.03.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
C# 教程
C# 教程

共94课时 | 11.4万人学习

C 教程
C 教程

共75课时 | 5.5万人学习

C++教程
C++教程

共115课时 | 22万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号