0

0

如何在Golang中实现并发爬虫

P粉602998670

P粉602998670

发布时间:2025-10-27 22:03:01

|

980人浏览过

|

来源于php中文网

原创

答案是利用Goroutine和Channel实现并发爬虫。通过为每个URL创建Goroutine执行fetch函数,并使用Channel传递结果,实现高效并发抓取,提升爬虫性能。

如何在golang中实现并发爬虫

在Golang中实现并发爬虫,核心在于利用Goroutine和Channel高效发起网络请求并处理响应。Go语言天生适合并发编程,通过轻量级的Goroutine和通信机制Channel,可以轻松构建高性能的爬虫系统。

使用Goroutine发起并发请求

每个网页抓取任务可以封装为一个函数,用Goroutine并发执行。这样能同时处理多个URL,显著提升抓取速度。

示例:启动多个Goroutine抓取不同页面

func fetch(url string, ch chan string) {
    resp, err := http.Get(url)
    if err != nil {
        ch <- fmt.Sprintf("Error: %s", url)
        return
    }
    defer resp.Body.Close()
    ch <- fmt.Sprintf("Success: %s (status: %d)", url, resp.StatusCode)
}
<p>// 主函数中并发调用
urls := []string{"<a href="https://www.php.cn/link/b05edd78c294dcf6d960190bf5bde635">https://www.php.cn/link/b05edd78c294dcf6d960190bf5bde635</a>", "<a href="https://www.php.cn/link/4d2fe2e8601f7a8018594d98f28706f2">https://www.php.cn/link/4d2fe2e8601f7a8018594d98f28706f2</a>", ...}
ch := make(chan string, len(urls))
for _, url := range urls {
go fetch(url, ch)
}
for range urls {
fmt.Println(<-ch)
}</p>

用Channel控制并发数量

无限制地开启Goroutine可能导致目标服务器压力过大或本地资源耗尽。使用带缓冲的Channel作为信号量,可有效控制最大并发数。

立即学习go语言免费学习笔记(深入)”;

方法是创建一个容量固定的Channel,在每个任务开始前获取令牌,完成后释放。

VALL-E
VALL-E

VALL-E是一种用于文本到语音生成 (TTS) 的语言建模方法

下载
semaphore := make(chan struct{}, 10) // 最多10个并发
ch := make(chan string, len(urls))
<p>for _, url := range urls {
go func(u string) {
semaphore <- struct{}{} // 获取令牌
resp, err := http.Get(u)
result := ""
if err != nil {
result = "Failed"
} else {
result = fmt.Sprintf("Status: %d", resp.StatusCode)
resp.Body.Close()
}
ch <- result
<-semaphore // 释放令牌
}(url)
}</p>

结合Context管理超时与取消

网络请求应设置超时机制,避免长时间阻塞。使用context.WithTimeout可为请求设定最长等待时间。

将Context传入http.Get,能在超时后自动中断请求。

client := &http.Client{
    Timeout: 10 * time.Second,
}
<p>ctx, cancel := context.WithTimeout(context.Background(), 5*time.Second)
defer cancel()</p><p>req, _ := http.NewRequestWithContext(ctx, "GET", url, nil)
resp, err := client.Do(req)</p>

解析HTML与数据提取

抓取到页面内容后,常用goquery或直接使用net/html进行解析。goquery语法类似jQuery,更易上手。

示例:提取页面标题

doc, err := goquery.NewDocumentFromReader(resp.Body)
if err != nil {
    log.Fatal(err)
}
title := doc.Find("title").Text()
fmt.Println("Title:", title)

基本上就这些。合理使用Goroutine、Channel和Context,就能写出稳定高效的并发爬虫。注意遵守robots.txt,控制请求频率,避免对目标网站造成负担。并发爬虫虽强,也需文明使用。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

WorkBuddy
WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
golang如何定义变量
golang如何定义变量

golang定义变量的方法:1、声明变量并赋予初始值“var age int =值”;2、声明变量但不赋初始值“var age int”;3、使用短变量声明“age :=值”等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

211

2024.02.23

golang有哪些数据转换方法
golang有哪些数据转换方法

golang数据转换方法:1、类型转换操作符;2、类型断言;3、字符串和数字之间的转换;4、JSON序列化和反序列化;5、使用标准库进行数据转换;6、使用第三方库进行数据转换;7、自定义数据转换函数。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

247

2024.02.23

golang常用库有哪些
golang常用库有哪些

golang常用库有:1、标准库;2、字符串处理库;3、网络库;4、加密库;5、压缩库;6、xml和json解析库;7、日期和时间库;8、数据库操作库;9、文件操作库;10、图像处理库。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

357

2024.02.23

golang和python的区别是什么
golang和python的区别是什么

golang和python的区别是:1、golang是一种编译型语言,而python是一种解释型语言;2、golang天生支持并发编程,而python对并发与并行的支持相对较弱等等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

214

2024.03.05

golang是免费的吗
golang是免费的吗

golang是免费的。golang是google开发的一种静态强类型、编译型、并发型,并具有垃圾回收功能的开源编程语言,采用bsd开源协议。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

410

2024.05.21

golang结构体相关大全
golang结构体相关大全

本专题整合了golang结构体相关大全,想了解更多内容,请阅读专题下面的文章。

510

2025.06.09

golang相关判断方法
golang相关判断方法

本专题整合了golang相关判断方法,想了解更详细的相关内容,请阅读下面的文章。

201

2025.06.10

golang数组使用方法
golang数组使用方法

本专题整合了golang数组用法,想了解更多的相关内容,请阅读专题下面的文章。

1539

2025.06.17

chatgpt使用指南
chatgpt使用指南

本专题整合了chatgpt使用教程、新手使用说明等等相关内容,阅读专题下面的文章了解更多详细内容。

0

2026.03.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Go 教程
Go 教程

共32课时 | 6.3万人学习

Go语言实战之 GraphQL
Go语言实战之 GraphQL

共10课时 | 0.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号