Python爬虫初学之爬取段子

巴扎黑

发布时间：2017-06-23 16:28:58

1571人浏览过

来源于php中文网

原创

最近开始学Python的爬虫，是在这个博客跟着学习的，该博主用的是Python 2.7版本，而我使用的是3.5版本，很多不兼容的地方，不过没关系，自己改改就好了。

我们想针对网站的内容进行筛选，只获取自己感兴趣的部分。比如你想在xx网站把小黄图筛选出来，打包带走。这里只做简单的实现，以百思不得姐上的段子（纯文本）为例。我们想要实现如下功能：

批量下载若干页段子到本地文件中

按下任意一键，开始阅读下一条段子

1. 获取网页代码

导入urllib的相关库，Python 3中应该这样写：

import urllib.requestimport urllib.parseimport re

re库是正则表达式（Regular Expression），后面作匹配时会用到。

立即学习“Python免费学习笔记（深入）”；

百思不得姐的段子页面url ='http://www.budejie.com/text/1'，这里末尾数字1代表此为第一页。通过以下代码就能返回网页内容。

    req = urllib.request.Request(url)# 添加headers 使之看起来像浏览器在访问req.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 ' '(KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
    response = urllib.request.urlopen(req)# 得到网页内容，注意必须使用decode()解码html = response.read().decode('utf-8')

print(html)的话，就是如下所示的内容：

Python爬虫初学之爬取段子

这能看？段子呢？我们想要的段子呢？！

哦对了headers这样查看。

按F12，然后...看图吧

2. 正则匹配提取段子

要想筛选符合普通人阅读的内容（如果还带着html标签那还咋读是不），成功提取出段子，为此我们需要一些既定的模式去和网页全部内容进行匹配，将模式下匹配成功的对象返回。我们使用强大的正则表达式进行匹配（Regular Expression），相关语法可以看这里。

仅仅针对本例中的网页内容，先看看我们需要的段子对应了网页中的什么内容。

Python爬虫初学之爬取段子

可以看到段子被

(我们要的内容)

这样的标签所包围，只需要指定相应规则提取出来即可！上图可以看出段子正文前后是有很多空格的，需要匹配进去。

pattern = re.compile(r'\s+(.*)\s+')
result = re.findall(pattern, html)

通过re库的compile函数制定规则。

Picsart（video-editor）
Picsart旗下的视频编辑器。

下载

\s+可以匹配一个或更多的空格

.匹配除开换行符\n外的所有字符。

现在我们得到了匹配后的结果，来看下。

Python爬虫初学之爬取段子

Bingo！提取出来了不是？！

可是我们发现里面还有些讨厌的。没关系，写几行代码的事。这里就不再展示去掉后的内容，自行脑补哈哈。

    for each in content:# 如果某个段子里有
if '
' in each:# 替换成换行符并输出new_each = re.sub(r'
', '\n', each)print(new_each)# 没有就照常输出else:print(each)

这里content是我们通过re.findall()返回的列表。

至此，我们成功得到我们想看的段子了！如果想要下载到本地呢？

3. 下载段子到本地

通过定义一个save()函数即可，num参数用户自定，想下载最近100页的内容都没问题！里面还有些变量没有提到，最后会给出源代码。

# num是指定网页页数def save(num):# 写方式打开一个文本，把获取的段子列表存放进去with open('a.txt', 'w', encoding='utf-8') as f:
        text = get_content(num)# 和上面去掉
类似for each in text:if '
' in each:
                new_each = re.sub(r'
', '\n', each)
                f.write(new_each)else:
                f.write(str(each) + '\n')

下载到本地文档后如下图所示

Python爬虫初学之爬取段子

4. 逐条读取段子

段子太多，琳琅满目。可我们只希望一条条阅读。通过按下键盘任意键可以切换到下一条，直到读取到最后一条程序才结束，或者通过设置一个退出键随时退出程序，比如设定q键退出。这里把全部代码给出。

import urllib.requestimport urllib.parseimport re

pattern = re.compile(r'\s+(.*)\s+')# 返回指定网页的内容def open_url(url):
    req = urllib.request.Request(url)
    req.add_header('User-Agent', 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 ' '(KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
    response = urllib.request.urlopen(req)
    html = response.read().decode('utf-8')return html# num为用户自定，返回的是所有页的段子列表def get_content(num):# 存放段子的列表text_list = []for page in range(1, int(num)):
        address = 'http://www.budejie.com/text/' + str(page)
        html = open_url(address)
        result = re.findall(pattern, html)# 每一页的result都是一个列表，将里面的内容加入到text_listfor each in result:
            text_list.append(each)return text_list# num是指定网页页数def save(num):# 写方式打开一个文本，把获取的段子列表存放进去with open('a.txt', 'w', encoding='utf-8') as f:
        text = get_content(num)# 和上面去掉
类似for each in text:if '
' in each:
                new_each = re.sub(r'
', '\n', each)
                f.write(new_each)else:
                f.write(str(each) + '\n')                
                
if __name__ == '__main__':print('阅读过程中按q随时退出')
    number = int(input('想读几页的内容: '))
    content = get_content(number + 1)for each in content:if '
' in each:
            new_each = re.sub(r'
', '\n', each)print(new_each)else:print(each)# 用户输入user_input = input()# 不区分大小写的q，输入则退出if user_input == 'q' or user_input == 'Q':break

演示一下，效果是这样的。
Python爬虫初学之爬取段子

虽然功能很鸡肋，不过作为初学我还是很满意了，有兴趣才能深入下去嘛！爬虫可不仅仅如此而已，以后会学习更加高级的功能。

by @sunhaiyu

2016.8.15

python中截取字符串方法_切片、split、正则与partition全面解析

Python finally 块一定会执行吗

运算符优先级python_总结所有运算符优先级与结合性

Python 为什么不适合写 CPU 密集型程序

python怎么截取一个字符串中的数字_isdigit过滤与正则匹配方法

python速学教程(入门到精通)

python怎么学习？python怎么入门？python在哪学？python怎么学才快？不用担心，这里为大家提供了python速学教程(入门到精通)，有需要的小伙伴保存下载就能学习啦！

下载

相关专题

1688阿里巴巴货源平台入口与批发采购指南

本专题整理了1688阿里巴巴批发进货平台的最新入口地址与在线采购指南，帮助用户快速找到官方网站入口，了解如何进行批发采购、货源选择以及厂家直销等功能，提升采购效率与平台使用体验。

2026.02.06

快手网页版入口与电脑端使用指南快手官方短视频观看入口

本专题汇总了快手网页版的最新入口地址和电脑版使用方法，详细提供快手官网直接访问链接、网页端操作教程，以及如何无需下载安装直接观看短视频的方式，帮助用户轻松浏览和观看快手短视频内容。

2026.02.06

C# 多线程与异步编程

本专题深入讲解 C# 中多线程与异步编程的核心概念与实战技巧，包括线程池管理、Task 类的使用、async/await 异步编程模式、并发控制与线程同步、死锁与竞态条件的解决方案。通过实际项目，帮助开发者掌握如何在 C# 中构建高并发、低延迟的异步系统，提升应用性能和响应速度。

2026.02.06

Python 微服务架构与 FastAPI 框架

本专题系统讲解 Python 微服务架构设计与 FastAPI 框架应用，涵盖 FastAPI 的快速开发、路由与依赖注入、数据模型验证、API 文档自动生成、OAuth2 与 JWT 身份验证、异步支持、部署与扩展等。通过实际案例，帮助学习者掌握使用 FastAPI 构建高效、可扩展的微服务应用，提高服务响应速度与系统可维护性。

2026.02.06