0

0

Python使用Airflow实现自动化任务调度的构建方式【教程】

舞夢輝影

舞夢輝影

发布时间:2025-12-13 19:18:08

|

952人浏览过

|

来源于php中文网

原创

Airflow通过DAG文件定义任务调度,需满足文件命名、全局dag变量、必要导入等要求;用PythonOperator封装函数,设置依赖、重试、触发规则及敏感参数管理;支持本地调试与生产部署。

python使用airflow实现自动化任务调度的构建方式【教程】

用 Airflow 实现 Python 任务的自动化调度,核心是把业务逻辑封装成可被 Airflow 管理的 Operator,再通过 DAG 定义执行顺序、触发条件和重试策略。它不直接运行脚本,而是调度“任务实例”,靠 Scheduler 和 Executor 协同驱动。

定义一个基础 DAG 文件

DAG 是 Airflow 的调度蓝图,本质是一个 Python 文件(通常放在 dags/ 目录下),需满足几个硬性要求:

  • 文件名不能含空格或特殊字符,推荐小写加下划线(如 etl_daily_job.py
  • 必须包含一个全局变量 dag = DAG(...),且变量名固定为 dag
  • 需导入必要模块:from airflow import DAGfrom airflow.operators.python import PythonOperator
  • DAG 参数中 schedule_interval(新版推荐用 schedule)决定触发频率,支持 cron 表达式(如 "0 2 * * *" 表示每天凌晨2点)或 timedelta(如 timedelta(days=1)

用 PythonOperator 封装你的函数

这是最常用的方式,适合已有现成的 Python 函数。Airflow 会在任务运行时调用它,并自动传入上下文(**context):

  • 函数本身不能带括号调用,只写函数名(例如 task1 = PythonOperator(task_id='run_clean', python_callable=clean_data)
  • 若需传参,用 op_kwargs 字典(如 op_kwargs={"table": "users", "days_back": 7}),函数签名要匹配
  • 函数返回值默认被序列化进 XCom,供下游任务读取(用 context["ti"].xcom_pull(task_ids="upstream_task")
  • 避免在函数里写长时间阻塞操作(如 time.sleep(300)),应拆成多个短任务或改用 TimeDeltaSensor 等传感器

设置依赖关系与容错机制

任务不是孤立运行的,DAG 要明确谁先谁后、失败怎么处理:

Quinvio AI
Quinvio AI

AI辅助下快速创建视频,虚拟代言人

下载

立即学习Python免费学习笔记(深入)”;

  • >> 设置上下游(如 extract >> transform >> load),也可用 set_downstream() 方法
  • retries=3 指定失败后重试次数;retry_delay=timedelta(minutes=5) 控制重试间隔
  • trigger_rule="all_success"(默认)表示所有上游成功才运行;换成 "all_done" 可让任务无论上游成败都执行(适合清理类任务)
  • 敏感参数(如数据库密码)不要硬编码,用 Airflow Connections 或 Variables 管理,代码里通过 BaseHook.get_connection("my_db").password 获取

本地调试与部署要点

别等部署到生产才发现问题:

  • 启动 Webserver 和 Scheduler 后,在 UI 中点击 DAG 名称右侧的「Trigger DAG」手动测试一次
  • 用命令行快速验证语法:airflow dags list 看是否识别;airflow tasks list my_dag_id 查任务;airflow tasks test my_dag_id task_name 2024-01-01 模拟单次运行(不走调度器,纯本地执行)
  • 生产环境建议用 CeleryExecutor 或 KubernetesExecutor,避免默认的 SequentialExecutor 只能串行跑任务
  • DAG 文件修改后,Scheduler 默认 30 秒扫描一次 dags/ 目录,无需重启服务(但语法错误会导致 DAG 显示为「paused」并报红)

基本上就这些。Airflow 强大但不复杂,关键在把逻辑切分成职责清晰的小任务,再用 DAG 连起来。写完一个能跑通的最小 DAG,后面扩展就顺了。

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

769

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

661

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

764

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

639

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1305

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

549

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

579

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

709

2023.08.11

云朵浏览器入口合集
云朵浏览器入口合集

本专题整合了云朵浏览器入口合集,阅读专题下面的文章了解更多详细地址。

20

2026.01.20

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 9.5万人学习

Django 教程
Django 教程

共28课时 | 3.3万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号