谷歌下场优化扩散模型，三星手机运行Stable Diffusion，12秒内出图

王林

发布时间：2023-04-28 08:19:14

1395人浏览过

来源于51CTO.COM

转载

Stable Diffusion 在图像生成领域的知名度不亚于对话大模型中的 ChatGPT。其能够在几十秒内为任何给定的输入文本创建逼真图像。由于 Stable Diffusion 的参数量超过 10 亿，并且由于设备上的计算和内存资源有限，因而这种模型主要运行在云端。

在没有精心设计和实施的情况下，在设备上运行这些模型可能会导致延迟增加，这是由于迭代降噪过程和内存消耗过多造成的。

如何在设备端运行 Stable Diffusion 引起了大家的研究兴趣，此前，有研究者开发了一个应用程序，该应用在 iPhone 14 Pro 上使用 Stable Diffusion 生成图片仅需一分钟，使用大约 2GiB 的应用内存。

此前苹果也对此做了一些优化，他们在 iPhone、iPad、Mac 等设备上，半分钟就能生成一张分辨率 512x512 的图像。高通紧随其后，在安卓手机端运行 Stable Diffusion v1.5 ，不到 15 秒生成分辨率 512x512 的图像。

近日，谷歌发表的一篇论文中《 Speed Is All You Need: On-Device Acceleration of Large Diffusion Models via GPU-Aware Optimizations 》，他们实现了在 GPU 驱动的设备上运行 Stable Diffusion 1.4 ，达到 SOTA 推理延迟性能（在三星 S23 Ultra 上，通过 20 次迭代生成 512 × 512 的图像仅需 11.5 秒）。此外，该研究不是只针对一种设备；相反，它是一种通用方法，适用于改进所有潜在扩散模型。

在没有数据连接或云服务器的情况下，这项研究为在手机上本地运行生成 AI 开辟了许多可能性。Stable Diffusion 去年秋天才发布，今天已经可以塞进设备运行，可见这个领域发展速度有多快。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

谷歌下场优化扩散模型，三星手机运行Stable Diffusion，12秒内出图

论文地址：https://arxiv.org/pdf/2304.11267.pdf

Khroma

AI调色盘生成工具

下载

为了达到这一生成速度，谷歌提出了一些优化建议，下面我们看看谷歌是如何优化的。

方法介绍

该研究旨在提出优化方法来提高大型扩散模型文生图的速度，其中针对 Stable Diffusion 提出一些优化建议，这些优化建议也适用于其他大型扩散模型。

首先来看一下 Stable Diffusion 的主要组成部分，包括：文本嵌入器（text embedder）、噪声生成（noise generation）、去噪神经网络（denoising neural network）和图像解码器（image decoder，如下图 1 所示。

谷歌下场优化扩散模型，三星手机运行Stable Diffusion，12秒内出图

然后我们具体看一下该研究提出的三种优化方法。

专用内核：Group Norm 和 GELU

组归一化（GN）方法的工作原理是将特征图的通道（channel）划分为更小的组，并独立地对每个组进行归一化，从而使 GN 对批大小的依赖性降低，更适合各种批大小和网络架构。该研究没有按顺序执行 reshape、取均值、求方差、归一化这些操作，而是设计了一个独特的 GPU shader 形式的内核，它可以在一个 GPU 命令中执行所有这些操作，而无需任何中间张量（tensor）。

高斯误差线性单元（GELU）作为常用的模型激活函数，包含大量数值计算，例如乘法、加法和高斯误差函数。该研究用一个专用的 shader 来整合这些数值计算及其伴随的 split 和乘法操作，使它们能够在单个 AI 作画调用中执行。

提高注意力模块的效率

Stable Diffusion 中的文本到图像 transformer 有助于对条件分布进行建模，这对于文本到图像生成任务至关重要。然而，由于内存复杂性和时间复杂度，自 / 交叉注意力机制在处理长序列时遇到了困难。基于此，该研究提出两种优化方法，以缓解计算瓶颈。

一方面，为了避免在大矩阵上执行整个 softmax 计算，该研究使用一个 GPU shader 来减少运算操作，大大减少了中间张量的内存占用和整体延迟，具体方法如下图 2 所示。

谷歌下场优化扩散模型，三星手机运行Stable Diffusion，12秒内出图

另一方面，该研究采用 FlashAttention [7] 这种 IO 感知的精确注意力算法，使得高带宽内存（HBM）的访问次数少于标准注意力机制，提高了整体效率。

Winograd 卷积

Winograd 卷积将卷积运算转换为一系列矩阵乘法。这种方法可以减少许多乘法运算，提高计算效率。但是，这样一来也会增加内存消耗和数字错误，特别是在使用较大的 tile 时。

Stable Diffusion 的主干在很大程度上依赖于 3×3 卷积层，尤其是在图像解码器中，它们占了 90% 。该研究对这一现象进行了深入分析，以探索在 3 × 3 内核卷积上使用不同 tile 大小的 Winograd 的潜在好处。研究发现 4 × 4 的 tile 大小最佳，因为它在计算效率和内存利用率之间提供了最佳平衡。

谷歌下场优化扩散模型，三星手机运行Stable Diffusion，12秒内出图

实验

该研究在各种设备上进行了基准测试：三星 S23 Ultra（Adreno 740）和 iPhone 14 Pro Max（A16）。基准测试结果如下表 1 所示：

谷歌下场优化扩散模型，三星手机运行Stable Diffusion，12秒内出图

很明显，随着每个优化被激活，延迟逐渐减少（可理解为生成图像时间减少）。具体而言，与基线相比：在三星 S23 Ultra 延迟减少 52.2%；iPhone 14 Pro Max 延迟减少 32.9%。此外，该研究还对三星 S23 Ultra 端到端延迟进行评估，在 20 个去噪迭代 step 内，生成 512 × 512 像素图像，不到 12 秒就达到 SOTA 结果。

小型设备可以运行自己的生成式人工智能模型，这对未来意味着什么？我们可以期待一波。

Perplexity免费版和Pro版区别_Perplexity付费订阅价值分析教程【对比】

OpenClaw启动时卡在加载界面怎么办_OpenClaw加载卡死常见原因与对策【教程】

OpenClaw最新版与旧版有什么区别_OpenClaw主要版本功能差异对比【汇总】

Perplexity Chrome插件怎么用_Perplexity浏览器扩展一键搜索教程【指南】

WorkBuddy技能包有哪些类型_常见Skills技能包分类与用途介绍

谷歌浏览器

谷歌浏览器Google Chrome是一款可让您更快速、轻松且安全地使用网络的浏览器。Google Chrome的设计超级简洁，使用起来得心应手。这里提供了谷歌浏览器纯净安装包，有需要的小伙伴快来保存下载体验吧！

下载

相关专题

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

276

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开，系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理，以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例，帮助开发者理解浏览器底层工作原理，并掌握提升网页加载速度与交互体验的实用技巧。

105

2026.03.06

Rust内存安全机制与所有权模型深度实践

本专题围绕 Rust 语言核心特性展开，深入讲解所有权机制、借用规则、生命周期管理以及智能指针等关键概念。通过系统级开发案例，分析内存安全保障原理与零成本抽象优势，并结合并发场景讲解 Send 与 Sync 特性实现机制。帮助开发者真正理解 Rust 的设计哲学，掌握在高性能与安全性并重场景中的工程实践能力。

230

2026.03.05

PHP高性能API设计与Laravel服务架构实践

本专题围绕 PHP 在现代 Web 后端开发中的高性能实践展开，重点讲解基于 Laravel 框架构建可扩展 API 服务的核心方法。内容涵盖路由与中间件机制、服务容器与依赖注入、接口版本管理、缓存策略设计以及队列异步处理方案。同时结合高并发场景，深入分析性能瓶颈定位与优化思路，帮助开发者构建稳定、高效、易维护的 PHP 后端服务体系。

619

2026.03.04