Meta「分割一切」超进化版来了！IDEA领衔国内顶尖团队打造：检测、分割、生成一切，狂揽2k星

WBOY

发布时间：2023-04-13 14:40:03

2204人浏览过

来源于51CTO.COM

转载

Meta的「分割一切」模型横空出世后，已经让圈内人惊呼CV不存在了。

就在SAM发布后一天，国内团队在此基础上搞出了一个进化版本「Grounded-SAM」。

注：项目的logo是团队用Midjourney花了一个小时做的

Grounded-SAM把SAM和BLIP、Stable Diffusion集成在一起，将图片「分割」、「检测」和「生成」三种能力合一，成为最强Zero-Shot视觉应用。

网友纷纷表示，太卷了！

谷歌大脑的研究科学家、滑铁卢大学计算机科学助理教授Wenhu Chen表示「这也太快了」。

AI大佬沈向洋也向大家推荐了这一最新项目：

Grounded-Segment-Anything：自动检测、分割和生成任何有图像和文本输入的东西。边缘分割可以进一步改进。

截至目前，这个项目在GitHub上已经狂揽2k星。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

检测一切，分割一切，生成一切

上周，SAM的发布让CV迎来了GPT-3时刻。甚至，Meta AI声称这是史上首个图像分割基础模型。

该模型可以在统一的框架prompt encoder内，指定一个点、一个边界框、一句话，直接一键分割出任何物体。

SAM具有广泛的通用性，即具有了零样本迁移的能力，足以涵盖各种用例，不需要额外训练，就可以开箱即用地用于新的图像领域，无论是水下照片，还是细胞显微镜。

由此可见，SAM可以说是强到发指。

而现在，国内研究者基于这个模型想到了新的点子，将强大的零样本目标检测器Grounding DINO与之结合，便能通过文本输入，检测和分割一切。

借助Grounding DINO强大的零样本检测能力，Grounded SAM可以通过文本描述就可以找到图片中的任意物体，然后通过SAM强大的分割能力，细粒度的分割出mas。

最后，还可以利用Stable Diffusion对分割出来的区域做可控的文图生成。

再Grounded-SAM具体实践中，研究者将Segment-Anything与3个强大的零样本模型相结合，构建了一个自动标注系统的流程，并展示出非常非常令人印象深刻的结果！

这一项目结合了以下模型：

· BLIP：强大的图像标注模型

· Grounding DINO：最先进的零样本检测器

· Segment-Anything：强大的零样本分割模型

· Stable-Diffusion：出色的生成模型

所有的模型既可以组合使用，也可以独立使用。组建出强大的视觉工作流模型。整个工作流拥有了检测一切，分割一切，生成一切的能力。

该系统的功能包括：

BLIP+Grounded-SAM=自动标注器

使用BLIP模型生成标题，提取标签，并使用Ground-SAM生成框和掩码:

· 半自动标注系统：检测输入的文本，并提供精确的框标注和掩码标注。

· 全自动标注系统：

首先使用BLIP模型为输入图像生成可靠的标注，然后让Grounding DINO检测标注中的实体，接着使用SAM在其框提示上进行实例分割。

Stable Diffusion+Grounded-SAM=数据工厂

· 用作数据工厂生成新数据：可以使用扩散修复模型根据掩码生成新数据。

Segment Anything+HumanEditing

在这个分支中，作者使用Segment Anything来编辑人的头发/面部。

· SAM+头发编辑

· SAM+时尚编辑

AdsGo AI

全自动 AI 广告专家，助您在数分钟内完成广告搭建、优化及扩量

下载

作者对于Grounded-SAM模型提出了一些未来可能的研究方向：

自动生成图像以构建新的数据集；分割预训练的更强大的基础模型；与(Chat-)GPT模型的合作；一个完整的管道，用于自动标注图像（包括边界框和掩码），并生成新图像。

作者介绍

Grounded-SAM项目其中的一位研究者是清华大学计算机系的三年级博士生刘世隆。

他近日在GitHub上介绍了自己和团队一起做出的最新项目，并称目前还在完善中。

现在，刘世隆是粤港澳大湾区数字经济研究院（IDEA研究院），计算机视觉与机器人研究中心的实习生，由张磊教授指导，主要研究方向为目标检测，多模态学习。

在此之前，他于2020年获得了清华大学工业工程系的学士学位，并于2019年在旷视实习过一段时间。

个人主页：http://www.lsl.zone/

顺便提一句，刘世隆也是今年3月份发布的目标检测模型Grounding DINO的一作。

此外，他的4篇论文中了CVPR 2023，2篇论文被ICLR 2023接收，1篇论文被AAAI 2023接收。

论文地址：https://arxiv.org/pdf/2303.05499.pdf

而刘世隆提到的那位大佬——任天和，目前在IDEA研究院担任计算机视觉算法工程师，也由张磊教授指导，主要研究方向为目标检测和多模态。

此外，项目的合作者还有，中国科学院大学博士三年级学生黎昆昌，主要研究方向为视频理解和多模态学习；IDEA研究院计算机视觉与机器人研究中心实习生曹赫，主要研究方向为生成模型；以及阿里云高级算法工程师陈佳禹。

任天和、刘世隆

安装运行

项目需要安装python 3.8及以上版本，pytorch 1.7及以上版本和torchvision 0.8及以上版本。此外，作者强烈建议安装支持CUDA的PyTorch和TorchVision。

安装Segment Anything：

python -m pip install -e segment_anything

安装GroundingDINO：

python -m pip install -e GroundingDINO

安装diffusers：

pip install --upgrade diffusers[torch]

安装掩码后处理、以COCO格式保存掩码、example notebook和以ONNX格式导出模型所需的可选依赖。同时，项目还需要jupyter来运行example notebook。

pip install opencv-python pycocotools matplotlib onnxruntime onnx ipykernel

Grounding DINO演示

下载groundingdino检查点：

cd Grounded-Segment-Anything
wget https://github.com/IDEA-Research/GroundingDINO/releases/download/v0.1.0-alpha/groundingdino_swint_ogc.pth

运行demo：

export CUDA_VISIBLE_DEVICES=0
python grounding_dino_demo.py 
--config GroundingDINO/groundingdino/config/GroundingDINO_SwinT_OGC.py 
--grounded_checkpoint groundingdino_swint_ogc.pth 
--input_image assets/demo1.jpg 
--output_dir "outputs" 
--box_threshold 0.3 
--text_threshold 0.25 
--text_prompt "bear" 
--device "cuda"

模型预测可视化将保存在output_dir中，如下所示：

Grounded-Segment-Anything+BLIP演示

自动生成伪标签很简单：

1. 使用BLIP（或其他标注模型）来生成一个标注。

2. 从标注中提取标签，并使用ChatGPT来处理潜在的复杂句子。

3. 使用Grounded-Segment-Anything来生成框和掩码。

export CUDA_VISIBLE_DEVICES=0
python automatic_label_demo.py 
--config GroundingDINO/groundingdino/config/GroundingDINO_SwinT_OGC.py 
--grounded_checkpoint groundingdino_swint_ogc.pth 
--sam_checkpoint sam_vit_h_4b8939.pth 
--input_image assets/demo3.jpg 
--output_dir "outputs" 
--openai_key your_openai_key 
--box_threshold 0.25 
--text_threshold 0.2 
--iou_threshold 0.5 
--device "cuda"

伪标签和模型预测可视化将保存在output_dir中，如下所示：

Grounded-Segment-Anything+Inpainting演示

CUDA_VISIBLE_DEVICES=0
python grounded_sam_inpainting_demo.py 
--config GroundingDINO/groundingdino/config/GroundingDINO_SwinT_OGC.py 
--grounded_checkpoint groundingdino_swint_ogc.pth 
--sam_checkpoint sam_vit_h_4b8939.pth 
--input_image assets/inpaint_demo.jpg 
--output_dir "outputs" 
--box_threshold 0.3 
--text_threshold 0.25 
--det_prompt "bench" 
--inpaint_prompt "A sofa, high quality, detailed" 
--device "cuda"

Grounded-Segment-Anything+Inpainting Gradio APP

python gradio_app.py

作者在此提供了可视化网页，可以更方便的尝试各种例子。

网友评论

对于这个项目logo，还有个深层的含义：

一只坐在地上的马赛克风格的熊。坐在地面上是因为ground有地面的含义，然后分割后的图片可以认为是一种马赛克风格，而且马塞克谐音mask，之所以用熊作为logo主体，是因为作者主要示例的图片是熊。

看到Grounded-SAM后，网友表示，知道要来，但没想到来的这么快。

项目作者任天和称，「我们用的Zero-Shot检测器是目前来说最好的。」

未来，还会有web demo上线。

最后，作者表示，这个项目未来还可以基于生成模型做更多的拓展应用，例如多领域精细化编辑、高质量可信的数据工厂的构建等等。欢迎各个领域的人多多参与。

QClaw测试版和稳定版怎么选_QClaw版本选择建议【说明】

OpenClaw声音没有输出怎么办_OpenClaw音频无声故障快速排查【解答】

大模型到底是什么？教你快速掌握 LLM 的基本逻辑与分类

Minimax视频生成多场景转换提示词写法

WorkBuddy技能包加载慢怎么办_WorkBuddy性能优化与加速技巧

相关专题

chatgpt使用指南

本专题整合了chatgpt使用教程、新手使用说明等等相关内容，阅读专题下面的文章了解更多详细内容。

2026.03.16

chatgpt官网入口地址合集

本专题整合了chatgpt官网入口地址、使用教程等内容，阅读专题下面的文章了解更多详细内容。

2026.03.16

minimax入口地址汇总

本专题整合了minimax相关入口合集，阅读专题下面的文章了解更多详细地址。

2026.03.16

C++多线程并发控制与线程安全设计实践

本专题围绕 C++ 在高性能系统开发中的并发控制技术展开，系统讲解多线程编程模型与线程安全设计方法。内容包括互斥锁、读写锁、条件变量、原子操作以及线程池实现机制，同时结合实际案例分析并发竞争、死锁避免与性能优化策略。通过实践讲解，帮助开发者掌握构建稳定高效并发系统的关键技术。

2026.03.16

TypeScript类型系统进阶与大型前端项目实践

本专题围绕 TypeScript 在大型前端项目中的应用展开，深入讲解类型系统设计与工程化开发方法。内容包括泛型与高级类型、类型推断机制、声明文件编写、模块化结构设计以及代码规范管理。通过真实项目案例分析，帮助开发者构建类型安全、结构清晰、易维护的前端工程体系，提高团队协作效率与代码质量。

114

2026.03.13

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

141

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

396

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

111

2026.03.09

热门下载

网站特效

网站源码

网站素材

前端模板