0

0

美团开源LongCat-Video支持高效长视频生成,迈出“世界模型”探索第一步

爱谁谁

爱谁谁

发布时间:2025-10-28 11:40:18

|

643人浏览过

|

来源于php中文网

原创

美团迈出通往“世界模型”的关键一步,旨在更高效地连接现实世界的“原子”与数字世界的“比特”。
美团开源longcat-video支持高效长视频生成,迈出“世界模型”探索第一步

▲美团LongCat团队发布并开源LongCat-Video视频生成模型,开启“世界模型”探索之路(资料图)

10月27日,美团旗下LongCat团队正式推出并开源其最新研发的LongCat-Video视频生成模型。该模型在文生视频和图生视频任务中均达到开源领域的SOTA(最先进)水平,同时通过原生支持视频续写任务的预训练机制,成功实现分钟级长度的高质量、连贯性视频生成,在跨帧时序一致性与物理运动合理性方面表现突出,显著提升了长视频生成的技术上限。

近年来,“世界模型”(World Model)因其具备理解、预测乃至重构真实世界运行规律的能力,被广泛视为通向下一代人工智能的核心路径。作为一种能够学习物理法则、时空动态及场景逻辑的智能系统,“世界模型”使AI获得对现实世界的深层认知能力。而视频生成技术正被视为构建此类模型的重要突破口——通过从大量视频数据中提炼几何结构、语义信息与物理规律,AI可在虚拟空间中模拟和推演真实世界的演变过程。

基于这一愿景,LongCat团队指出,此次发布的LongCat-Video正是迈向“世界模型”的首次实质性尝试。未来,该模型将有望应用于美团持续布局的自动驾驶、具身智能等需要深度环境交互的业务场景中,成为连接“比特世界”与“原子世界”的核心技术桥梁。

美团开源LongCat-Video支持高效长视频生成,迈出“世界模型”探索第一步

▲LongCat-Video实现视频推理速度提升至10.1倍,突破效率瓶颈(资料图)

根据技术文档披露,LongCat-Video基于Diffusion Transformer(DiT)架构打造,是一款多功能统一的视频生成基座模型。其创新性地利用“条件帧数量”作为任务区分信号:无条件帧时执行文本生成视频,输入1帧图像则进行图生视频,多帧历史序列则用于视频续写任务,无需额外微调或模块切换,真正实现了“文生—图生—续写”三大任务的一体化闭环。

尤为值得一提的是,得益于以视频续写为核心的预训练策略,该模型可稳定输出长达5分钟的连续视频内容,且在整个过程中保持画质稳定、动作流畅,有效避免了行业常见的色彩漂移、画面降级和动作断裂等问题,确保长时间序列下的视觉一致性和物理合理性,满足数字人、机器人仿真、世界模型训练等高要求应用场景的需求。

ToonMe
ToonMe

一款风靡Instagram的软件,一键生成卡通头像

下载

为应对长序列处理中的计算冗余问题,模型引入块稀疏注意力(BSA)与条件token缓存机制,在处理93帧以上的长视频时仍能维持高效推理与高质量输出,彻底打破“视频越长,质量越差”的技术困局。

针对高分辨率、高帧率带来的算力挑战,LongCat-Video采用“二阶段粗到精生成(C2F)+ 块稀疏注意力(BSA)+ 模型蒸馏”三重优化方案,使整体视频推理速度提升达10.1倍,在保证视觉表现力的同时实现极致效率平衡。

美团开源LongCat-Video支持高效长视频生成,迈出“世界模型”探索第一步

美团开源LongCat-Video支持高效长视频生成,迈出“世界模型”探索第一步

▲LongCat-Video在多项基础任务中达到开源SOTA水平(资料图)

据评估报告,LongCat-Video的性能测试涵盖内部基准与多个公开评测体系,重点考察Text-to-Video(文本生成视频)和Image-to-Video(图像生成视频)两大核心任务,并从文本对齐度、图像保真度、视觉质量、运动连贯性及整体观感等多个维度进行全面评估。结果显示:其136亿参数规模的基座模型在两项任务上均达到当前开源模型中的领先水平;尤其在文本匹配精度、动作自然性等关键指标上优势明显;在VBench等权威公开基准测试中,综合表现位居前列,展现出强大的泛化能力与实用性。

相关文章

美团
美团

美团app是一款吃喝玩乐一应俱全的生活服务类软件,汇集团购、美食、酒店、外卖、电影、美发、美甲、KTV等服务于一体,为用户提供非常便利且全面的服务,有需要的小伙伴快来保存下载体验吧!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
登录token无效
登录token无效

登录token无效解决方法:1、检查token的有效期限,如果token已经过期,需要重新获取一个新的token;2、检查token的签名,如果签名不正确,需要重新获取一个新的token;3、检查密钥的正确性,如果密钥不正确,需要重新获取一个新的token;4、使用HTTPS协议传输token,建议使用HTTPS协议进行传输 ;5、使用双因素认证,双因素认证可以提高账户的安全性。

6098

2023.09.14

登录token无效怎么办
登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容,供大家免费下载体验。

809

2023.09.14

token怎么获取
token怎么获取

获取token值的方法:1、小程序调用“wx.login()”获取 临时登录凭证code,并回传到开发者服务器;2、开发者服务器以code换取,用户唯一标识openid和会话密钥“session_key”。想了解更详细的内容,可以阅读本专题下面的文章。

1062

2023.12.21

token什么意思
token什么意思

token是一种用于表示用户权限、记录交易信息、支付虚拟货币的数字货币。可以用来在特定的网络上进行交易,用来购买或出售特定的虚拟货币,也可以用来支付特定的服务费用。想了解更多token什么意思的相关内容可以访问本专题下面的文章。

1261

2024.03.01

人工智能在生活中的应用
人工智能在生活中的应用

人工智能在生活中的应用有语音助手、无人驾驶、金融服务、医疗诊断、智能家居、智能推荐、自然语言处理和游戏设计等。本专题为大家提供人工智能相关的文章、下载、课程内容,供大家免费下载体验。

411

2023.08.17

人工智能的基本概念是什么
人工智能的基本概念是什么

人工智能的英文缩写为AI,是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学;该领域的研究包括机器人、语言识别、图像识别、自然语言处理和专家系统等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

305

2024.01.09

人工智能不能取代人类的原因是什么
人工智能不能取代人类的原因是什么

人工智能不能取代人类的原因包括情感与意识、创造力与想象力、伦理与道德、社会交往与沟通能力、灵活性与适应性、持续学习和自我提升等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

628

2024.09.10

Python 人工智能
Python 人工智能

本专题聚焦 Python 在人工智能与机器学习领域的核心应用,系统讲解数据预处理、特征工程、监督与无监督学习、模型训练与评估、超参数调优等关键知识。通过实战案例(如房价预测、图像分类、文本情感分析),帮助学习者全面掌握 Python 机器学习模型的构建与实战能力。

34

2025.10.21

PS使用蒙版相关教程
PS使用蒙版相关教程

本专题整合了ps使用蒙版相关教程,阅读专题下面的文章了解更多详细内容。

23

2026.01.19

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
麻省理工大佬Python课程
麻省理工大佬Python课程

共34课时 | 5.2万人学习

国外Web开发全栈课程全集
国外Web开发全栈课程全集

共12课时 | 1.0万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号