腾讯版Sora开源后被提速8倍!官方点赞并预告:下月上新图生视频
csdh11 2025-01-01 19:09 18 浏览
提速8倍!
速度更快、效果更好的混元视频模型——FastHunyuan来了!
新模型仅用1分钟就能生成5秒长的视频,比之前提速8倍,步骤也从50步减少到了6步,甚至画面细节也更逼真了。
和普通速度的混元对比一下,原来50步才能生成1条视频,而现在新模型在相同的时间里可以生成8条
再来看看和Sora的画面对比,可以看到Fast-Hunyuan和Sora两者的效果都更逼真一些,衣服、水果和山峰的细节也非常清晰。
甚至在一些物理细节的理解上,Fast-Hunyuan比Sora还强,比如下面拿取柠檬的视频:
更重要的是,Fast-Hunyuan的代码也开源了,这下不用为Sora的订阅费和限额发愁了。
研究团队来自加州大学圣地亚哥分校(UCSD)的Hao AI实验室,他们主要专注机器学习算法和分布式系统的研究。
混元官方账号还特意发博感谢了他们:
有网友看完后直呼,混元才是最好的开源视频模型。
开创性的视频DiT蒸馏配方
团队是如何做到8倍提速的情况下还能提升视频清晰度呢?
下面就一起来看一下Fast-Hunyuan的技术原理——
首先,他们开发了全新的视频DiT蒸馏配方。
具体来说,他们的蒸馏配方基于阶段一致性(Phased Consistency Model, PCM)模型。
在尝试使用多阶段蒸馏后发现效果没有显著改进,最终他们选择保持单阶段设置,与原始PCM模型的配置相似。
其次,团队使用了OpenSoraPlan中的MixKit数据集进行了蒸馏。
为了避免在训练过程中运行文本编码器和VAE,团队还预处理了所有数据,用来生成文本嵌入和VAE潜在变量。
在推理阶段,用户可以通过FSDP、序列并行和选择性激活检查点进行可扩展训练,模型可以近乎线性扩展到64个GPU。测试代码在Python 3.10.0、CUDA 12.1和H100上运行。
官方推荐使用80GB内存的GPU,不同模型有相应的下载权重和推理命令。
最低硬件要求如下:
- 40 GB GPU 内存,每个 GPU 配备 lora
- 30 GB GPU 内存,每 2 个 GPU 配备 CPU 卸载和 LoRa。
在模型微调方面,Fast-Hunyuan提供了全微调(需准备符合格式的数据,提供了一些可下载的预处理数据及对应命令)和LoRA 微调(即将上线)两种方式。
此外,他们还结合了预计算潜变量和预计算文本嵌入,用户可以根据自己的硬件条件选择不同的微调方式来执行命令,也支持图像和视频的混合微调。
模型已于2024年12月17日发布了v0.1版本。
未来的开发计划还包括添加更多蒸馏方法(如分布匹配蒸馏)、支持更多模型(如CogvideoX模型)以及代码更新(如fp8支持、更快的加载和保存模型支持)等等。
One More Thing
除了加速模型,混元还预告了大家都非常期待的图像到视频生成功能。
最快1月份,也就是下个月就可以看到!期待住了。
GitHub:https://github.com/hao-ai-lab/FastVideo
HuggingFace:https://huggingface.co/FastVideo/FastHunyuan
参考链接:
[1]https://x.com/TXhunyuan/status/1869282002786292097
— 完 —
量子位 QbitAI · 头条号签约
关注我们,第一时间获知前沿科技动态
相关推荐
- 知名软件变“木马”:2小时感染10万电脑
-
近日,腾讯电脑管家监测发现,一款通过“驱动人生”升级通道,并同时利用“永恒之蓝”高危漏洞传播的木马突然爆发,仅2个小时受攻击用户就高达10万。腾讯电脑管家可精准拦截该病毒攻击,管家团队也将持续跟踪该款...
- 腾讯电脑管家发布病毒预警:“驱动人生木马”爆发,2小时感染10万台电脑
-
新华网天津12月15日电(记者周润健)腾讯电脑管家15日紧急发布病毒预警,14日下午,腾讯电脑管家监测发现,一款通过“驱动人生”升级通道,并同时利用“永恒之蓝”高危漏洞传播的木马突然爆发,仅2个小时受...
- 全新“撒旦”勒索病毒来袭 瑞星推出独家解密工具
-
新华社北京7月26日电瑞星威胁情报平台近日发现多起国内用户感染“撒旦”勒索病毒事件。据瑞星安全研究人员介绍,该病毒运行后会加密受害者计算机文件,加密完成后会用中英韩三国语言索取1个比特币作为赎金,并...
- 新勒索病毒“WannaCry”疯狂来袭 乌克兰副总理电脑中招
-
据外媒报道,从6月27日开始,一种新勒索病毒再次疯狂来袭,已席卷欧洲多个国家,连乌克兰副总理的电脑都已中招。报道称,这轮病毒足以与五月席卷全球的勒索病毒“WannaCry”的攻击性相提并论。该病毒代号...
- 蠕虫病毒利用“永恒之蓝”漏洞传播 单位局域网受威胁最大
-
日前,火绒安全团队通过“火绒威胁情报系统”发现蠕虫病毒“Worm/Sharp”正在全网传播,其中在政府、企业、学校、医院等单位的局域网具有非常强的传播能力。该病毒通过“永恒之蓝”漏洞、多个电脑常用端口...
- 新病毒爆发:利用“永恒之蓝”传播,2小时感染10万台电脑挖矿
-
驱动人生发布的声明。据腾讯安全专家介绍,通过追溯病毒传播链发现,该病毒自12月14日约14点,利用“驱动人生”、“人生日历”等软件最早开始传播,另有约30%的传播通过“永恒之蓝”漏洞在局域网内进行主动...
- 逍遥安卓模拟器定制手游电脑版 手机电脑账号完全互通
-
从今年起大量回合制端游转向手游方向,无论是《梦幻西游》、《大话西游》、《神武》还是刚刚发行的《问道》手游,都是非常重度需要大量时间来做任务挂机升级的游戏。很多人习惯了端游的时候一个电脑可以多开的玩法,...
- 安卓模拟器绿色U盘移动版 公司玩游戏无痕迹
-
安卓模拟器已经不稀奇了!随着安卓手游的盛行,特别是《梦幻西游手游》之类的重度手游发布,玩手游花的时间也越来越多。用手机玩这些游戏存在着屏幕小、点量少、费流量还有容易被电话打断,在电脑上用安卓模拟器玩游...
- 苹果推出 iCloud 照片和视频转移服务:可转移至谷歌相册
-
IT之家3月4日消息据MacRumors今日报道,苹果公司本周推出了一项新服务,帮助iCloud用户方便快捷的将其存储的照片和视频转移到谷歌照片上。苹果在其支持文档中表示,用户可以登...
- NAS PK台,4核带m.2的威联通TS-264C vs 双核TS-462C
-
因为618年中大促看到威联通TS-264C和TS-462C这两机型售价差不多,就做个比较以供参考。毕竟作为自2007年以来就一直卖威联通的NAS老油来说,对威联通各NAS机型的识别还是相当全面的,对不...
- 前端学AI(七):构造 RAG 系统评估测试数据集
-
引言在基于DeepSeek+Chroma+LangChain开发一个简单RAG系统...
- 惨重教训!调查显示挪威“英斯塔”号宙斯盾舰撞油轮后本不必“丧命”
-
最新公布的调查报告显示,挪威皇家海军“英斯塔”号护卫舰2018年11月与油轮相撞后,如果其舰员接受了更好的损管训练,并且对舰艇的稳定特性更加熟悉的话,这艘宙斯盾型战舰本来是可以挽救的。↑挪威“英斯塔”...
- 「必买」盘点2021年男人们的败家清单,越“败”越香
-
心里总想买点啥?看看《必买》,全网最有料的场景种草指南。草原割不尽,春风吹又生。在过去的2021年,不断被各种数码产品种草,一直在买买买,剁手不停。大部分产品都经过详细的对比做足了功课,也有部分是一时...
- 实现浏览器播放rtsp视频流的解决方案
-
有同学问道:需要实时播放摄像头rtsp视频流,而浏览器不能直接播放,怎样解决?实现这个需求可以通过插件或者转码来实现。要实现这个目的,可以采用的方案非常得多,有商业的也有开源的,这里主要列举一些开源的...
- ISO9000你知道多少?
-
1ISO9000族标准是什么?ISO9000族标准是指由国际标准化质量管理和质量保证技术委员会(ISO/TC176)制订的所有国际标准。ISO9000族标准可帮助各种类型和规模的组织实施并有效运行质...
- 一周热门
- 最近发表
- 标签列表
-
- mydisktest_v298 (34)
- document.appendchild (35)
- 头像打包下载 (61)
- acmecadconverter_8.52绿色版 (39)
- word文档批量处理大师破解版 (36)
- server2016安装密钥 (33)
- mysql 昨天的日期 (37)
- parsevideo (33)
- 个人网站源码 (37)
- centos7.4下载 (33)
- mysql 查询今天的数据 (34)
- intouch2014r2sp1永久授权 (36)
- 先锋影音源资2019 (35)
- jdk1.8.0_191下载 (33)
- axure9注册码 (33)
- pts/1 (33)
- spire.pdf 破解版 (35)
- shiro jwt (35)
- sklearn中文手册pdf (35)
- itextsharp使用手册 (33)
- 凯立德2012夏季版懒人包 (34)
- 冒险岛代码查询器 (34)
- 128*128png图片 (34)
- jdk1.8.0_131下载 (34)
- dos 删除目录下所有子目录及文件 (36)