百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术教程 > 正文

腾讯版Sora开源后被提速8倍!官方点赞并预告:下月上新图生视频

csdh11 2025-01-01 19:09 18 浏览

提速8倍!

速度更快、效果更好的混元视频模型——FastHunyuan来了!

新模型仅用1分钟就能生成5秒长的视频,比之前提速8倍,步骤也从50步减少到了6步,甚至画面细节也更逼真了。

和普通速度的混元对比一下,原来50步才能生成1条视频,而现在新模型在相同的时间里可以生成8条

再来看看和Sora的画面对比,可以看到Fast-Hunyuan和Sora两者的效果都更逼真一些,衣服、水果和山峰的细节也非常清晰。



甚至在一些物理细节的理解上,Fast-Hunyuan比Sora还强,比如下面拿取柠檬的视频:

更重要的是,Fast-Hunyuan的代码也开源了,这下不用为Sora的订阅费和限额发愁了。

研究团队来自加州大学圣地亚哥分校(UCSD)Hao AI实验室,他们主要专注机器学习算法和分布式系统的研究。


混元官方账号还特意发博感谢了他们:

有网友看完后直呼,混元才是最好的开源视频模型。

开创性的视频DiT蒸馏配方

团队是如何做到8倍提速的情况下还能提升视频清晰度呢?

下面就一起来看一下Fast-Hunyuan的技术原理——

首先,他们开发了全新的视频DiT蒸馏配方

具体来说,他们的蒸馏配方基于阶段一致性(Phased Consistency Model, PCM)模型

在尝试使用多阶段蒸馏后发现效果没有显著改进,最终他们选择保持单阶段设置,与原始PCM模型的配置相似。

其次,团队使用了OpenSoraPlan中的MixKit数据集进行了蒸馏。

为了避免在训练过程中运行文本编码器和VAE,团队还预处理了所有数据,用来生成文本嵌入和VAE潜在变量。

在推理阶段,用户可以通过FSDP、序列并行和选择性激活检查点进行可扩展训练,模型可以近乎线性扩展到64个GPU。测试代码在Python 3.10.0、CUDA 12.1和H100上运行。

官方推荐使用80GB内存的GPU,不同模型有相应的下载权重和推理命令。

最低硬件要求如下:

  • 40 GB GPU 内存,每个 GPU 配备 lora
  • 30 GB GPU 内存,每 2 个 GPU 配备 CPU 卸载和 LoRa。

在模型微调方面,Fast-Hunyuan提供了全微调(需准备符合格式的数据,提供了一些可下载的预处理数据及对应命令)和LoRA 微调(即将上线)两种方式。

此外,他们还结合了预计算潜变量预计算文本嵌入,用户可以根据自己的硬件条件选择不同的微调方式来执行命令,也支持图像和视频的混合微调

模型已于2024年12月17日发布了v0.1版本。

未来的开发计划还包括添加更多蒸馏方法(如分布匹配蒸馏)、支持更多模型(如CogvideoX模型)以及代码更新(如fp8支持、更快的加载和保存模型支持)等等。

One More Thing

除了加速模型,混元还预告了大家都非常期待的图像到视频生成功能。

最快1月份,也就是下个月就可以看到!期待住了。

GitHub:https://github.com/hao-ai-lab/FastVideo
HuggingFace:https://huggingface.co/FastVideo/FastHunyuan

参考链接:
[1]https://x.com/TXhunyuan/status/1869282002786292097

— 完 —

量子位 QbitAI · 头条号签约

关注我们,第一时间获知前沿科技动态

相关推荐

知名软件变“木马”:2小时感染10万电脑

近日,腾讯电脑管家监测发现,一款通过“驱动人生”升级通道,并同时利用“永恒之蓝”高危漏洞传播的木马突然爆发,仅2个小时受攻击用户就高达10万。腾讯电脑管家可精准拦截该病毒攻击,管家团队也将持续跟踪该款...

腾讯电脑管家发布病毒预警:“驱动人生木马”爆发,2小时感染10万台电脑

新华网天津12月15日电(记者周润健)腾讯电脑管家15日紧急发布病毒预警,14日下午,腾讯电脑管家监测发现,一款通过“驱动人生”升级通道,并同时利用“永恒之蓝”高危漏洞传播的木马突然爆发,仅2个小时受...

全新“撒旦”勒索病毒来袭 瑞星推出独家解密工具

新华社北京7月26日电瑞星威胁情报平台近日发现多起国内用户感染“撒旦”勒索病毒事件。据瑞星安全研究人员介绍,该病毒运行后会加密受害者计算机文件,加密完成后会用中英韩三国语言索取1个比特币作为赎金,并...

新勒索病毒“WannaCry”疯狂来袭 乌克兰副总理电脑中招

据外媒报道,从6月27日开始,一种新勒索病毒再次疯狂来袭,已席卷欧洲多个国家,连乌克兰副总理的电脑都已中招。报道称,这轮病毒足以与五月席卷全球的勒索病毒“WannaCry”的攻击性相提并论。该病毒代号...

蠕虫病毒利用“永恒之蓝”漏洞传播 单位局域网受威胁最大

日前,火绒安全团队通过“火绒威胁情报系统”发现蠕虫病毒“Worm/Sharp”正在全网传播,其中在政府、企业、学校、医院等单位的局域网具有非常强的传播能力。该病毒通过“永恒之蓝”漏洞、多个电脑常用端口...

新病毒爆发:利用“永恒之蓝”传播,2小时感染10万台电脑挖矿

驱动人生发布的声明。据腾讯安全专家介绍,通过追溯病毒传播链发现,该病毒自12月14日约14点,利用“驱动人生”、“人生日历”等软件最早开始传播,另有约30%的传播通过“永恒之蓝”漏洞在局域网内进行主动...

逍遥安卓模拟器定制手游电脑版 手机电脑账号完全互通

从今年起大量回合制端游转向手游方向,无论是《梦幻西游》、《大话西游》、《神武》还是刚刚发行的《问道》手游,都是非常重度需要大量时间来做任务挂机升级的游戏。很多人习惯了端游的时候一个电脑可以多开的玩法,...

安卓模拟器绿色U盘移动版 公司玩游戏无痕迹

安卓模拟器已经不稀奇了!随着安卓手游的盛行,特别是《梦幻西游手游》之类的重度手游发布,玩手游花的时间也越来越多。用手机玩这些游戏存在着屏幕小、点量少、费流量还有容易被电话打断,在电脑上用安卓模拟器玩游...

苹果推出 iCloud 照片和视频转移服务:可转移至谷歌相册

IT之家3月4日消息据MacRumors今日报道,苹果公司本周推出了一项新服务,帮助iCloud用户方便快捷的将其存储的照片和视频转移到谷歌照片上。苹果在其支持文档中表示,用户可以登...

NAS PK台,4核带m.2的威联通TS-264C vs 双核TS-462C

因为618年中大促看到威联通TS-264C和TS-462C这两机型售价差不多,就做个比较以供参考。毕竟作为自2007年以来就一直卖威联通的NAS老油来说,对威联通各NAS机型的识别还是相当全面的,对不...

前端学AI(七):构造 RAG 系统评估测试数据集

引言在基于DeepSeek+Chroma+LangChain开发一个简单RAG系统...

惨重教训!调查显示挪威“英斯塔”号宙斯盾舰撞油轮后本不必“丧命”

最新公布的调查报告显示,挪威皇家海军“英斯塔”号护卫舰2018年11月与油轮相撞后,如果其舰员接受了更好的损管训练,并且对舰艇的稳定特性更加熟悉的话,这艘宙斯盾型战舰本来是可以挽救的。↑挪威“英斯塔”...

「必买」盘点2021年男人们的败家清单,越“败”越香

心里总想买点啥?看看《必买》,全网最有料的场景种草指南。草原割不尽,春风吹又生。在过去的2021年,不断被各种数码产品种草,一直在买买买,剁手不停。大部分产品都经过详细的对比做足了功课,也有部分是一时...

实现浏览器播放rtsp视频流的解决方案

有同学问道:需要实时播放摄像头rtsp视频流,而浏览器不能直接播放,怎样解决?实现这个需求可以通过插件或者转码来实现。要实现这个目的,可以采用的方案非常得多,有商业的也有开源的,这里主要列举一些开源的...

ISO9000你知道多少?

1ISO9000族标准是什么?ISO9000族标准是指由国际标准化质量管理和质量保证技术委员会(ISO/TC176)制订的所有国际标准。ISO9000族标准可帮助各种类型和规模的组织实施并有效运行质...