CogVideo 文生视频本地部署指南两条命令拿到 5 秒成片参数一次讲明白【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo这是一篇面向新手的 CogVideo 文生视频上手指南。你在自己电脑上敲两条命令就能把一句提示词变成一段能直接播放的 5 秒 mp4CogVideoX-2B 档位一张 4090 显卡就能扛住。 先看成品一句话进一个能播的 mp4 出把场景说死你在终端敲下一行带--prompt A girl riding a bike.的命令几分钟后当前目录里会多出一个output.mp4双击就能播——81 帧、16fps、正好 5 秒。不用开浏览器、不用云服务文件就躺在你的磁盘上。这是官方 Web 演示的界面截图对应本文第 3 节跑完推理、拿到成片的这一步。 黑盒打开一句话是怎么变成视频的整条链路三段每段干一件具体的活文本编码器把文字翻译成模型能读的数字向量先接住你的提示词再叠加一层分类器自由引导通俗说就是画面必须听文字的话的力度旋钮出厂把力度拧到 6.0。有个隐含前提模型是用长描述喂大的提示词越短这根缰绳越松。潜空间扩散去噪不直接在像素上算先在一份压缩版表示里反复打磨DiT 主干从一团纯高斯噪声起步默认 50 轮把压缩表示一步步磨出视频该有的样子。官方给 5B 推荐的调度器写法就两行pipe.scheduler CogVideoXDPMScheduler.from_config( pipe.scheduler.config, timestep_spacingtrailing )3D 因果 VAE把压缩表示解压回一帧帧真实画面的解码器负责最后一道工序随后export_to_video按 16fps 写成 mp4。显存富余时把 offload 换成enable_model_cpu_offload()还能再提速代价是更吃显存两种写法在 inference/cli_demo.py官方推理入口管参数解析与导出顶部注释里有对照。 最快跑通两条命令出片前提Python 3.10–3.12。git clone https://gitcode.com/GitHub_Trending/co/CogVideo cd CogVideo pip install -r requirements.txt然后这一行就出片4090 选 2Bpython inference/cli_demo.py --prompt A girl riding a bike. --model_path THUDM/CogVideoX-2b --generate_type t2v跑完看一眼./output.mp481 帧 ÷ 16fps ≈ 5 秒和出厂参数严丝合缝链路确认没断。提示词只有一句话时建议先走一遍 inference/convert_demo.py提示词扩写工具把短句撑成长描述再喂进去画面会稳不少。️ 参数手感几个旋钮各自管什么参数出厂值它管的事往大了拧往小了拧num_frames81出多少帧即片长片变长显存和耗时跟着涨片变短出片更快num_inference_steps50去噪磨多少轮画面更干净单次更慢更快但可能带噪点、抖动guidance_scale6.0文字对画面的管束力度更贴文字过高画面发腻模型发挥空间变大易与文字脱节fps16导出时的播放帧率同帧数播得更快更利落播得更长但发闷seed42随机种子换个值就是一条新视频固定值可复现同一支几个和档位绑死的数字1.0 档2B/5B推荐 49 帧 8fps约 6 秒、分辨率 480x7201.5 档1.5-5B推荐 81 或 161 帧 16fps5 秒或 10 秒、分辨率 768x1360。图生视频i2v模式下宽高跟随输入图推荐分辨率按上表对应档位取。SAT 版本单独读 sat/configs/inference.yamlSAT 推理配置管帧数与 fps其中 22 帧对应 5 秒、42 帧对应 10 秒。这是官方图生视频演示的示例输入图对应上一段 i2v 模式的说明输出视频的分辨率就跟着这张图走。️ 翻车自救两个最常见的卡点显存不够、跑起来极慢根因5B 权重和 VAE 同时挤在显存里互相抢地盘。对策cli_demo出厂已开enable_sequential_cpu_offload()把暂不用的模块挪去内存用到再搬回别手滑删掉仍 OOM 就降档换 2B 模型。画面跟提示词对不上根因一句话提示词太短文字约束撑不住 50 轮去噪。对策用 inference/convert_demo.py 扩成长提示再跑或把guidance_scale从 6.0 提到 7 出两版对比。仓库里还有 tools/caption/video_caption.py视频打标脚本给自有素材批量生成描述可以拿来造提示词。这是打标工具产出的视频描述示例对应上面扩写长提示词这一步模型吃的是这种颗粒度的描述。 下一步同一命令加--seed 7再跑一次两支成片并排看种子和参数的实际影响一眼就能分出来。所有参数的默认值与含义在 inference/cli_demo.py官方推理入口的函数注释里都能查到动手改之前翻一眼即可。【免费下载链接】CogVideotext and image to video generation: CogVideoX (2024) and CogVideo (ICLR 2023)项目地址: https://gitcode.com/GitHub_Trending/co/CogVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考