Codex一键生成口播视频,零基础照着做就能出片

全平台 付费课 VIP

得DB站混D樊DXX商学院热门大V课最新 AI 全系列课

这些平台单买 1 门课就要几百上千

10000+ 门高价付费课 / 终身更新 / 随便看

在 Codex 里输入“做一条口播视频”,眼前不会立刻掉出一个 MP4。

OpenAI 当前的模型页写得很明确,Codex 模型只接收图片输入,音频和视频输出都不支持。旧的视频生成接口也已经标记为弃用。于是标题里的“一键”不能理解成 Codex 自带了剪映或数字人功能。

它能做的事情更接近日常生产。先写口播稿,再生成竖屏画面,调用电脑里的中文语音,把画面、声音和字幕合成视频,最后检查尺寸与编码。Codex 负责把这些步骤连起来,并把成片保存到指定文件夹。

这篇教程走一条零 API 费用的 Mac 路线。第一次花十几分钟搭好模板,第二条视频开始只改选题,再发一句“重新生成成片”就够了。

01 先确定要做哪一种口播视频

本教程生成的是九比十六竖屏信息视频。画面由标题卡、要点卡、进度条和字幕组成,配上一段中文旁白,适合知识分享、产品介绍和干货短视频。

它不包含会眨眼、对口型的真人头像。数字人口播需要额外的人像授权、声音授权和唇形驱动工具。先把脚本、配音、字幕和节奏跑通,通常比一开始追求一张会说话的脸更稳。

最终文件建议固定为这些规格。

项目建议值
画面尺寸1080×1920
比例9比16竖屏
视频编码H.264
音频编码AAC
帧率30帧
第一条时长30秒到60秒
口播字数150字到240字

*图一 Codex负责组织流程,语音和视频仍由本地工具生成。*

02 新建一个空文件夹,再交给 Codex

打开 Codex,创建一个本地任务,选择刚建好的空文件夹。名称可以叫 talking-video。别选桌面根目录或存着工作资料的大文件夹,后面生成的图片、音频和临时片段会比较多。

先让 Codex 只检查环境,不安装任何东西。

请检查当前电脑能否制作本地竖屏口播视频。  只做读取和检测,不修改系统。检查中文语音、FFmpeg、浏览器渲染能力和可用字体。  请列出已经具备的工具、缺少的工具、预计生成流程和需要授权的动作。缺少组件时先停下,等待确认后再安装。

Mac 自带 say,可以生成中文语音。FFmpeg 负责把图片和声音合成 MP4,它通常需要另行安装。Codex 检测到缺失时,应先说明安装内容和影响,得到确认后再继续。

Windows 和 Linux 也能照这套思路做,但系统语音命令不同。不要直接复制 Mac 命令,先让 Codex重新检测环境。

03 把这段总指令发给 Codex

环境检查通过后,在同一个任务里发送下面这段话。

请在当前空文件夹创建一个可重复使用的竖屏口播视频项目。  目标 读取 topic.md,生成口播稿、分镜卡片、中文配音、字幕文件和最终 MP4。  画面 使用 1080×1920 竖屏尺寸。每个画面只放一个结论,正文最多两行。上下留出平台按钮和标题安全区。  声音 优先使用电脑已有的中文系统语音。语速自然,段落之间留短暂停顿。不要模仿任何真人声音。  输出 最终文件保存为 output/final.mp4,同时保留 script.md、subtitles.srt、cover.png 和 render-report.md。  安全要求 不覆盖已有成片。缺少软件时先说明,不自动安装。不调用付费 API,不上传素材,不发布视频。  验收 检查视频为九比十六,包含 H.264 视频和 AAC 音频,声音完整,字幕没有超出安全区。完成后重新读取成片属性,并把结果写入报告。

这条指令没有规定每一行代码。Codex 会根据电脑里已有的工具选择实现方法。常见做法是用网页渲染竖屏卡片,再用 FFmpeg 合成音频与画面。

*图二 首次创建模板和后续出片要分开看。*

04 topic.md只写四件事

项目创建后,打开 Codex 生成的 topic.md,把样例内容换成自己的选题。

视频主题 为什么很多人第一次用 Codex 会卡住  目标观众 刚安装 Codex、没有编程经验的职场人  视频时长 45 秒左右  内容要求 开头五秒提出具体问题 正文只讲三个动作 每句话尽量不超过二十五个字 不编造功能和数据 结尾提醒保存这份教程

最常见的问题是把一篇两千字文章直接塞进一分钟视频。旁白会越读越快,字幕也会挤满屏幕。四十五秒中文口播先控制在两百字上下,发现超时就删内容,别靠加速语音硬塞。

05 第一次生成,先看十五秒样片

不要让 Codex上来就渲染完整视频。先做前三个画面,听一遍声音,再看字幕和画面。

请先生成前十五秒样片。完成后打开样片供检查,暂时不要渲染完整视频。

样片重点检查五处。第一句话有没有在五秒内进入主题,中文人名和英文缩写有没有读错,断句是否自然,字幕有没有贴近屏幕底部,画面是否一闪而过。

读错的词可以在口播稿里改成更适合朗读的写法。AI可以写成“人工智能”,产品英文名可以用空格或标点调整停顿。旁白确认以后,再让 Codex 输出完整成片。

06 第二条视频才接近一键生成

模板通过验收后,复制项目文件夹,修改 topic.md,然后发送一句话。

请根据新的 topic.md 重新生成整条视频。沿用已经确认的画面、声音、字幕和验收规则,不覆盖上一条成片。

这时 Codex 会重新写稿、拆分画面、生成配音、合成视频并读取文件属性。已经安装的工具和确认过的版式都能继续使用,人工工作缩短到改选题、看样片和验收成片。

本次教程实际跑了一条二十六秒样片。输出文件为 1080×1920,30 帧,H.264 视频与 AAC 音频,文件大小约 735KB。这个结果只证明流程可以执行,不代表声音表现和内容质量已经适合直接发布。

样片还暴露出一个常见问题。画面生成很快,朗读节奏更花时间。先完整听一遍再改断句,比同时改颜色、字体和语速更容易找到问题。

*图三 成片生成成功以后,还要完成一次独立检查。*

07 发布前别漏掉这八项

• 开头五秒已经出现主题

• 旁白没有错字、漏字和奇怪停顿

• 字幕与声音大致同步

• 字幕没有进入顶部和底部按钮区

• 图片、音乐和字体拥有使用许可

• 没有模仿未经授权的真人声音

• 成片能够在手机上正常播放

• Codex没有替人上传或公开发布

如果需要真人数字人,把最终口播稿、分镜表和字幕交给获得授权的数字人工具。真人形象、声音克隆和对外发布都应单独确认,别把模板能自动运行理解成内容可以自动上线。

Codex 当前已经能创建和检查文件,也能使用本地终端与图像生成工具。它很适合把分散的制作步骤整理成一个可重复运行的项目。音视频的生成边界仍然要写进任务里,成片也要由人打开检查。

信息来源

  1. OpenAI Developers《Codex应用说明》,核验于2026年9月2日。
  2. OpenAI Developers《GPT-5.6 Sol模型页》,核验于2026年9月2日。
  3. OpenAI Developers《视频接口参考》,核验于2026年9月2日。
  4. 本机样片验证记录,macOS系统语音、FFmpeg 4.4与Chromium渲染,2026年9月2日。