逆风飞翔的小叔头像
关注
【AI智能体】Codex + Seedance2.5 制作AI视频实战操作详解封面图

【AI智能体】Codex + Seedance2.5 制作AI视频实战操作详解

目录

一、前言

 二、Codex 介绍

2.1 Codex 是什么

2.2 Codex能做什么?

2.3 Codex的不同使用模式

2.4 Codex处理自动化任务流程

三、Codex 部署与接入大模型

3.1 Codex 部署过程

3.1.1 获取Codex 安装包

3.1.2 安装Codex

3.2 安装CC Switch

3.2.1 获取安装包

3.2.2 安装CC Switch

3.3 CC Switch 配置DeepSeek

3.3.1 获取DeepSeek信息

3.3.2 配置CC Switch

3.4 效果测试

四、Codex 自动化任务案例操作

4.1 短视频制作自动化任务案例前置说明

4.2 短视频制作自动化任务操作过程

4.2.1 获取选题

4.2.2 根据标题获取人物重大经历事件

4.2.3 扩展每段经历的详细信息

4.2.4 做出技能包

4.2.5 效果测试

4.2.6 对接火山方舟文生图大模型

4.2.7 生成完整的图片

4.2.8 图生视频

4.2.9 获取视频

五、写在文末


一、前言

Codex 被誉为2026年最值得上手的 AI 工具,它不仅是一个编程 Agent,更是一个几乎可以替换掉任何对话工具的全能 AI。配合高性价比的定价机制和充足的 Token 额度,只要你能想到的场景,它都能帮你自动化完成。可以说,Codex 完美复刻了ChatGPT的模板,让普通的用户也能方便使用一款专属定制、性能强大的桌面版AI助手,其中,基于Codex 完成一些日常工作中的自动化任务编排是一个非常高频的场景,试想,每天都要处理一些繁琐且重复的工作时,有没有考虑过将这些事项通过流程编排的方式,通过Codex 来自动完成呢,本篇将详细介绍下如何在Codex 中封装自己的技能从而完成自动化任务的操作实践。

 二、Codex 介绍

Codex 是 OpenAI 推出的一款AI 编程智能体。与简单的聊天机器人或代码补全工具不同,Codex 能够像一个真实的开发人员一样,独立理解复杂任务、操作你的电脑、编写并修改代码、运行终端命令,甚至自动修复bug。https://openai.com/zh-Hans-CN/codex/?utm_source=Ai138.com

​

2.1 Codex 是什么

简单来说,可以把 Codex 看作一个“能帮你干活的AI工程师”。

  • 它是“目标驱动”而非“指令驱动”:你只需告诉它最终的目标(例如:“帮我搭建一个带用户登录功能的网站”),它会自动拆解任务,规划步骤并执行,而不需要你一步步告诉它该怎么做。

  • 它不只是一个聊天框:虽然你可以在ChatGPT网页版找到它,但它真正的威力在于桌面应用和命令行工具(CLI)。在这些地方,它可以直接访问你的文件系统、运行终端命令,甚至操作其他软件。

  • 它的用户远超程序员:官方数据显示,Codex每周有超过300万用户,其中近一半(50%)的使用场景并非编码。从写周报、整理文档到数据分析,它都足以胜任。

2.2 Codex能做什么?

近期的重大更新让Codex的能力大幅跃升,使其不再局限于编程领域:

  • 动打开软件、运行模拟器、发现问题、修改代码,并再次测试验证,完成一整套开发闭环。

  • 所见即所得的开发(内置浏览器):Codex内置了一个浏览器。当你开发网页时,它可以直接在浏览器中展示效果。你可以直接在渲染出的网页上圈出问题,比如圈出一个标题并写上评论“字体太大,颜色改成蓝色”,Codex就能理解视觉和空间上下文,并精准地修改对应的代码。

  • “心跳”机制与长期记忆:

    • 自动排班:你可以交付给它一个需要数小时甚至数周的长线任务。即使你关掉电脑,它也会在约定的时间点“自动醒来”,在后台继续工作。

    • 记忆功能:它会记住你的编码偏好和纠正过的错误,下次再合作时,就不需要从头开始解释了。

  • 强大的工具生态:Codex已经接入了超过90个插件,可以无缝连接JIRA、GitLab、Microsoft Suite、Slack、Gmail等常用工具。你可以让它去Notion里读文档、去邮箱里看邮件、去项目管理工具里筛选Bug,再把所有信息汇总成一份报告给你。

2.3 Codex的不同使用模式

Codex提供了多种使用方式,用户可以根据自己的需求选择不同的入口:

使用方式

适合人群

核心优势

桌面应用

追求最佳体验的用户

具备最完整的功能,如可视化代码审查、并行任务管理、“操作电脑”功能等

命令行 (CLI)

习惯终端操作的程序员

路径最短,与代码仓库、编辑器和命令行工作流结合最紧密

IDE 插件

不想改变现有开发环境的程序员

在你熟悉的VS Code或Cursor等编辑器中直接调用Codex的能力,接入成本最低

网页版 (ChatGPT)

普通用户或轻度使用者

无需安装,登录 chatgpt.com 即可在左侧边栏找到它,适合处理简单的一次性任务

2.4 Codex处理自动化任务流程

在 Codex 中配置处理自动化任务的常用流程,可以根据任务的复杂度和运行环境,从基础实践到高级配置逐步深入。核心思路是:先用 AGENTS.md 固化上下文,再用Skills 封装可复用能力,最后通过 Automations 或 CI/CD 实现无人值守执行。其最核心的步骤如下:

  • 基础准备:认证与基础配置

    • 这是所有自动化的前提,确保 Codex 有权限执行任务。主要配置在 ~/.codex/config.toml 或项目级的 .codex/config.toml

    • 自动化/CI场景:设置环境变量 OPENAI_API_KEY,避免密钥泄露风险

  • 用 AGENTS.md 固化项目知识

    • 这是让 Codex 稳定、正确执行任务的关键。AGENTS.md 是一个项目说明书,Codex 每次进入仓库都会自动加载它作为上下文

    • 内容建议:应包括项目技术栈、目录结构、常用命令(如 pnpm test)、编码规范(如“禁止使用内联样式”)和“禁止操作”清单

    • 存放位置:可以放在 ~/.codex/AGENTS.md(全局生效),或项目根目录、子目录中

    • 践建议:先花几分钟写一个精准的 AGENTS.md,可以有效减少 Codex 重复犯错,后续若发现它反复犯同类错误,可复盘并更新此文件

  • 将重复工作封装为 Skills

    • 当某个工作流变得可重复时(例如日志排查、发布说明撰写、按模板进行代码审查),应将其封装为 Skills。Skills 通过 SKILL.md 文件组织指令、上下文和脚本,实现复用

    • 实践原则:Skills 应聚焦单一职责,包含清晰的触发词和使用场景描述。可以先从 2-3 个具体用例开始,完善后再逐步扩展

    • 存放位置:个人 Skills 存放在 $HOME/.agents/skills,团队共享的可以放在仓库的 .agents/skills 目录下

    • 实践建议:如果你发现自己反复使用相同的提示词或不断纠正同一个工作流,就说明它应该被提炼成一个 Skill。$skill-creator 技能可以帮助你快速创建初始版本的 Skill

  • 选择并配置自动化运行方式

    • 根据任务场景,选择最合适的自动化执行方式。

    • 桌面应用自动化 (Automations)

    • CI/CD 集成

下面是完整的流程图

​

三、Codex 部署与接入大模型

3.1 Codex 部署过程

3.1.1 获取Codex 安装包

进入Codex官网,获取安装包

​

3.1.2 安装Codex

下载到本地之后,双击exe安装包,根据你的网络情况,大约3分钟左右即可完成安装

​

安装完成后,会看到下面一个使用前的引导页面

​

全部流程走完,会进入到下面的主页,后续使用桌面版的话所有的操作都可以在这个控制台完成

​

3.2 安装CC Switch

很多同学安装完成了Codex 之后,限于网络问题和地域问题,使用Codex 账号上面有限制,目前推荐通过CC Switch 代理配置其他大模型的方式来使用,基本上能够满足日常大部分的使用场景了,下面介绍下安装与配置的过程。

3.2.1 获取安装包

在github上面搜CC Switch 并获取下面的安装包

​

建议选择最新的版本,里面的功能更齐全

​

3.2.2 安装CC Switch

双击安装包,连续点击下一步即可完成安装,安装完成后,界面上能看到下面这个图标

​

打开之后,看到下面的效果,在这个页面,就可以接入并配置各种大模型,配置完成后,就可以在Codex 中使用了

​

3.3 CC Switch 配置DeepSeek

下面以国产大模型DeepSeek为例进行说明。

3.3.1 获取DeepSeek信息

进入deepseek之后,找到下面的API开发平台

​

进入之后,找到下面的 API Keys ,创建一个专属的apikey,并保存下来,给后面配置CC Switch 时使用

​

3.3.2 配置CC Switch

打开CC Switch 面板后,切换到下面这个 DeepSeek的图标

​

然后点击最右侧的+号,会弹出一个配置DeepSeek信息的窗口,在这个窗口中,主要调整2个地方,第一个是将上一步得到的deepseek那里的apikey粘贴进去

​

紧接着就是下面的地址改为这个

https://api.deepseek.com/ 

默认进来的话不是这个地

​

选择模型,目前deepseek最新的模型,上面配置完成后,点击下方的获取模型列表,可以看到有2个最新的大模型

​

然后在下面这个地方,可以切换任意一个进行使用

​

最后点击保存

​

最终在主页面,可以看到你新增的这个DeepSeek的配置,注意把对应的路由打开

​

3.4 效果测试

以上配置完成后,先把之前的Codex 客户端页面退出,然后再次打开,就可以直接开始使用了,此时Codex 使用的大模型就是DeepSeek V4 的了

​

测试一下效果

​

四、Codex 自动化任务案例操作

接下来通过几个实际操作案例演示下如何基于Codex 实现一些日常工作中常用的自动化任务配置过程。

4.1 短视频制作自动化任务案例前置说明

如果不借助AI 自动化工作流,做一个短视频的完整流程会比较繁琐,从寻找素材,写短视频脚本,剪辑,配音,字幕等,这是一个非常巨大的工程,现在有了Codex 之后,借助Codex 强大的编排处理能力,将整个过程中的每个环节跑通过之后,封装成为一个技能包(Skill),后续就可以通过自然语言,简单的一句话或者一个词语,就可以完成一个短视频的制作过程,接下来,以这个场景为例,介绍一下核心的操作过程。

4.2 短视频制作自动化任务操作过程

参考下面的步骤,完成自动化任务的制作。

4.2.1 获取选题

在本地目录新创建一个文件目录,用于保存本次的项目的各项文件,首先输入下面的提示词,通过这个提示词,生成本次要做的视频的选题

帮我做一个历史人物的标题,比如武则天传奇的一生/悲壮的一生,我会给你一个人物名字,你做的标题不能超过10个字,给我十个选题。
李清照

输入之后等待一会,Codex 会给出10个选题

​

​

4.2.2 根据标题获取人物重大经历事件

有了标题之后,为了后续生成短视频的脚本,还需要根据标题生成比较详细的内容,比如我们本次要做的视频是给出一个历史名人,然后就能得到一个历史人物的详细解读,接下来输入下面的提示词:

根据你推荐的这个标题帮我做一些关于李清照生平经历简略的描述,一定要言简意
赅一些,比如XXX年做了什么事/有什么重大事件,帮我只需要做8段经历即可,包括出生和逝世。

继续在这个对话中输入,经过等待之后,得到了历史人物的生平重大事件,视频中需要这些事件作为素材进行展开

​

4.2.3 扩展每段经历的详细信息

有了每段经历,接下来需要将这些经历的内容进行扩展,扩展之后的内容方便后续生成短视频中脚本,继续输入下面的提示词:

再帮我把每一段经历做成一个详细的画面描述,越丰富越好,不少于100字,一共是八段描述

最后按照要求生成了8段经历描述的扩展内容

​

​

4.2.4 做出技能包

为了方便后面类似的场景复用,我们可以将上面的Codex 的操作过程输出封装为一个技能,这样后面在使用的时候,只需要调出这个技能,输入一个历史人物名字,就可以很快得到相似的输出内容,在Codex 里面制作技能包很简单,只需要输入下面的提示词即可:

把上面的流程封装成一个技能,后续我只需要输入一个历史人物名字,你帮我做:标题,生平经历,每段经历的画面描述。

这个过程时间可能有点长,最终按照要求生成了一个技能

​

生成之后,在个人空间Codex 的技能目录下可以看到这个技能文件

​

4.2.5 效果测试

后续在使用的时候,可以通过 /技能名字 ,快速调出这个技能执行类似的任务

​

这里我输入李白做测试

​

4.2.6 对接火山方舟文生图大模型

紧接着,根据上述得到的历史人物的经历和详细的描述,生成不同的图片,我们整体的逻辑是,根据文案描述生成图片,再根据图片调用相关的图生视频的API得到每一段视频。

首先输入下面的提示词

  • 因为deepseek不是多模态模型,无法直接生图,这里需要做一下约束

接下来在这个对话窗口一定不要返回或者出现配图或者视频,把所有的内容保存到当前文件夹中,不要展示。

​

本次文生图使用火山方舟下面的大模型,里面有非常多的生图、语音、以及生成视频的大模型,新用户每天都有一定的额度免费使用

  • 如果之前没有使用过,需要注册并登录一下

如下,在生图大模型这里有很多模型可供选择,这里我选择下面这个

​

选API接入

​

进入之后,点击开通模型

  • 注意保存好apikey信息

​

然后就能看到调用和对接这个模型的完整接口文档了

​

文生图模型开通之后,具体怎么在Codex中进行对接呢?其实不需要你懂代码,直接将接口对接文档交给Codex 即可,你要做的就是把对接的过程描述清楚即可,找到下面的完整调用指南

​

然后把下面的这两个完整的对接文档丢给Codex 学习,即可进行测试对接

​

然后在Codex 中输入下面的提示词

参考这个文档内容,帮我测试这个画图API,我的key是:XXX ,我需要得到的图的比例是9:16 输入的参考提示词就是刚才得到的每一个画面描述(在API调用时,必须将提示词转成UTF-8编码),以秦始皇这个人物为例,你先用其中一个画面描述来测试。

参考测试例子如下:

curl https://ark.cn-beijing.volces.com/api/v3/images/generations \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $ARK_API_KEY" \
  -d '{
    "model": "doubao-seedream-5-0-pro-260628",
    "prompt": "充满活力的特写编辑肖像,模特眼神犀利,头戴雕塑感帽子,色彩拼接丰富,眼部焦点锐利,景深较浅,具有Vogue杂志封面的美学风格,采用中画幅拍摄,工作室灯光效果强烈。",
    "size": "2K",
    "output_format":"png",
    "watermark": false
}'

请一定把生成的链接结果保存到本地文件夹。

​

最终通过上面的生图API完成了对上述某个历史人物的描述生成了一个图片

​

生成的图片如果不符合要求,还可以继续让Codex 进行完善

​

4.2.7 生成完整的图片

文生图测试通过后,接下来针对某个人物生成完整的图片

好了,文生图测试通过了,接下来,使用historical-figure-bio这个技能,为我生成李白的信息

​

​

给出下面的提示词,基于上述人物历史信息生成完整的图片

接下来,用上面测试通过的生图API把每段对应的图生成出来,然后保持到本地

​

注意:

到生图这里,仍然可以将这一步纳入到前面的技能中,从而只需要输入一个历史人物名字,就可以调用API,得到几张图片

4.2.8 图生视频

跟上述文生图类似,我们这里仍然使用火山方舟中的大模型,完成图生视频的操作,参考上面的做法,对接一下图生视频的API,测试一下这个过程

获取某个生成视频的大模型

​

我这里选择下面的这个模型

​

然后将下面的提示词给到Codex

阅读这个文档,我现在要根据上一步你生成的李白的其中第一张图生成一段视频,你来测试下这个API是否可用,我需要前后帧的模式,我的key是:XXX

选择的模型必须是doubao-seedance-1-0-pro-fast-251015,视频长度为5秒,必须是无声的视频,480P。

请一定把生成的视频链接结果保存到本地文件夹。

图片可以在这个文件夹里面随便找两个当作前后帧。

参考的调用例子如下:

# 创建 图生视频 任务
curl -X POST https://ark.cn-beijing.volces.com/api/v3/contents/generations/tasks \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer XXX" \
  -d '{
    "model": "doubao-seedance-1-0-pro-fast-251015",
    "content": [
        {
            "type": "text",
            "text": "无人机以极快速度穿越复杂障碍或自然奇观,带来沉浸式飞行体验  --resolution 1080p  --duration 5 --camerafixed false --watermark true"
        },
        {
            "type": "image_url",
            "image_url": {
                "url": "https://ark-project.tos-cn-beijing.volces.com/doc_image/seepro_i2v.png"
            }
        }
    ]
}'

​

4.2.9 获取视频

上一步生成了视频任务ID,接下来需要调用另一个API,根据任务ID获取视频并下载到本地,方法跟前面的类似

​

输入进去之后,Codex 会自动阅读理解API,然后获取到了这个视频到本地

​

最后,按照上面的操作方式,将剩下的其他几张图片也全部生成视频即可。

五、写在文末

限于篇幅原因,后面的流程就不再继续了,后续只需要把得到的视频进行组装、剪辑、配音等相关操作即可,有兴趣的同学可以继续基于此进行优化完善,本篇到此结束,感谢观看。

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/congge_study/article/details/167223945

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--