首页文章详情

视频生成迎来“Claude Code时刻”,MiniMax Design “杀入” Adobe、Canva 腹地

极客邦科技InfoQ2026-08-21 13:05
模型公司的“副产品”,可能会成为软件公司的“终极威胁”。

一笔 AI 视频生成的隐性账单

周一上午,一家消费品牌临时决定,为即将开始的促销活动追加一轮短视频投放。

需求听起来并不复杂:围绕同一款新品,面向不同年龄、消费场景和平台,制作一批风格接近真实用户分享的短视频。内容大致包括:有人在办公室使用产品,有人在家体验;有的突出价格,有的强调功能。整体要求语气不能太像硬广,画面还需适配多平台规格。

真正让内容团队头疼的是最后一句:“先做 100 条,下午看第一轮效果。”

按照过去的工作方式,要在当天完成这项工作几乎不可能。

团队需要先把一句商业需求拆成若干脚本,再逐条设计分镜,准备人物、商品和场景素材,随后进入拍摄或生成、剪辑、配音、字幕和包装环节。

即使已经使用了 AI 工具,创作者仍要在多个工具之间来回切换:一个工具生成图片,一个工具让图片动起来,再用其他软件处理配音、字幕和剪辑。每多做一个版本,都意味着重新组合一遍素材和流程。

问题在于,这种“做 100 条视频,下午就要”的需求,正在从临时任务变成商业内容团队的日常。

这不是个别团队的焦虑,2025 年,Adobe 调研显示,超过 60% 的营销人员认为内容需求已经增长至原来的 5 倍或以上,且预计这种压力还会继续增加。

图片来源:Adobe 官网

WPP Media 发布的《2026 年年中全球广告预测》显示,预计 2026 年全球广告收入达到 1.3 万亿美元,同比增长 8.9%,高于 2025 年 12 月预测的 7.1%。

数字广告占比越高,意味着品牌对短、快、多版本素材的需求也越强。

视频需求增长与 AI 生成能力的普及,正在同时把内容团队推向一个新的瓶颈。

这个瓶颈就是:生成 10 个、100 个版本的视频越来越容易,但判断哪个能用、保持哪些元素一致、修改哪一版,以及如何送审和交付,并不会自动变得简单。

同一款产品需要覆盖抖音、快手、小红书、电商平台和海外社交媒体,还要适配不同人群、场景、语言、尺寸和传播语境。广告投放还要不断测试不同的开场、人物、卖点和表达方式,根据点击率、完播率和转化效果快速更换素材。

当生成成本下降之后,人的时间开始消耗在筛选、校对、修改和版本管理上。这笔隐性账单,成为全行业必须正视的“后生成时代”核心命题。

那么,这笔隐性账单应该怎么消化?

其实现在市场上并不缺生成工具。图像、视频、配音、数字人、字幕、翻译、剪辑和尺寸适配等环节,都已经出现大量 AI 产品或功能。

但问题是,单纯地把这些 AI 生成工具叠加起来,只会让团队拥有更多彼此割裂的能力。

一个工具写脚本,一个工具生成图片,一个工具制作视频,再由人把素材导入剪辑软件,补充口播、字幕和包装。

生成环节越来越快,需求拆解、分镜制作、资产整理、版本筛选和最终交付仍然需要人工完成,一套能承接完整商业任务的视频生产工具平台,才是付费的企业级用户真正需要的。

商业视频生成的“最终一公里”

那么,能够直接承接商业视频生成任务的平台,都有哪些玩家?

市场上已经出现了一些相对成熟的解决方案。

Adobe 正从专业创作软件向 AI 工作流延伸,Canva 则从模板化设计进一步走向 Agent。两者都在尝试把生成能力嵌入现有设计和内容生产体系。

但 MiniMax design 走出了一条差异化的路线:MiniMax Design 从原生多模态模型出发,重新组织商业视频的生产流程。

这一区别直接影响产品的工作方式。

传统创作软件通常以画布、时间线和素材为起点,用户需要明确自己要调用哪些功能。MiniMax Design 以需求为起点,用户只需要描述产品、受众、平台、卖点和内容风格,系统便可继续完成创意拆解、脚本、分镜、素材生成、配音、字幕和成片。

既然大家都开始做视频生成 Agent,谁的 Agent 更接近商业视频生产本身,谁就能掌握更多主动权。

然而,当越来越多产品开始提供视频生成 Agent,竞争关键也随之变化:谁更理解商业需求,谁能减少人工拆解和跨工具拼接,谁能稳定批量交付可用素材,谁就更接近真正的商业视频生产。

MiniMax Design 凭什么认为自己更接近这一目标?答案最终还要落到真实的生成结果上。

产品上线后,很快在国内外创作者社区引发一轮集中体验,海外用户的创作热情尤其明显,不少创作者开始尝试用它制作动画、影视预告和视觉包装,并在社交平台上分享生成过程与使用感受。

在 x 平台,一位 ID 名为 Ai Bella 的用户使用 MiniMax Design 完成了一支僵尸题材的悬疑预告片。

他表示,自己想测试 AI 能在多大程度上展开一个完整的电影概念,于是将一则僵尸电影创意交给 MiniMax Design 处理。从故事梗概、电影场景和整体氛围,到视觉特效、字体设计及结尾转折,整支预告片都在 Agent 驱动的工作流中逐步完成。

在他看来,这次体验与过去生成一组彼此割裂的视频片段有所不同。不同镜头和视觉元素开始围绕同一个故事目标被组织起来,整个过程“更像是在真正执导一部短片”。

以前可能制作一条这样的内容,要先确定人物、场景和脚本,再准备参考素材和文案,随后完成拍摄或生成、剪辑等工作。而使用 MiniMax Design,用户可以直接口述需求,甚至一句话的提示词就能得到下列类似的视频。

同样在 x 平台,一位日本视频创作者 SEIIIRU 在体验 MiniMax H3 和 MiniMax Design 后,将其形容为一个可能让从业者产生职业危机感的案例。

他用 Design 制作了一条汽水广告视频,随后写道:“这就是那种让人觉得 AI 真的要来抢我们工作了的情况吧。”

但他紧接着给出了另一个判断:站在视频行业从业者的角度,面对这类工具,也已经很难选择完全不用。

另一名创作者则尝试用 MiniMax Design 中的 H3 探索不同动画风格。

他表示,自己只需要给出大致方向,Agent 便会进一步把想法拆解成可以实际执行的工作流,再逐步生成相应的视频。这种创作方式让 AI 视频变得更有趣:创作者无需一开始就确定所有制作细节,可以在生成过程中不断尝试不同风格,并根据结果继续调整方向。

还有位 x ID 名为 Bhavy 的用户,用 Design 进行了对象替换,该用户表示,自己给 Design 一个参考视频和 3 张图片,让它交换舞者。结果它在不到 1 分钟的时间内生成了这段视频,并且始终保持每张脸和光照的一致性。

他不禁感慨,“这简直太疯狂了 ”。

还有用户表示,自己试过后完全迷上了 MiniMax Design, 只需要一个提示,然后等待一会儿,就能获得完整的复古日式旅行海报风格视频。

从这些用户分享的视频中可见,MiniMax Design 整体对电影类型、视觉风格和氛围的理解较好。在提示词足够具体、故事和镜头规划清晰的情况下,可以生成电影感较强、画面质量较高的片头或预告片样片。

值得一提的是,这些案例之外,MiniMax H3 也开始进入更成熟的创作平台。

剪映国际版 CapCut 平台已经接入 MiniMax H3,用户可以直接在 CapCut App、Web 和 桌面端试用。

差异性怎么体现?

从以上实测案例可以看到,MiniMax Design 的优势不只体现在单条视频的生成效果上。它在需求理解、专业效果调用、复杂任务执行和商业成片交付等环节,都呈现出与其他视频 Agent 不同的产品逻辑。

而要做到这些,背后离不开 MiniMax Design 的几个差异化特征:

第一,不是给旧软件加一个 Agent,是围绕 Agent 重新设计生产界面。

Adobe 的优势来自 Photoshop、Premiere、Illustrator、AEM 和 Workfront 等成熟软件体系,Canva 的基础则是模板、画布与协作生态。

两家公司正在把 Agent 逐步嵌入原有产品:Adobe 将 Creative Agent 带入 Firefly、Photoshop 和 Premiere,Canva AI 也开始通过对话生成和修改设计。

MiniMax Design 与他们最大的不同,是直接以 Agent 作为创作入口。用户描述想法或上传 brief 后,主 Agent 理解目标、拆解任务并匹配模型,文案、图像、视频和音频等 Agent 随后协同完成任务。

其工作流程可以概括为:

理解创作目标 → 智能拆解任务 → 多 Agent 协同处理 → 合并、编辑和导出

Adobe 把 Agent 带进了软件,MiniMax Design 则以 Agent 为入口,将软件能力纳入从需求到交付的完整链条中。

第二、它更集中地面向“视频原生”的多模态生产。

MiniMax Design 将脚本、分镜、图像、视频、配音、音乐和编辑放在同一张 Canvas 上,不同节点自动连接,从前期调研、脚本策划一直走到最终剪辑,减少在多个工具之间反复上传素材和重建上下文。

这些能力最终围绕视频成片组织。用户只需描述产品、受众、渠道、卖点和内容风格,系统继续完成脚本、分镜、画面、声音与剪辑。适配的重点场景包括短剧、电商内容、品牌 TVC 和广告素材,产品重心比通用设计平台更集中于商业短视频生产。

第三、把“成功的方法”封装成 Skill,比每次重写 Prompt 更适合批量生产。

MiniMax Design 另一个值得重点关注的能力,是自定义 Skill 和插件。

用户可以通过对话创建自己的 Skill,也可以直接调用 Skill Plaza 中已经沉淀的工作流。适配范围覆盖短剧、分镜、商业广告、电商、音频和音乐等内容,并可以借助专业插件处理电影特效和其他复杂制作任务。

为什么这很重要?

这样从 Skill 与普通 Prompt 的差别说起。

Skill 与普通 Prompt 的差别,在于它保存的内容不只是一段自然语言指令。一项完整的生产方法,往往还包括任务拆解顺序、节点关系、模型选择、参考素材、参数约束和质量检查。

例如,制作一条 KOC 种草视频,需要确定目标人群和使用场景,提炼产品卖点,生成口语化脚本,再依次处理人物、口播、产品露出、字幕和包装。一次效果较好的成片背后,真正有价值的是这套流程,而非某一个偶然生成成功的镜头。

批量生产真正需要复制的,不是上一条视频,是生产上一条视频的方法。这也是 Skill 机制最擅长做的事。

Skill 可以把一次成功的提示词、节点组合和检查流程沉淀下来,成为下一项任务可以直接调用的生产能力。面对新的商品或课程,用户只需要替换产品信息、受众和交付要求,就能沿用已经验证过的结构。

比如生产 100 条视频时,团队不必从头编写 100 次 Prompt,也不必依靠某位操作人员记住全部制作步骤。

此外,商业客户还需要在多人协作、跨项目复用和人员变化的情况下保持结果一致。Skill 把个人经验转化为可保存、可调用的流程资产,使内容团队有机会建立自己的广告 Skill、电商 Skill、动态讲题 Skill 或影视包装 Skill。AI 由此从一次性的灵感工具,进一步接近日常生产系统。

第四、开放适配,免迁移。

创作团队已经积累了大量本地素材、专业软件工程文件和内部工作流,采用 AI 并不意味着这些资产可以全部推倒重来。

MiniMax Design 设置了本地资产中心,Canvas 素材可以保存在本地,Agent 能够调用本地文件,并将生成结果导向专业工具,这样团队就不必放弃已有素材和生产流程。

底层的 MiniMax H3 进一步提供了开放权重、API 和 ComfyUI 接入方式。

MiniMax H3 项目地址:https://github.com/MiniMax-AI/MiniMax-H3

图片来源:MiniMax 官网

H3 能够统一理解文本、图像、视频和音频输入,生成带同步立体声音频的视频;API 支持 768P 和 2K 输出,时长为 4 至 15 秒。

这种开放适配带来两个直接好处。

首先,模型与产品之间的反馈链路更短。商业生产中暴露的人物一致性、商品还原、声音同步和参考素材理解等问题,可以更快进入底层模型的迭代。

其次,企业可以根据自身需求选择接入方式。普通创作者可以直接使用 MiniMax Design,专业团队可以连接本地素材和外部工具,拥有开发能力的企业则可以通过 H3 API、开放权重和 ComfyUI,将模型接入原有生产流程,无需彻底迁移既有资产和工作流。

模型公司开始吞噬软件层

把前面四点放在一起看,MiniMax Design 的产品逻辑会更清楚:以 Agent 作为创作入口,用 Canvas 组织视频生产,通过 Skill 复用成功流程,再以开放模型和工具适配原有工作流。

这几项能力共同指向一件事:MiniMax 想做不仅是一款视频生成工具,而是一套围绕模型重新建立的创作软件。

在其他同类产品上,模型作为一项能力被放进软件。例如 Photoshop 增加生成式填充,剪辑软件加入自动字幕,设计平台接入文生图。模型负责生成某段内容,软件继续承担任务拆解、素材管理、编辑修改和流程组织。

但用户依然要打开不同工具,在菜单、时间线和文件夹之间完成剩余工作。

而 Agent 和 Harnes 出现后,打破了这种分工。

模型获得工具调用、文件读写、任务规划和结果检查能力后,开始接手软件原本负责组织的工作。用户不再需要逐项指定使用哪个功能,而是直接说明想要的结果,Agent 再决定如何拆解任务、调用工具,并根据执行结果继续修改。

Claude Code 已经在软件开发领域证明了这条路线。

Claude 过去也会写代码,但真正让它进入开发流程的,是读取项目、修改文件、运行命令和检查结果的能力。模型由此从回答编程问题的助手,变成开发环境里的执行者。

Anthropic 分析了 50 万次 Claude Code 和 Claude.ai 交互,发现 Claude Code 中 79% 的对话包含某种形式的自动化,高于 Claude.ai 的 49%。改变开发方式的关键,是它能否借助 Harness 把任务持续做完。

图片来源:Anthropic 官网

Harness 正在成为 AI 时代的新软件层。过去软件通过固定界面规定用户怎么工作,Harness 则根据用户目标,临时组织模型、工具和流程。

MiniMax Design 正在把类似的逻辑带进视频生产。

当然,这不是传统软件单方面被模型公司“进攻”,倒可以说是一场双向迁移。

MiniMax Design 和 Adobe、Canva 正在从相反方向抵达同一个战场。

Adobe 已经推出 Firefly AI Assistant,用户可以用自然语言描述目标,由 Agent 跨 Firefly、Photoshop、Premiere、Illustrator 等应用执行多步骤工作流,Canva AI 2.0 同样强调意图理解、Agent 编排、品牌记忆和跨渠道内容生成,并可以定时批量生产社交内容。

如果 Agent 只是一项边缘功能,Adobe 和 Canva 不必同时向 Agent 转型。传统软件公司把模型装进软件,模型公司则开始从模型中长出软件,把这种双向渗透放在一起来看,释放了一个信号——双方最终抵达的是同一个战场。

那么下一步竞争的重点,是谁能理解 brief、拆解脚本和分镜,组织人物、商品与品牌资产,调度图像、视频、声音和剪辑能力,并完成修改、检查与交付。

MiniMax Design 正是在这一层向上生长,所以它的想象空间也不只属于视频 Agent 市场。

它想重新定义的,是 Adobe、Canva 背后整套商业内容生产逻辑。

视频生成只是入口,真正可能被改写的,是商业内容的生产方式。

参考链接:

https://platform.minimax.io/docs/guides/video-generation

https://business.adobe.com/resources/reports/content-management-digital-trends.html

https://www.anthropic.com/research/impact-software-development

本文来自微信公众号“InfoQ”(ID:infoqchina),作者:冬梅,36氪经授权发布。