AI 在实现更多人的创作需求,走向全民创造时代。
作者|Moonshot
编辑|郑玄
最近,影视飓风开始进入 AI 影视赛道,选择与 TapNow 推出一套 AI 影像创作教程。
一套教程的出现,本身就是个信号,它说明AI 影像正在走出「展示奇观」的阶段,开始形成可以被讲解、学习和复用的创作方法。
被教程吸引进来的,也未必都是准备拍电影的人。
车企、游戏公司和消费品牌都在增加视频内容的使用:产品发布需要概念片,游戏上线需要世界观短片,市场部门则要持续生产品牌视频、更新社交媒体。
对这些团队来说,AI 影像正在从一项新技术,变成工作里可以调用的制作能力。
但真正开始做视频以后,问题很快就从「怎么生成」变成了「怎么把视频做下去」。
一条完整的视频还要经过创意开发、视觉设定、分镜、素材生成、修改和剪辑。视频一旦从十秒左右的镜头走向完整作品,人物、场景和前后决定都要保持连续,原本分散在不同工具里的问题也会同时出现。
观众看到的是一条视频,但创作者面对的是一个项目。AI 影像已经不缺会生成的工具,缺的是一套能把项目做完的系统。
为此,TapNow 推出了 Creative OS,并将其定位为「世界首个 AI 原生创作系统」,平台的创作者们也把它类比为「创作界的 Codex」。
但 AI 影像,为什么开始需要一个操作系统?
01
AI 视频的真实落地
要回答这个问题,让我们先回到真实的创作场景里。为了理解 Creative OS 怎样进入真实生产,我实际体验了两个差别很大的项目,也带着一篇多年没有拍出来的短片剧本,观察它在专业影视上的能力边界。
第一个是准备改成自媒体视频的想法,只有一个大概方向,还没有发展成脚本;
第二个是已经立项的内容工作,时长、形式和更新频率基本确定;
第三个是我写完的短片剧本。因为拍摄成本和精力限制,一直停留在文字里。
一个念头、一项工作和一篇剧本,刚好构成了 AI 影像进入真实生产的三个台阶:先进入个人内容创作,再进入企业内容生产,再最后尝试承接电影级表达。
TapNow 的创作者类型并不局限在「导演」上|图源:TapNow
传统 AI 视频产品通常默认用户已经想清楚了。打开工具后的第一步,就是输入 Prompt。但要写出一条准确的 Prompt,我得先确定人物、剧情、叙事方式和视觉风格,再把这些内容翻译成模型能够理解的语言。
可问题就在这里:如果我已经能把一切描述清楚,最困难的创意阶段其实已经结束了。
对于刚开始尝试 AIGC 的用户,这一步是劝退级的门槛。但 Creative OS 里的 Brainstorm 提供了另一种起点。
Brainstorm 不会直接把一个模糊想法生成视频,而是沿着现有方向继续发散,带着我把还没想清楚的问题拆成人物设定、叙事方向和视觉方案,再给出几组可以选择、修改和继续追问的提案。
这些没在脚本里体现的内容,Brainstorm 会直接拿出可用方案|图源:TapNow
这也让我看到了 Brainstorm 对非专业用户的价值。
自然语言处理让 AI 听懂了人的想法,Brainstorm 则是反过来,把视听语言里的专业问题,翻译成普通用户也能看懂的方案。它让 AI 听懂「外行」,也让「外行」看懂内行在判断什么。
用户不需要先学会景别、运镜和用光,才能迈进创作的第一步。专业判断依然存在,作出判断的人也仍然是用户,只是一个模糊想法终于有了继续往下发展的路径。
Brainstorm 的前期推演同样适用于企业内容。像是产品发布、游戏宣发和品牌活动,往往都从一个传播目标为起点,再逐渐长出视觉概念和视频方案。
当方向讨论清楚后,Agent 还会把前面的创意直接整理成一个对外展示的网页。省掉了把聊天记录重新整理成提案的步骤,可以直接进入汇报、评审和客户沟通环节。
Agent 生成的提案网页|图源:TapNow
Brainstorm 解决了「怎样开始」的问题。接下来要解决的,是怎样把一套方法稳定地重复下去。
02
让 AI 进入已经运转的工作流
第二个项目,是一个脚本结构、视频时长和更新频率都已经确定的内容项目。
目前项目进展了很多期,但我面临着特别现实的问题:人已经找到方法,AI 却没有把它记住。这也是很多打工人和 AI 协作共创的常态。
每换一篇新脚本,我都要重新说明画面风格、怎样拆解剧情、怎么运镜……即使工作内容高度相似,我和 AI 的沟通仍然要从头开始。
Creative OS 里的 Skill 解决的就是这个痛点。
我在 TapNow 里完成第一条成片后,就可以把这套流程封装成一个 Skill。之后,我只需要在新窗口调用它,再输入一篇新的脚本,Skill 就会沿着之前的画风、改编方法和制作步骤自动推进,我只需要检查结果,再处理这一期内容里的特殊部分。
Skill 很像 WPS 里的工作模板。模板不会替人完成所有工作,却能保留一套已经验证过的格式和方法,让后来者不用每次重新搭建。
一套方法能够被重复以后,AI 才真正有机会进入日常工作,毕竟对于需要持续更新的内容项目来说,稳定地做出第二条、第三条,往往比偶尔生成一条效果出色的视频更重要。
我调用 Skill,只需要输入新的脚本,TapNow 会自动跑一遍已有的工作流|图源:TapNow
而在工作场景里,一个项目也很少只由一个人,在一个平台里单独完成,往往要经过策划、设计、视频和客户审核,在多个同事和软件之间流转。
于是 Creative OS 做出了 Plugins(插件),让 AI 可以直接进入这些已经存在的工作资料。
比如,公司准备举办一场新品发布会。策划人员可以让 Agent 读取飞书里的会议纪要,再结合 Notion 中的客户 Brief,整理出活动方案和汇报 Deck。
设计师可以从 Pinterest 挑选参考图,确定发布会的视觉风格;负责视频的同事也可以使用同一批资料,完成发布会预热视频;客户新的要求还可以从 Slack 同步;视频进入审核阶段,还可以通过 Frame.io 完成批注和版本确认,最终成片可以放到 Vimeo 管理、分享和展示。
在过程里,Brainstorm 还能辅助策划,提供更丰富的视觉方案;如果品牌已经形成稳定的视觉规范和内容方法,可以继续把它们保存成 Skill 复用。
原本需要多个软件、多个岗位反复协调的工作,在 Creative OS 里变成了一条连续的生产线。
从 Brainstorm 到 Skill 再到 Plugins, Creative OS 超越了单一的 AI 影像,深入到了更泛化的内容工作场景。
这种场景对应着一群数量更大的用户。TapNow 面对的企业用户,往往分布在品牌、市场、游戏发行和产品传播团队。他们很少把自己称为影视创作者,却在持续生产视频内容。
因为做方案、找参考、出物料、剪视频和完成跨部门协作,就是工作的一部分。
文档的流转可以全部在 Creative OS 里实现|图源:TapNow
对他们来说,TapNow 不只是影视工具,也是一套从策划走到影像的创作工具。
专业影视项目有明确的行业边界,企业里的产品传播、品牌活动和内容更新却每天都在发生。
Creative OS 能覆盖多少这样的工作,构成了 TapNow 的应用广度,象征了 Creative OS 的横坐标。
另一条纵坐标,是它在自己最擅长的 AI 影像领域,究竟能走多深。
03
AI 横店,一套 AI 创作系统的专业上限
第三个项目是一篇多年没有被拍出来的短篇剧本。它对 TapNow 的要求最高,因为剧本影视化涉及人物、场景、镜头、表演、声音和剪辑。
在我输入短片剧本后,TapNow 会直接给我生成一套项目方案|图源:TapNow
受限于体验时间,我没有把它从剧本完整跑到成片。但这次体验让我观察到 TapNow 为复杂影像项目准备了哪些能力。
短片的宣传小片|图源:TapNow
打开 TapNow 时,最先吸引我的,是首页那批极具电影感的样片。
其中不少作品长达五到二十分钟,有人物,有场景,也有完整的情绪和叙事,在篇幅上已经进入电影短片的范围。
这些作品展示的不只是画面质量,也在展示 TapNow 能够把 AI 影像推到多高。
模型、专业 Prompt、角色资产、Skill、3D 场景和镜头工具,被 TapNow 集中在同一个平台里。为了理解这种密度,我把 TapNow 看成一座「AI 横店」。
TapNow 建立了一个完善的 AI 角色库供用户直接调用|图源:TapNow
剧组经常在横店扎堆,因为场景、群演、服装、道具、器材和制作班底都聚集在那儿。剧本需要一条古代街道,或者临时增加一场夜戏,制片团队能迅速找到相应的资源。
TapNow 也在尝试搭建类似的环境。
平台提供了大量的视频模型,因为模型决定了画面能够达到的高度。但模型越多,创作者越难判断什么时候该用哪一个。
比如同样是一条视频,汽车高速行驶的镜头和游戏角色的表情特写,对模型的要求完全不同。
Harness Layer 会根据具体任务,准备更合适的模型、专业 Prompt、参考资产和生成方法。它就像一名熟悉所有制作部门的制片人,用户提出画面要求,它负责安排合适的班底。
这套匹配能力也来自 TapNow 与模型供应商的前置合作。
在新模型正式发布前,双方就会针对具体场景沟通,提前调整 Prompt 和 Agent 工作流。等模型上线,用户调用的模型是已经优化好的方案,发布后就能丝滑使用。
TapNow 提供的海量模型|图源:TapNow
3D 虚拟片场解决的是另一个问题:怎样把镜头放进一个稳定的空间里。
它可以把一张场景图,搭成一个能够进入和拍摄的空间。底层的世界模型还会推算出图片之外的部分,让摄影机能够向前走、转到侧面,或者拍摄原图里没有出现的角度。
这功能很像先搭好一座可以反复使用的虚拟摄影棚。
车企可以围绕同一个展厅和产品空间制作不同机位的宣传镜头,品牌想要制作的横屏宣传片、竖屏短视频和发布会物料,都能从同一个空间里取景。
3D 世界可以把一张静帧图扩展为一个可调用的场景|图源:TapNow
场景搭好以后,TapNow 的多角度和镜头切分功能再负责「拍」,可以围绕同一个场景生成不同机位,再把一个连续动作拆成一组镜头。
因为真实片场也不会只拍一个机位。导演会准备全景、中景、特写和反打,给后期剪辑留下重新组织场面的空间。
视频剪完后,过去还要再花一轮时间单独处理声音。
TapNow 新接入的视频原生 AI 声音模型 Sonilo Sound Effects 1.0 就能识别视频里的动作和场景,自动补上动作声与环境声,并把时间点对齐。
再配合 Sonilo 的音乐模型,上传一次视频,配乐和声音设计就能一起完成,用户可以直接拿到一个声画完整的版本。
这些视听能力也不只服务 AI 电影。
产品广告里,需要准确表现产品、空间和运动镜头,游戏宣发视频里,要维持角色与世界观的一致性。这些低频却关键的能力,决定了 TapNow 能否承接复杂、专业、高规格的影像项目。
而一套 AI 影像系统的专业上限,最后还是要由作品来证明。
04
AI 视频的商业化,可能先发生在一到十分钟之间
长片电影仍是 AI 影像最远的目标。但在现阶段,AI 视频的「工业化」和「商业化」,可能先发生在一到十分钟之间。
十秒 Demo 太短,只要一个镜头足够惊艳,人物有没有变化、空间能不能接上、故事是否成立,都可以暂时藏起来。
九十分钟的电影又太长,它会同时考验长叙事、制作管理、算力成本和发行体系。现阶段,大多数 AI 团队还很难承担这一整套压力。
一到十分钟的中视频刚好处在中间。它足够长,人物、场景、风格和节奏都要经得起时间检验;它也足够短,个人和小团队仍然承担得起试错;它还刚好是品牌短片、MV、动画和自媒体视频的长度舒适区,已经有成熟的发布渠道和明确的内容需求。
AI 视频最早形成规模的地方,很可能就在这里。
市场也证明了这一点,目前国内超过 70% 的车企、部分头部的游戏厂商,都在把 TapNow 纳入产品传播、游戏宣发和品牌内容中的固定生产环节。
当 AI 开始进入有预算、有流程、有交付要求的项目,AI 影视的工业化就有了更具体的尺度。
这些领域正是 AI 影像最先能商业化的地方|图源:TapNow
创作者敢不敢给出报价和工期?客户能不能提出修改?团队做完这一条以后,还有没有能力继续制作下一条?
当这些问题都有稳定答案,AI 视频才能变成一个行业,一门生意,它也会拥有一套比「效果展示」更具体的评价标准。
当 AI 视频从一个镜头走向一部作品,平台的竞争方式也会跟着改变。
第一轮竞争看的是模型和功能。谁接入的模型更多,画布更灵活,工作流更完整,谁就能吸引创作者。这些能力今天仍然重要,但正在逐渐成为 AI 视频平台的基本配置。
下一轮竞争,要看平台能不能持续产生完整作品,它能承接多复杂的项目,能不能让创作者从一个想法走到交付,又能不能聚集一批愿意长期使用这些专业能力的人。
TapTV 上不断涌现的中短片,就是一种答案。大量的优秀 AIGC 创作者在 TapTV 上分享制作过程,作品可以传播,方法可以学习,一些内容也借由 TapNow 引荐,开始进入专业展映和行业活动。
TapTV 上汇集了大量的优质 AI 短片|图源:TapNow
当这些经验继续回到新的项目里,TapNow 积累的就不再只是一组功能,还包括创作者、作品和逐渐形成的专业标准。
至此,文章开头的问题「AI 影像为什么开始需要一套操作系统?」也有了答案。
当创作停留在一次生成,一件工具就够了。项目开始变长以后,创意、资料、人物、场景、镜头和团队协作会陆续加入,还会在反复修改中不断变化。它们需要围绕同一部作品保持联系,也要沿着前面作出的决定继续推进。
Creative OS 处理的,正是从「想法」到「项目」的全过程。
从影视飓风推出教程,让普通用户第一次接触 AI 影像,到 TapNow 提供完整的创作环境,再到 TapTV 展示作品和工作流,最后进入电影节与行业活动。
TapNow 正在搭建一条从入门到专业创作,从一个想法到一部作品,全链路能跑通的路径。
两端之间那段漫长的制作过程,就是 TapNow 希望用 Creative OS 覆盖的位置。
*头图来源:TapNow