字节游戏的AI试错,这回试出了路
7月17日,字节游戏旗下朝夕光年发布了首款AI全流程制作的超写实修仙互动作品《不问凡尘》的第二支PV(Promotion Video)。
这款修仙题材的买断制互动产品里,几乎所有的场景、人物、战斗动画都由Seedance等AI模型生成。
从去年10月立项到今年以来两度发布PV,这仅用了不到1年的时间。
日前,华尔街见闻·全天候科技与《不问凡尘》总制作人昕玠及其所在的团队江南工作室展开了一场深度对话。
不到一年的开发周期背后,其实是团队和AI模型的共同成长。
去年立项时,当时AI视频模型生成的人物还处在“人都不像人”的阶段,团队不得不像做Flash动画一样,一帧帧手插关键帧再交给模型链接。到今年春节,Seedance2.0正式发布后视频跨过“恐怖谷”阶段,模型开始能理解人物表演,制作效率才迎来质的飞跃。
即便如此,昕玠在交流中反复提到的一个词让人印象深刻:“勤奋”。
在AI工具日新月异的今天,这似乎是一个格格不入的词。
但昕玠给出了一组数字:为了达到更好的效果,团队的抽卡成功率一度只有2%。
要制作一个15秒的片段,每次可能只能抽出5秒团队觉得合适的素材,而这5秒需要抽20到100次不等。复杂镜头甚至要抽100多次,才能选出3到5秒钟可用的内容。
“工具虽然在进步,但你怎么样使用工具、做出更好的内容,一部分是等着工具进步,一部分还是人的勤奋和耐心。”昕玠说。
一
不断试错
《不问凡尘》是昕玠所在团队江南工作室做的第四款AI游戏,前三款的命运像是一部浓缩的AI试错史。
第一款是一个“老板模拟器”:玩家扮演老板,通过自然语言和员工对话,管理他们的状态,完成模拟经营。
团队当时兴奋于AI识别非结构化数据的能力。传统输入是结构化的数字和表格,而AI能理解一段话的意思。
但做完demo,他们还是把项目砍掉了。
原因很简单,自然语言交互是一种“非常重”的交互。传统游戏里,玩家按几个按钮就能获得大量的画面反馈和情绪渲染;而在这个模拟器里,玩家需要不停打字,交互负担大幅增加,反馈却没有相应增强。
团队总结出了一条原则:最好的产品,交互很轻,反馈却很强烈。
第二款是“穿书游戏”。玩家养成不同的角色,带他们穿越进不同的故事世界。例如团队曾在游戏中带着林黛玉去霍格沃茨,AI发挥出了令人惊喜的涌现能力:林黛玉不会念“Wingardium Leviosa”这样的咒语,是通过作诗来施法。
那个瞬间让团队觉得“太好了”,既符合哈利波特的世界观,又完美贴合人物的时代背景。
但这款产品同样夭折了,问题出在了AI的记忆能力,角色经常“脑子乱码”。例如带角色打完世界杯,再去打三体舰队入侵,AI会说“我要用世界杯决赛的4231阵型来分析三体舰队的战术”。
团队花了一个多月试图解决,发现这是模型能力的边界,靠工程化的能力难以实现突破。
第三款叫“我是大导演”。玩家培养明星、选角、改剧本、争票房,AI生成明星拍摄的电影等预告片来反馈。
团队至今觉得这个玩法很有趣,但卡在了运行成本上,需要等视频模型的价格再降一到两个数量级才有可能推进。
但正是在做“我是大导演”的过程中,团队误打误撞地发现了一件事:让一个AI生成的真人在屏幕上动起来,随着玩家的选择做出不同反应,这本身已经构成了一个最小的游戏循环。
当时,团队只是从网上随手找了一张人物图,确定首尾帧,让AI填充中间的部分。动起来的那一刻,那个人物有一种真实感。
“这有点新时代引擎的感觉。”团队做了一个抉择:放下手头的项目,围绕这个“引擎”做一款完整的游戏。
这就是《不问凡尘》的起点。
二
一个AI团队在做游戏
“我们是一个做游戏的AI团队,而不是一个用AI的游戏团队。”昕玠所在的团队成员们再次向全天候科技强调了这个区别。
2026年的游戏行业,早已不是新鲜词,很多公司都在一套已经跑通的生产线上加装AI模块,从素材创作、美术制作到文本生成等环节都有AI的身影,但以AI为核心驱动力而创作的游戏确实少见。
《不问凡尘》从第一天起就不太一样,几乎所有内容,包括场景、人物、战斗动画等都由AI生成。
AI是这款游戏成立的前提。
早在去年《不问凡尘》正式立项前,团队就搭了一套内部工具,把生图、视频等模型的多模态能力集合到同一个平台上。如今这套架构正在全面CLI化,导演不用再逐个打开模型、上传素材、调整参数,直接告诉Agent自己要什么画面,系统完成调用和衔接。
与此同时,团队专门配了导演团队。AI生成的视频需要有人把控,包括战斗动画怎么拍增强感、剧情怎么设计才有感染力,这些问题难以通过几句提示词解决。
《不问凡尘》团队一开始想找外部伙伴合作,但发现这件事很难,因为不少传统的导演对AI熟练程度有限,不知道如何用agent去做生产,各方的审美也有差异。
最后,团队的负责人还是决定为成员提供AI工具使用的培训,转换大家的思路。
架构可以主动调整,但模型的能力不是团队能决定的。
去年项目刚筹备的时候,AI视频模型生成的视频还处在“人都不像人”的阶段,制作过程更像是做Flash动画。
“要让一个角色笑,你不可能给AI一张图说‘让他笑’,模型根本无法理解。所以得先画一张正脸的关键帧,再画一张笑脸的关键帧,然后让视频模型把两帧连起来,当时每5秒就需要一个新的关键帧,所以那时候我们团队很需要懂构图的人。”团队中一个成员向全天候科技表示。
转折发生在Seedance 2.0。
据团队介绍,Seedance从关键帧的链接工具变成了“副导演”。
你告诉它两个人在一个场景里面对谈,给它场景图片、人物三视图和声音,它能理解空间关系和透视,自主完成表演,交付一个完整片段,制作效率终于从“帧”跳到了“片段”。
目前Seedance 2.0单次能生成15秒视频,即将发布的2.5版本将会提升到30秒。
“AI视频仍然是一个婴儿时期。”团队中一个成员表示,“但它已经迈过了恐怖谷,能随着你的创意和审美带来一些不错的作品。”
模型能力提升后,98%的失败率仍然是日常。团队觉得很多人对AI制作的理解有一个误区,以为差距来自提示词。
“你很难说我有一套惊天动地的提示词,能让模型做出超越它的东西。这已经不是现在的时代了。网上很多AI制作的分享,确实能帮你完成0到1”,团队表示,“但怎么从1做到100?还是靠刻苦、投入。这两件事在AI时代往往被忽视,但其实一直都在。”
三
与模型“对赌”
立项时最大的赌注是对模型发展速度的判断。
团队需要在demo和框架搭建完成后的6个月进入量产,而那时模型能否达到可用水准,谁也说不准。
“赌得太激进,项目会难产;赌得太保守,你在做一个上个时代的产品。”
AI内容产品有明确的窗口期。模型大约每三个月小更新、每六个月大迭代,今年做的内容放到明年可能就“不够看了”。
这和传统影视行业截然不同,10年前拍的电影和今年的电影,在画质、镜头、服化道上差别并不大。但AI领域还在一条陡峭的上升曲线上,“你得掐好产品的周期,去做整个团队的节奏和管理。”
团队其中一位负责人承认自己赌得“有点厉害”。
项目立项时,有些团队成员认为太激进。当时的AI模型能力要完成游戏的量产看起来相当困难。“但本身愿意去做这样内容的团队成员,还是都比较相信这个方向。”
现在来看确实“赌对了”。
谈及字节对游戏业务的耐心,这个在外界常被质疑的话题。团队不少成员都认为内部支持是足够的,“管理层整体愿意在这个方向做投入,你才能试出这样一款项目。”
《不问凡尘》计划2026年Q3上线Steam平台,以早期体验的形式首发约60%的内容,之后持续更新至完整版本。
如今团队一边铺量做内容,一边修复此前版本的完成度,正处在紧锣密鼓的量产阶段。
对于这款游戏能否成功带动更多同类产品的出现,团队保持着一种开放的心态。
“如果产品结果好的话,对于良性的行业竞争来说,大家就会来一起做。整个市场足够大,容得下很多人。”团队表示,这也意味着相关制作能力的人才、制作方式就不用团队自己在内部做那么多培养,整个行业的良性发展会让这一切变得更容易。
四
影视与游戏之间
团队一位负责人用画一条线来解释自己在做的事情。
最左端是传统电影,没有任何选择,观众观赏一个写故事,略微往右是《盛世天下》这类真人实拍互动影视,几十到上百个选择点、几条主干分支,但本质上还是“欣赏一个别人的好故事”。
最右端就是传统游戏。玩家每分钟进行几十个操作、技巧搭配、策略决策、密集的交互和反馈构成核心。
《不问凡尘》的位置在这条线的中间偏右。
“真人实拍的优势在于渲染人物更加细腻,在以情节打动观众这件事上,真人目前是更好的呈现方式,”团队一负责人坦言,“但我们做的并不是一个好看的剧情,而是一个好玩的互动产品。整个游戏的有很多段表演,你不可能让真人演员都演一遍,只有AI才能做这些事情。”
AI正在给影视和游戏的交叉地带带来全新的可能性。
在团队看来,游戏和影视是迄今为止都没有被UGC化的行业。短视频、图文内容已经进入了人人可创作的时代,但拍一部电影、做一款游戏的门槛仍然高得让普通人真正期待而又却步。AI正在改变这件事,大幅提升了创意落地的速度和效率,有可能让更多人拥有表达的能力,为消费者带来更多样的体验。
团队已经在做一些小尝试。团队透露他们计划在ChinaJoy期间举办线下活动,邀请玩家到团队现场拍摄一张照片,可以用AI把玩家的形象放到游戏里,现场体验自己在修仙世界中的样子。
《不问凡尘》或许有望成为AI游戏的重要风向标。AI视频驱动的游戏或许不再只是一个概念,而是一条可以规模化复制的路径。
从《老板模拟器》,到一个脑子乱码的《穿书游戏》,再到一个乐趣无穷但太贵的《大导演模拟器》,最终走到《不问凡尘》,这一路上工具在迭代,模型在进化,但有些东西始终没变:对技术方向的判断、过程中的那些笨功夫。
AI在变快,但勤奋和耐心没有捷径。
本文来自微信公众号“全天候科技”(ID:iawtmt),作者:郑敏芳,36氪经授权发布。