TaoZ Capital刘勇:AI创业成功率的核心计算公式
9月底,TaoZ Capital创始合伙人刘勇走上北京大学《AI创业与投资》第三课的讲台。
这门课的前两讲,百川智能王小川讲的是创业者如何站在非共识的一端,金沙江创投朱啸虎讲的是互联网与AI创投逻辑的异同,都是宏观图景。
刘勇反其道而行,讲微观:把创业拆成一道可以像物理题一样,一步一步推导的算术题。
刘勇本人的经历,正好横跨这门课要讲的三轮技术周期。
他本科毕业于北京大学,学的是物理,之后赴美拿了UIUC计算机硕士和Kellogg商学院MBA。2003年联合创办社交网站亿友网,2008年创立热酷,做成亚洲最大的社交游戏公司之一;2021年加入蓝驰创投任投资合伙人,重点投AI和Web3;2026年创立TaoZ Capital(道中资本),以孵化者而非纯财务投资人的姿态做AI早期投资。
先交代三件事:
1、本文是潮涌AI根据刘勇北大演讲的现场录音整理稿和课程公开笔记综合整理,未经讲者审定;口述体整理,以第一人称呈现,部分口语表述有精简;凡课堂之外的信息,均以“背景补充”标出,与讲者原话严格区分。
2、我们核心收录了AI创业方法论和商业判断的部分,并切分成观点式发布;
3、课堂课件的部分演示细节和问答没有全部收录,想对照原文的读者可以自行搜索其他整理版本。
这篇口述稿的核心内容:刘勇给出了他的“战场优先框架”——一个关于成本的公式(机器加能源,对比人的工资),并指出成功率才是公式里真正的杠杆;他用单步成功率连乘的数学,解释了“AI什么都会、又什么都做不成”这个普遍困惑;用DeepSeek R1开源后87天的窗口期,讲清楚了时机判断怎么量化;最后落到AI产品经理的新基本功“评测”、中美的两本账,以及AI创业最常见的三个坑。
以下为演讲实录的正文部分——
01
开场:创业也有公式
三十年前,我和台下的同学一样坐在北大的教室里,学的是物理,一门非常硬核的学科。
今天我想沿袭学物理的精神,用第一性原理,从创业者的视角,非常hardcore地看一下创业这个过程一步一步会怎么走。你真的掌握了一些基本能力之后会发现,创业也是有公式的,有的地方完全可以像学数学分析一样,一步一步推理过去。
这堂课只讲两个变量:赛道和时机。
赛道决定你进的是不是一个值得打十年的战场,它决定赔率——一块钱能赚几块钱;时机决定你进场的时候账能不能算得过来,它决定胜率。
用投资语言翻译,就是VC最爱问的三个问题里的两个:why this,why now。
先说我的核心判断:
AI创业,先学会算账,再谈理想。
算清成本拐点,算准时机窗口,算对稀缺转移。
这三笔账算明白了,很多争论自己会消失。
02
赌赛道,不赌骑师
红杉有一本书叫《赛道为王》,总结成一句话:Bet on the racetrack,not the jockey。
赌赛道,不赌骑师。
红杉会在同一条赛道里同时投两三家公司,赌的是赛道本身。
当然这种打法对创业者是忌讳的,你选VC的时候要想清楚对方在赌什么。
我的判断是:一流的赛道,三流的创业者去做,成功的概率会显著高于一流的创业者去做一个垃圾赛道。一流赛道会放大普通人的能力,三流赛道会吞没顶尖选手的才华。如果一个顶尖选手再叠加一流赛道,这个buff就更大了。
这是我自己创业时没完全想明白、进了VC之后才发现的不成文规则。《孙子兵法》说“善战者求之于势,不责于人”,势大于个人能力。
选择大于努力,这话是鸡汤,但它是对的。
03
快与慢:方向值得花一年
创业不怕你跑得慢,最怕的是你在错误的战场上跑得快,使劲跑,拼命跑,这就南辕北辙了。
如果你预计用八到十年做成一家公司,花十分之一的时间,也就是一年左右认真选方向,是值得的。
选完也不是结束,公司做大之后每个季度要复盘一次:赛道还成立吗?战场变了吗?很多公司死掉,病因不在当初选错,而在选对之后世界变了,它没跟着变。
一个大决定做得慢,执行和验证做得快,两个阶段用两套操作系统,不要混用。
怎么检验一个方向?三条标准。
第一,符合第一性原理,有真实用户愿意用、愿意付费。
注意“愿意付费”四个字,很多AI产品用户愿意用、不愿意付费,这就是账算不过来的信号。
第二,可量化、可证伪。
讲不出来“什么数据出现就证明我错了”的方向,不要进。
第三,放进长期的技术和经济周期里依然讲得通。
我自己看赛道,大概一半时间花在研究历史上,一半留给判断未来。
04
康波周期:要拥抱泡沫
为什么苹果、微软这些跨世纪的公司会在同一时期扎堆出现?为什么比尔·盖茨和乔布斯都生于1955年?因为它们都诞生在新技术拐点附近:新技术先改变成本结构,成本结构催生新的用户习惯,旧巨头的组织、渠道、定价跟不上,窗口就打开了。
扎堆不是巧合,是同一扇窗被同一批人看到了。
理解这个过程的时间尺度,需要康波周期这把尺子。
经济存在50到60年的长波,复苏、繁荣、衰退、萧条,每一轮对应一次重大技术革命。
处在周期不同位置,打法完全不同:引入期拼的是对技术方向的定义权;爆发期拼融资能力和扩张速度;扩散期拼成本、效率和交付;萧条期拼现金流,活下来的人吃掉倒下的人的市场。
AI现在基础能力的引入期已经过去,正在进入扩散期,主角不再是“谁模型更强”,而是“谁能把能力变成便宜、可靠、可规模化的交付”。
图源:网络
还有一点我想对北大的同学说:一定要有丰富的想象力,要拥抱泡沫,千万不要怕泡沫,拥抱泡沫才能够致富。
每一次技术革命都是一场大的发牌,它给普通人三个结构性机会:生产力百倍提升带来全新的增量市场;老一代的经验清零,所有人重新站在同一条起跑线上;生产要素级别的壁垒普遍降低。
大家往往只记得恐惧泡沫,但泡沫恰恰是新人上桌的时候。
05
一个成本公式:成功率才是真正的杠杆
讲完宏观周期,进入全场最核心的一套公式。
需求以价格的形式出现:每小时你要付给别人多少钱来完成这件事——咱们北大的机会成本,肯定比隔壁更高。
供给端由两部分构成:资本(以机器体现)加上能源。
工业时代能源是煤、石油、电,今天AI时代的机器就是大模型,能源就是电和算力。
只有新的供给成本显著低于人力成本,替代才会真实发生,创业的窗口才会打开。
但AI和过去的机器有一个本质区别:AI是概率产品,会失败,失败了需要人工接管。
所以,供给端的真实成本,必须加上失败介入的成本,再除以成功率。
我给一组测算:成功率90%的时候,总成本只比理论值高2.2倍;成功率只有20%的时候,总成本会高45倍。
成功率,才是这个公式里真正的杠杆变量。
这个数学还能解释一个常见的困惑:为什么大模型看起来无所不能,用起来却处处碰壁?一个复杂任务由n个简单步骤组成,整体成功率约等于单步成功率的n次方。
50步的任务,单步95%成功率,整体只有约8%;单步99%,整体约61%;单步99.9%,整体才能到95%。
而咱们真实面对的任务可能要一万步、十万步。这就是为什么“演示时很惊艳”和“生产环境真能用”之间隔着一道鸿沟。
工程上的含义是:不要追求每一步都到99.9%,找出流程里5%到15%的关键节点,在这些节点上用人把关。
机器跑完95%的流程,人只在最容易错的地方介入一次,整体成功率就能拉到可用水平。
06
87天窗口:时机是可以算出来的
时机怎么判?找能力拐点。
模型能力是连续进步的,但你的机会是不连续的,是一个阶跃函数。
2025年1月,DeepSeek开源了推理模型R1。
之后中国出现两家现象级的通用Agent公司:Manus 3月6日发布,蓝驰投资的Jasper 4月8日发布,距离R1开源只有两到三个月。
那个窗口期一样的只有87天。
后面再做所谓的通用Agent,再也不可能成功了,因为模型已经做到那儿去了。
所以,那时候只有拼命快,7×20小时这样去干,把它干出来。你必须在拐点来临之前,就等在风口。
(背景补充:Manus后来上线的增长印证了窗口期的速度——上线270天ARR突破1亿美元;2025年12月Meta宣布以20亿到30亿美元收购其母公司蝴蝶效应,但这笔交易在2026年4月被国家发改委以国家安全和关键技术流向风险为由叫停。这是公开报道,不是课堂内容。)
再说Claude Code。
自动化编程这件事,项目负责人Boris大概2022、2023年就想做,2024年产品做出来了,但很不好用;2025年1月勉强可用;直到2025年5月22日Opus 4发布,能力突然跃升到60%到70%的可用区间。
即使是Anthropic自己,做Claude Code本质上也是“为下一代模型做产品”——先做出来,等模型能力追上来。
更何况咱们应用公司呢?
需求常在,但机会窗口只是偶尔开放。
07
冲浪三天法:为下一代模型做产品
我把这套观察总结成一个方法,叫“冲浪三天法”:所有成功的AI应用公司,本质上都是在为下一代模型做产品。
浓缩成三句口诀:为下一代模型做产品,测量今天,重估昨天,预测明天。
具体做法是给AI产品经理加一门新基本功:懂评测。
这里要区分benchmark和evaluation两个概念:benchmark是宏观通用的评测集,今天很多已经被打满分,反映不了真实能力差距;evaluation是针对自己产品场景,自己设计的十几二十条具体任务,比如订机票的完整流程,持续衡量完成质量、速度、失败率和返工。通用榜单涨10分,不等于你的用户多付1分钱;你自己的20个样本涨10分,才等于。
样本怎么选?覆盖三类:用户最常做的任务、历史上最容易失败的任务、下一代模型可能新解锁的任务。
看到一项能力的评估分数从10%涨到20%,突然跳到40%,再到60%、70%,你就知道拐点要来了。
AI产品经理要找的,是需求曲线和能力曲线的交点。
已经很容易完成的任务,继续优化价值有限;长期做不出来的任务,不适合现在的产品。
交界处的任务,既有用户价值,又能随模型进步持续改善。
这是AI产品经理比互联网产品经理对技术理解要求高特别多倍的原因——否则你做的,别人也能做,模型公司也能做,你怎么办?
08
中美两本账:去找自己的变量
成本公式右边的人力成本,中美差距悬殊,美国部分知识岗位的人力成本大约是中国的三倍。
供给成本持续下降的曲线,会先触达美国那条更高的线,再触达中国这条更低的线。
这就是为什么今天不管模型公司还是应用公司,收入大部分甚至全部来自海外高端市场——那边的客户付得起更多钱,替代的价值更大。
这套框架里还有一个重要变量,我叫它“国运”,它会同时改变公式两端的价格。
中国新能源车最早完全靠十年政府补贴培育出来。这一轮AI浪潮里国运的作用比移动互联网时代大得多,因为它需要从零到一的基础科学突破和大规模工程能力。
Anthropic的CEO是纯理科背景,物理学博士,曾是物理奥赛出身;我认识的前OpenAI员工说,2021、2022年前后公司里学物理的是最多的专业。
这也是我判断北大这一波一定会跑出很牛的师生创业公司的原因:从基础科学到产业转化的路径,从未像今天这样短。
中美对比,课件上有一组数字:2025年美国私人市场投入AI约2859亿美元,对应5427座数据中心;而2024年中国工业机器人的全球安装量占比54%,约29.5万台。
这不是“谁投得多谁赢”,而是两个国家在两条不同赛道上各自领先:美国领先在资本和算力密度,中国领先在制造和部署规模。
差距这么大的情况下,就不要想着一定要在算力、算法上比它好——对方能用更多的钱抢更优秀的人,甚至把你培养的人直接挖走。
要去找我们自己的变量,比如具身智能,恰好是中国能和美国正面竞争的大杠杆。
不要问中国机会大还是美国机会大,要问账在哪边先算通。
09
三个坑:大而全、钱太多、人太多
第一个坑,做大而全。
AI看起来什么都能做,诱惑你一上来就做平台、做生态。
但扩散期的机会恰恰在具体:一个任务、一个工作流、一个付费场景。平台是打赢之后的结果,不是开局的姿势。
第二个坑,融资太多。
钱会掩盖问题,让你误以为“有钱”等于“有需求”。
融资节奏要跟着验证节奏走,每一轮钱都对应一组要回答的问题,答不出来就不要拿下一轮。
融资是手段,不是里程碑——真正要回答的永远是:这笔钱买到了哪个假设的答案?
第三个坑,团队太大。
AI把开发成本打下来之后,小团队能做的事比以前多得多。
一条简洁的分割线:凡是跟人打交道的,用关键人才;凡是基本不用和人打交道的,交给AI。
一个简单的检验:如果这个人离职,AI能不能在两周内补上?能,就交给AI;不能,就是你的关键人才。
10
现场问答精选
Coding赛道还有机会吗?
今天Codex和Cursor加起来只服务了大约五千万核心程序员,但AI coding真正的想象空间,是让全球十亿量级的普通人成为“vibe coder”。市场存在,不代表机会属于创业公司——很可能这块蛋糕最终被模型公司自己吃掉。
(背景补充:刘勇课堂上用Cursor的时间线回答“复制Cursor还有没有机会”:2025年1月ARR破1亿美元,6月破5亿美元,11月以293亿美元估值完成D轮融资;2026年8月,SpaceX以600亿美元全股票完成对Cursor母公司Anysphere的收购,成为风险投资史上最大规模的创业公司收购案。以上为公司公告和公开报道。)
医疗能不能进?
受监管的医疗场景,对普通创业者几乎永远不是一个好的进入时机,除非你能真正降低监管摩擦,或者和医院深度绑定。医疗的账不能只算技术账,还要算“进医院的门要敲多久”这笔时间账。
通用人形机器人呢?
获取数据没有壁垒,算法也没有壁垒,靠“快”根本追不上大公司的资源投入。大家就别搞了。如果一定要做,去海外做垂直场景,不要在国内卷通用赛道。
小公司做出创新,被大公司抄袭怎么办?
靠“点子新”防守在今天不现实。
要分层竞争:从一个小需求、小市场做到0到1的垄断,积累数据再往前走;还没有可防御的数据壁垒时,就不断尝试各种小市场,而且这个“不断尝试”的周期要非常短,不是半年一年换一次方向,是以月甚至更短为单位。
硬件会不会诞生下一个“手机”?
目前还没有真正跑出来。
眼镜曾经被寄予厚望,但能不能替代手机还没有被完全证明,关键在于模态够不够——获取数据的能力不够,捕获的信息就不够丰富。
想做硬件的同学可以去看CES:喂鸟、拍鸟、养鱼这些看起来小众的硬件,每一个赛道都能做到十亿美元规模。
判断硬件机会我只看两条:输入是不是新的,需求是不是每天都发生。
做决策靠数学推演还是商业直觉?
更偏向数学。
唯一的例外是判断人、和人打交道的时候,这部分没法完全靠第一性推理。
除此之外,绝大多数创业决策都值得放进第一性原理的框架里推演。
我的习惯是:先算账,账算不通的直觉不要信;账算通了,再用直觉决定下多大的注。
11
收束:把热闹变成算术
最后把这堂课收成一句话:
把热闹变成算术。
AI创业的噪音会越来越多,模型发布、融资新闻、泡沫争论,每周都有新的。
但噪音之下,账是稳定的:成本拐点到了没有,窗口打开了没有,稀缺转移到哪了。热度是大家的,账是自己的。算不清楚账的热闹,看得越认真,亏得越快。
如果你听完这堂课只带走一张纸,上面应该写四个问题:
第一,我的任务拆成多少步,每步成功率多少,连乘之后是多少;
第二,AI做这件事的总成本(含返工和人工介入),什么时候低于人工;
第三,我的场景里,什么正在变便宜,什么正在变稀缺;
第四,如果我的判断错了,哪个数据会最先告诉我。
四个问题都有答案,再动手。
(本文为课堂录音及公开课程笔记的口述体综合整理稿,未经讲者审定,未尽之处以现场为准。文中“背景补充” 内容来自公开报道,与讲者原话无关。)
本文来自微信公众号“潮涌AI”,作者:潮涌AI编辑部,36氪经授权发布。