26岁从智源“毕业”,到26年融资超10亿,仅4年就跻身AI独角兽

策划/撰文:星愿大叔    系列:智源研究院系列 · 第4期

2024年6月,斯坦福。

一支斯坦福的AI团队在GitHub上开源了一款多模态模型,名字叫 Llama3-V,他们说这是"完全自主研发"。

一周后,一家中关村的小公司站出来,甩出一行代码对比图:

“你们这个模型,连里面那行中文标注的错误都原封不动——你们抄的是我们的。”

抄的是MiniCPM-Llama3-V2.5,参数2.6B,这家公司叫面壁智能

抄它的是斯坦福。

故事的荒诞就在这里:

当整个AI行业都在拼命造更大的模型——千亿参数、万亿参数、估值百亿——北京清华科技园里,一家成立不到两年的小公司,做了一个几乎没人看好的决定:

把大模型,做小。小到能跑在手机上。小到能塞进汽车的驾驶舱里。小到参数只有几十亿,而不是几千亿。

这件事在当时,全行业都觉得"不太对劲"。

但仅仅几个月后,这家公司登上了Nature Machine Intelligence的封面论文

而它背后的技术一号位,那年 26岁

01他叫曾国洋,8岁开始写代码

曾国洋,1998年生。如果你要给他贴标签,可以贴一串很吓人的东西:高二全国青少年信息学竞赛金牌(全国前50)、亚太信息学竞赛金牌、保送清华、大二进清华NLP实验室、开源社区OpenBMB发起人、BMTrain/BMInf主要作者——这几个标签随便拎一个出来,都够普通人吹一辈子。

但对他来说,这些只是铺垫。

真正的故事,是从他走进北京智源研究院那天开始的。

2020年,智源启动"悟道"大模型项目,目标是中国自己的超大规模预训练体系。曾国洋作为核心团队的骨干,参与了悟道·文源中文预训练模型的训练工作。那是中国第一次真正意义上的"百人大模型会战"——数千块GPU、上百名顶尖人才,在张宏江和黄铁军设计的框架下,干一件当时全世界都没人干成的事。

那两年,曾国洋做的最核心的工作是什么?

怎么把模型做出来,还能跑得动。

数据怎么洗、参数怎么调、训练效率怎么优化——全链条实战。

这套经验,在后来,被他原封不动地搬进了面壁。

2022年8月,面壁智能成立。

创始人有两个:刘知远(清华副教授、智源青年科学家)和曾国洋(智源悟道·文源核心骨干)。

你去看当时国内的AI创业潮:几乎所有头部项目都在说同一句话——把模型做大,做到GPT-4的水平,然后去融更多的钱。

智谱、月之暗面、阶跃星辰……每一家都在比谁的参数更大、谁的估值更高。

面壁说:不,我们做端侧。

什么叫端侧?

就是模型不跑在云端的服务器里,而是直接装进手机、汽车、电脑这些终端设备。你打开手机,不用等网络返回,直接就能用。

这个方向在2022年听起来有多不主流?

这么说吧:当时投资人的标准问题是——“你们做端侧,那算力从哪来?手机能跑得动大模型吗?”

面壁的回答是:能。问题是你们以前做的方式太笨了。

02Think Different

面壁的底气,来自刘知远在2024年底提出的一条规律。

不是在公司内部,是在CCAI 2024(中国人工智能大会)的学术讲台上。

刘知远的团队说:大模型的能力,正在以一种可预测的方式变强——不是靠把模型做大,而是靠把同样能力的模型,做得更小。

他们把这种现象命名为:密度定律(Densing Law)

核心结论只有一句:大模型的能力密度,每约100天翻一番。

什么叫"能力密度"?可以粗暴理解为:为了让模型达到同样的智能水平,你所需的参数数量在持续下降。

他们给了一个让人后背发凉的对照:

2020年,要做一个能达到 GPT-3 水平(当时最强模型)的智能系统,你需要 1750亿 参数。

2024年2月,你只需要 24亿 参数——差不多是原来的 1/73,就能达到同等水平。

训练所需的算力,下降了一个数量级。

推理成本,20个月里降到了原来的 1/267

GPT-3.5级别的模型能力,现在(2026年)4B、8B参数就能达到。

而密度定律告诉我们:这条曲线,还在继续往下走。

刘知远有一个预测,后来被写进了论文:按这个速度,2026年左右,一个8B参数的模型,就能达到GPT-4o的同等水平。

如果这个预测成真,那整个行业的逻辑就要翻转:

不是"模型越大越好",而是谁能把更大的智能塞进更小的参数里

面壁,就是这条赛道的提前入场者。

面壁把自己的端侧模型系列叫做 MiniCPM——内部代号"小钢炮"。

这个名字后来被整个AI圈叫开了。

因为它的战绩,真的像小钢炮一样凶猛:

2024年2月,MiniCPM-2B发布。参数2.6B(比Mistral-7B小了近七成),中文能力、代码能力、数学能力,全面超越Mistral-7B——后者是当时公认最强的开源模型之一。

一个2B,打赢了7B。

CPU就能跑,手机开飞行模式,实测每秒生成约6.5个token。

2024年9月,MiniCPM 3.0,4B参数,达到 GPT-3.5 水平。量化后只占2.2GB内存——相当于一个普通手机App的大小。

2025年1月,MiniCPM-o 2.6,8B参数的多模态模型。在 OpenCompass 评测中,综合得分 70.2分,单图理解能力超越 GPT-4o-202405、超越 Gemini 1.5 Pro、超越 Claude 3.5 Sonnet

注意:这是一台 8B 的模型,而被它打败的对手,参数都是它的几十倍到上百倍。

它还能跑在 iPad 上,做实时的音视频交互。

2025年8月,MiniCPM-V 4.5,在多模态图片理解上,超越 Qwen2.5-VL 72B(后者参数是它的9倍)、超越 GPT-4o、超越 Gemini-2.0-Pro

2026年5月,MiniCPM-V 4.6,1.3B参数,仅需 6G内存,同类全球第一。

同月,BitCPM-CANN系列:中国第一个基于华为昇腾训练的1.58-bit端侧大模型。

每一代产品,都在做同一件事:用更小的参数,打更大的对手。

截至2026年4月,MiniCPM系列在 GitHub、HuggingFace 等平台累计下载超过2400万次,成为国内除阿里外唯一拥有端侧模型"全家桶"的AI开源厂商。

所以,2024年6月斯坦福的那次抄袭,不是偶然的。

一个全球顶级AI团队的工程师,在浩瀚的开源世界里找到了一个模型——2.6B参数,效果惊人——他们没有选择自己复现,而是决定直接"借鉴"。

"借鉴"到连代码里中文注释的错误都原封不动地搬了过去。

这件事后来被面壁发现。面壁发了一份措辞克制但证据详实的声明,斯坦福团队删库跑路,在Reddit和Twitter上引发轩然大波。

但这件事的真正意义,不是"我们被抄了"。

而是一个隐含的认可:这个2.6B的端侧小模型,值得斯坦福团队冒险去抄。

在AI的世界里,被谁盯上、被谁模仿,永远是一种实力的认证。

而面壁,用一块"小钢炮",撬动了一次跨越大洋的知识产权争议。

03 10个月,从零到量产上车

技术厉害是一回事,能不能落地是另一回事。

面壁解决这个问题的方式,是找了一个"最能打"的人来操盘商业化。

李大海,北大数学系硕士,Google中国创始员工之一,后来在知乎从零搭建搜索和推荐体系,把知乎从百万用户带到亿级。2015年加入知乎,任合伙人、CTO。

2023年6月,李大海出任面壁智能CEO。

他的任务很明确:把清华实验室里跑通的技术,塞进真实的工业场景里。

第一个目标是汽车智能座舱

2025年8月,面壁宣布成立汽车业务线(一级组织)。合作车企名单:吉利、大众、长安、长城、广汽,外加芯片厂商英特尔、中科创达。

然后是一条让整个汽车行业侧目的时间线:

2025年4月23日,长安马自达 MAZDA EZ-60 正式上市。这是全球首款搭载面壁端侧大模型量产车型,智能座舱全部由面壁提供。2025年9月,与吉利中央研究院联合定制的端侧VLA多模态大模型(0.9B参数),在吉利银河M9智能座舱正式量产部署,具备舱内外多模态感知、实时响应、主动决策能力。

从2025年初"从零开始"到量产车正式上路——10个月

行业惯例是一年半到两年。

刘知远负责"定义未来的方向",曾国洋负责"把模型做出来还能跑",李大海负责"把它融进真实的工业体系里"——三种能力,在同一家公司里凑齐了。

04技术兑现

曾国洋和刘知远在智源的那两年,亲眼见证了"密度定律"描述的现象正在真实发生:每过100天,把同样智能塞进更小参数的难度,就会降低一倍。

他们看到的是:当这条路走下去,2025年、2026年,端侧模型的能力会达到云端模型的水平。

那时候,谁有端侧模型,谁就拥有最广泛的分发渠道。

手机、汽车、机器人、物联网设备——每一个终端,都是面壁的潜在用户。

这不是一个关于"小模型"的投机,而是一张押注在十年后的彩票。

只不过,这张彩票在2026年,已经开始兑现了。

刘知远在提出密度定律的论文里,写过一段话,后来被反复引用:

“随着芯片电路密度(摩尔定律)和模型能力密度(密度定律)持续增强,AI的能力将会像现在的CPU一样,渗透进每一种终端设备,从云端下沉到指尖。”

这段话,或许就是Think different的注脚。

2026年面壁智能累计融资超10亿,跻身基模独角兽行列。

面壁仅用4年就成功迈入独角兽行列,不仅是资本的认可,也是你打开手机、调出车载语音助手,那里面运行的,可能就是来自面壁的模型——无声无息,无处不在。

就像当年的CPU一样。

图片

图片

声明:本文为维科号作者发布,不代表维科号立场。如有侵权或其他问题,请及时联系我们举报。