2026年7月,DeepSeek创始人梁文锋的一份内部会议纪要开始在网络上流传。这份纪要的核心判断,可能要比大多数行业分析都更激进:国产AI芯片替代正处于一个历史性的窗口期,而这个窗口正在快速收窄。
英伟达CUDA的护城河为什么正在瓦解
梁文锋的第一个判断直指行业共识的核心——英伟达的CUDA生态曾经被视为无法逾越的壁垒,但这一壁垒正在「快速瓦解」。原因有三:
第一,AI本身可以写代码了。过去要建立一套与CUDA平行的生态,需要海量工程师手动移植和适配,几乎不可能完成。但现在,用AI来构建这个生态,可以把英伟达的整套生态「全部写一遍」。DeepSeek自研的TileLang,正是用高级语言来写CUDA算子,结合AI完成移植。
第二,专用芯片时代的到来。CUDA是从游戏卡演变出来的,它的底层架构与游戏卡的设计一脉相承。但AI芯片越做越专——不管是华为还是英伟达自己,以后都是专用芯片,不再与CUDA绑定。对于一个专用芯片来说,CUDA的生态优势被大幅削弱了。
第三,生态信心的自我实现。在梁文锋看来,国产芯片的问题从来不是硬件不行或生态不行,而是产能不够。他预测「未来一年之内会有一个事情被验证:国产芯片的生态完全没有问题」。一旦这个事实被验证,信心到位,剩余的产能问题也会逐步解决。
DeepSeek自研的TileLang是一项关键的技术突破——它用高级语言描述CUDA算子,结合AI自动完成底层移植。这意味着不需要重写英伟达的整个生态,而是让AI来完成这个「翻译」工作。
华为950超节点:性能与价格的平替
梁文锋对华为最新发布的Atlas 950 SuperPoD(昇腾950超节点)给出了极为具体的评价:
「华为950超节点,在性能和价格上可以完全平替英伟达的GB200、GB300。」
950超节点基于灵衢互联协议和超节点架构,实现业界最大1024卡规模,提供1 EFLOPS FP8、2 EFLOPS FP4算力,256TB全局统一内存编址空间,TB级NPU互联带宽与3μs超低RTT时延。
梁文锋承认价格上「贵但贵得有限」——贵50%、100%甚至200%都可以接受,因为在任务上完全可以平替,「所有GB300能做的任务,华为超节点都能做,延迟都一样」。唯一的代价是四张华为卡顶一张英伟达卡,同时落后两年。
这里的关键不是性能指标的高低,而是可置换性——国产芯片已经进入一个可以规模化使用的阶段,不再是实验性的替代方案。
梁文锋的「四张华为卡顶一张英伟达卡」是一个务实的评估:代价是2~3倍的硬件投入和两年的代际差距,但换来的是供应链自主。在AI训练集群的规模效应下,这个代价是可以被量化和接受的。
从算力焦虑到电力约束
梁文锋的另一个微妙判断涉及算力的长期瓶颈。他指出AI最重要的就是三样东西:算力、算法和数据。
芯片层面有差距,但「技术和工艺迭代可以追赶」——更重要的是算力背后的电力。中国在电力领域有着明显优势,而美国和中国的电力差距只会越拉越大。在AI的长期竞争里,电力最终可能比芯片更关键。
梁文锋将AI竞争的长期瓶颈从芯片转向电力,这与中国特高压电网、西部绿电基地和新型储能体系的发展形成呼应。在一个芯片受限的世界里,能源自主可能成为最终的决定性优势。
产能问题在今明后年甚至更久的时间内都会存在,但五年之后未必。他表达了一种谨慎的乐观:「我不太相信未来五年之后,我们还卡在产能的问题上。」
开源阳谋与美国的算力叙事
梁文锋在更宏观的层面做了一个判断:谁想着靠AI暴利谁就死。他认为AI最终可能占人类社会GDP的10%,但任何人都无法独占——「拿得少的人一定打败拿得多的人」。
这个判断与DeepSeek和Kimi K3等国产模型的开源策略一脉相承。Kimi K3以2.8万亿参数、100万Token上下文窗口、开源协议,直接冲击了美国闭源模型的估值逻辑。高盛在报告里也在问:如果杨植麟能用有限的算力训练出媲美顶尖闭源模型的Kimi K3,那AI还需要这么多算力吗?
梁文锋把这件事比作「新时代的星球大战」——被拖进泥潭、不得不烧钱开路的现在变成了美国。问题不在于国产芯片能不能追上,而在于美国还跟不跟这场游戏。
开源模型通过社区贡献降低研发成本,通过全球采用摊薄边际成本,通过透明度吸引信任和合作。在「算力受限但电力充裕」的不对称格局下,开源阳谋是一个价格战逻辑——只要美国不能承受无限烧钱,它就不得不面对开源生态的侵蚀。
- 观察者网 · 2026-07-24 12:31 — 梁文锋内部会议纪要流传