📝 本期播客简介

本期我们克隆了:知名播客 The MAD Podcast with Matt Turck Cerebras CEO: Why GPUs Can't Do Fast Inference

原内容更新时间:2026-07-23

本期嘉宾是 Cerebras 联合创始人兼 CEO Andrew Feldman,主持人是知名投资人 Matt Turck。Cerebras 造出了计算史上最大的芯片,比 GPU 大 58 倍,并且刚刚完成了半导体行业有史以来规模最大的 IPO。但 Andrew 没有停留在这些商业头条上,而是从“什么是晶圆”开始,一步步拆解 AI 推理在硅层面到底是怎么运作的。

这期节目深入探讨了为什么在 AI 进入大规模应用后,推理速度成了新的核心战场,以及 GPU 架构在快速推理上为什么存在根本性瓶颈。Andrew 还分享了 Cerebras 在“没人想要这种芯片”的十年里如何熬过沙漠期、如何解决计算史上没人解决过的难题,以及他对 CUDA 护城河、AI 泡沫、智能体未来的真实看法。如果你想真正搞懂当下的芯片格局,这期节目就是为你准备的。

👨‍⚕️ 本期嘉宾

Andrew Feldman,Cerebras 联合创始人兼 CEO。他是一位在芯片领域摸爬滚打多年的连续创业者,此前创办的公司卖给了 AMD。Cerebras 以晶圆级芯片闻名,专注于为 AI 工作负载从零设计架构,不走传统 GPU 路线。Andrew 是一位典型的深科技创始人,对计算机架构、AI 基础设施和行业格局有着极为深刻且直白的判断。

⏱️ 时间戳

开场 & 速度成为 AI 新核心战场

02:56 速度是不是已经成了今天 AI 领域最核心的话题?

03:27 一旦 AI 变得有生产力,速度就重要了

04:28 AI 的“宽带时刻”类比:从寄 DVD 到流媒体

芯片行业格局:GPU、ASIC 与 Cerebras 的位置

05:40 当下芯片行业的格局:一个芯片包打天下的时代结束了

07:17 什么是 ASIC(专用集成电路)

08:24 Nvidia 收购 GRAC,证明 GPU 做不了快速推理

三种没人提的供应链短缺

16:24 当前三个主要瓶颈:HBM 内存、COAS 封装、3 纳米产能

18:30 计算机行业历史上造出的最大芯片,比 GPU 大 58 倍

19:11 智能体 AI 正在引爆 CPU 短缺

在沙漠里游荡的十年:从没人要到大爆发

20:38 刚刚完成了一场非常精彩的 IPO,时机堪称完美

24:33 一开始就告诉风投:我们要攻克一个非常难的问题

27:31 十八个月里每月烧掉八百万美元,却造不出来

29:15 第一次成功时,我们五个人就站在那里,不敢相信它真的能工作

为什么 Cerebras 比 GPU 快得多

33:15 为什么这比 GPU 快?根本原因是什么

33:51 推理的两个步骤:预填充和解码

34:56 为了生成一个词,你得把 100 部高清电影从内存搬到计算单元

推理、Agent 与多模态的未来

38:00 推理并不总是所有问题的正确解法

40:15 一堆更小的模型跑得更快,还是一个超大模型

40:52 多模态在更大的模型里处在什么位置

Cerebras 的业务、OpenAI 交易与护城河

41:38 Cerebras 的业务:芯片供应商、云服务商、数据中心提供商

42:35 与 OpenAI 的历史性交易:高达 750 兆瓦电力

47:06 我不认为 CUDA 是护城河

🌟 精彩内容

💡 GPU 做快速推理存在根本性瓶颈

在 AI 推理中,生成每个 token 都需要把整个模型的权重从内存搬到计算单元。Andrew 用一个生动的比喻解释:一个 700 亿参数的模型,权重大概相当于 100 部高清电影。为了生成一个词,你得把这 100 部电影搬过去,生成下一个词又得再搬一次。GPU 用的 HBM 内存在这个环节太慢了,而 Cerebras 把所有权重放在 SRAM 里,搬运速度快了 2500 倍。

"为了生成一个词,你得把 100 部高清电影从内存搬到计算单元。然后生成下一个词,又得再搬一次。"

💡 AI 的“宽带时刻”:速度会改变一切

Andrew 用 Netflix 的类比来解释速度如何重塑行业:以前网速慢的时候,Netflix 是用信封寄 DVD 的;后来网速变快了,他们并没有在寄 DVD 这件事上变得更高效,而是直接变成了一家电影制片厂。AI 推理速度的提升同样会打开一个全新的领域,让你能用完全不同的方式使用 AI。

"慢速搜索的市场有多大?拨号上网的市场有多大?答案是零。"

💡 在沙漠里游荡十年,然后就有了“完美的时机”

Cerebras 在 2020 年就交付了计算史上没人解决过的晶圆级芯片,但根本没人在意。Andrew 坦言,那时候 AI 只是个爱好,没人关心你的爱好跑得特别快。他们熬过了没人买、没人关心的阶段,一代一代迭代,直到 AI 进入生产环境,速度才突然变成了所有人最在乎的事。

"所谓时机完美,其实就是先熬十年糟糕的时机,然后你就有了完美的数据。"

💡 CUDA 在推理领域根本没有护城河

Andrew 直言,两年前每个最先进的模型都在 CUDA 流程里训练,但现在 Gemini 不用 CUDA,Claude 也不用 CUDA,训练最先进模型这块 Nvidia 已经丢掉了 70% 的份额。而在推理领域,从 GPU 切到 Cerebras,在云上只需要敲 8 个键。

"在云端从 GPU 切到我们,只需要敲八下键盘。"

💡 深科技创业的真相:那些别人根本不知道的难关才是真正的难关

Andrew 分享了 Cerebras 早期每月烧掉八百万美元却造不出来的经历。他说,大家都觉得难的地方他们很快就解决了,而那些别人根本不知道的地方——比如怎么把晶圆固定到主板上、怎么供电、怎么散热——才是真正的难关。他用攀登珠峰的类比:从来没人越过某些关卡,所以他们连该怕什么都不知道。

"我们有过一段十八个月的时期,每个月烧掉八百万美元,却造不出来。"

💡 你今天用的模型会是你用过的最差的模型

Andrew 对 AI 的未来给出了一个确定的判断:你今天正在用的模型,不管是 GPT-5 还是 GPT-6,都会是你用过的最差的模型。六个月后你就会觉得它又无聊又落后。他还观察到,年轻工程师使用 AI 的方式和他自己完全不同,这是一个可以向团队里年轻人学习的阶段。

"你现在觉得它多厉害,六个月后就会觉得它又无聊又落后。这太让人兴奋了。"

💡 AI 对 SaaS 的冲击可能是无法修复的

Andrew 认为,以前那些因为要跨越公司内部组织壁垒而变得很困难的事情,现在都变了。你可以直接对 AI 说“帮我做一个像 Salesforce 一样的工具”,30 秒后就有了一个能用的工具。这种破坏对大多数 SaaS 公司来说可能是无法修复的。

"你可以直接对你的 AI 说,帮我做一个像 Salesforce 一样的工具。30 秒后,你就有了一个能用的工具。"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺;

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight


在小宇宙查看该单集文稿

Podden och tillhörande omslagsbild på den här sidan tillhör yikai. Innehållet i podden är skapat av yikai och inte av, eller tillsammans med, Poddtoppen.