
事情是这样,前段时候海北设备保温施工队,路透 · 社报谈说浓眉大眼的 DeepSeek 也曾悄摸作念了年的 AI 芯片了,正在讲和芯片缱绻、晶圆代工和存储厂商。
但这音书出来没几天,OpenAI 就把我方和博通搞的 Jalapeño 芯片集群端了出来。完事儿相同也在这段时候,Anthropic 也说要驱动组建我方的芯片团队了。。。
不是你们个个的,边狂买英伟达产能,边又公开默示也要下场搞芯片。难谈老黄给他们的 GPU 不香了吗?
经过番商讨我发现,还确实不香了。。。
而这切齐是因为:理芯片。
这个所谓的理芯片,其实也不是啥新词。好多年前谷歌代 TPU 就在商讨理了,前几年各式商讨理芯片的初创公司也不少,像什么 Groq、Cerebras、SambaNova,这些不错说是各有活。
关联词之是以大当今感到生分,原因亦然显而易见:这个行业在前几年直齐是不冷不热,属于大厂们鸟齐不鸟的域。
那么问题来了,前几年大厂对此不甚上心,本年偏说婉婉类卿,为啥倏得间大伙齐夏侯惇坐飞机,看眼了呢?
因为划不来啊。。。这事在当年还没谱。
无人不晓,大模子是个发展很快的行业,今天爆火的模子、技巧向,可能过两个月就东谈主问津了。本年的 OpenCLaw 小龙虾当今在哪发家咱齐不知谈,别说前两年的大模子厂商了。
毕竟那时候黑白分明反对 LLM 的齐大有东谈主在(你小杨哥 YannLecun)。。。大模子能走多远齐不好说,是以模子厂商们不可能门为理造芯片了。
毕竟英伟达的卡又不是不成用,查考起来也嘎嘎好使,花时候商讨理芯片那不是闲的嘛。唯搞理的谷歌 TPU,驱动也不是为大模子准备的,因为那时候大模子齐还没降生呢。
但事情的调动,发生在两年前的这个时候。
2024 年 8 月,Google DeepMind 团队发表了篇里程碑式论文,他们发现只须延长念念考时候,模子的正确率就会径直暴涨。
9 月驱动,OpenAI 的 o 系列就驱动让原枪弹爆炸了;翻过年,DeepSeek-R1 等度念念考模子又给了天下顿轰动。
然后从昨年到本年,大迟缓意志到,AI Agent、多 Agent 和洽集群、几十万字的长高下文分析,也曾成了大模子落地使命的标配。度理和 Agent 这套技巧阶梯,基本取得了通盘行业的说明。
随着技巧阶梯的说明和发展,压力大的除了前端昆仲,还有 GPU。。。。
纵情开个 AI 对话框,我们在这里输入笔墨,AI 就会复返笔墨,这看起来颠倒天然丝滑。
但从 AI 的视角看,你告诉 AI "上演个猫娘",它需要先贯通"这句话到底说了个啥?"这步就被称为Prefill。而 AI 读懂以后,驱动学猫娘讲话输出给你的经过,叫Decode。
在 Prefill 阶段,AI 要把整句话拆成个个 token,然后分辩贯通这些 tokens 的含义,这个经过和 AI 的查考阶段颠倒相似。
模子怎样才能判断这些 token 的含义呢,这就触及到了矩阵。
而纵不雅天地硬件,适算矩阵的算中之霸,等于 GPU。
然鹅,对 GPU 来说,发送问题的 Prefill 阶段,和输出修起的 Decode 阶段,计算经过却不同。。。
在 Prefill 阶段,我们次提供了数据,GPU 不错我方切分、所有中枢起并行计算,这就很恬逸。
用底下图片中的简化公式感受下:假定我们输入的 token 需要个 4096 参数的矩阵,那么计算出来每从内存搬运 1 个字节的数据,GPU 就不错用这笔数据,奉行上千次运算。
但干涉 Decode 阶段,地点就出了问题。
无人不晓,当今的大模子齐是自记忆的,说白了等于要知谈上个词才能算出来下个词。是以底本 Prefill 阶段 4096 行的输入矩阵,到了 Decode 阶段,会暴跌成只须 1 行。
经过相同的计算,每搬运 1 个字节的数据,GPU就只可算次。。。
这下就坏菜了。。。
在芯片里面,两个数据相乘的能量铺张颠倒少。但要把个数据从显存搬到 GPU 里,铺张的能量和时候频频是前者的几十倍以至上百倍。
是以要把颗芯片的算力拉满,梦想的情况定是,搬次数据进中枢,然后在腹地反复算上几万次。忌讳的等于搬次算次,下次要用再临时去搬。
是以在 Decode 阶段,个 70B 参数 140GB 权重的大模子,每向用户输出个 Token,芯片就须把这 140GB 从 HBM 显存里完好读入遍,再吐个字又重读遍。
哪怕用上 3 TB/s 带宽的顶显存,输出速率也只须每秒 21 个 token。。。
换句话说,老子花这样多钱买显卡,效果芯片有 80 的时候在发愣等数据传过来,这 nm 谁受得了。
要命的是,除了理时候变长,为了记取前边几十万字的念念考经过,模子须把所有历史 Token 的特征一起缓存在显存里,每多念念考步,显存里要搬运的数据量(KV Cache)也随着爆炸。(这等于为啥显存和内存齐纷繁加价)
夙昔显存还算够用的时候,设备保温施工各大厂商还能靠纯软件妙技来清闲绷住。
比如搞联络批处理,把几十个用户的肯求攒起来摊薄搬运资本;还有梁圣的潜在多头矜重力机制,压缩 KV Cache 来减少 GPU 的搬运量。
但这些齐标不本。。。GPU 在内容上是通用芯片而不是理芯片,它就不是给来 Decode 的啊!
施行上,谷歌在好多年前就发现了这个问题。他们那时猜度的认识颠倒浅薄苛虐,既然通用 GPU 这样拉,那我为什么不门造颗只为理的芯片?
于是,代 TPU 就建树了。它用来经管数据搬运问题的中枢技巧,叫作脉动阵列(Systolic Array)。
把芯片里面比作个工场,HBM 显存是厂外的中央仓库,SRAM 是活水线旁的小筐,计算中枢等于螺丝工位。平凡的 GPU 算矩阵,就像个工东谈主每拧颗螺丝,就要回显存仓库里拿个件,拧完再送回仓库。
而谷歌的脉动阵列,等于把螺丝的经过变成了活水线,而况是个二维的活水线。
他们把上万个乘法计算单位(PE)焊成个阵,矩阵的权重数据旦进了活水线,就像勤快棒样在工位之间横向传递计算,算出来的效果再按序传到基层计算。
由于数据在相邻的中枢之间径直传递,数据每进次中枢,就会在里面联络传递、复用几十上百次,根本不需要奉赵外部显存,根底就不需要半途再去搬运数据。
是以 TPU 的这波招也成了谷歌能开脱英伟达卡脖子,在 Gemini2.5 时间秒就能脉动回来的要道之。(天然当今 Gemini 又拉了)
以前技巧阶梯没定,TPU 这种用案在大模子上没显出太大势,大也就接续买 GPU。
而当当今度理让理负载暴增,TPU 的念念路驱动真确香了起来,包括谷歌齐驱动把 TPU 门分出来查考版和理版。
于是各大模子厂在这段时候齐纷繁觉悟:是时候钱作念用的理芯片了。
天然,吃够了英伟达卡脖子窒息 play 的大模子厂们,此次没东谈主风物再当被迫的买。。。
比起每年把几十上百亿好意思元 ATM 给老黄,你还得看东谈主脸,有这钱养个芯片团队支拨几乎就洒洒水。
不外真要我方作念了,大也莫得只按谷歌的 TPU 的阶梯去抄。毕竟模子齐是自的,怎样也得我方调教开导才能找到适的硬件啊!
拿 Anthropic 来说,脉动阵列固然快,但无数的杂活就不成脉动回来了。是以 Anthropic 不仅搞脉动活水线,还选拔跟 AWS 度作了 Trainium(另面 A 社我方也晓喻要自研),拿着 Claude 模子运行的真实工序数据,反向写进底层编译器。
而投靠了英伟达的 Groq,他们的念念路等于端活水线派,觉得平凡芯片把显存的数据搬来搬去是奢华。是以径直把 HBM 显存给了,然后把整颗芯片塞满 SRAM,相配于所有货齐放在活水线驾驭的小筐,随用随取。
比较端派,国内的阿里就赶巧反过来。若是底层架构写死,到时候大模子架构变了咋办?是以他们选拔拼刀,让无数天真通用的程序加工岛,起拼同套缓存 SRAM。
至于 OpenAI 嘛,若是说前边几齐还在分娩线高下功夫,他们相配于把通盘工业园区重建了遍。OpenAI 的 Jalapeno 理集群跟博通作,把芯片、HBM、腹地缓存、芯片间网罗起缱绻,靠让特定用户的 KV Cache 驰念档案和特定的算力集群绑定来减少搬运。
于是这样看下来,模子厂和硬件厂之间就变成了个雷同汽车行业的时势,比谷歌就像比亚迪,从 TPU 到 Gemini 全栈自研;OpenAI + 博通就雷同祯祥,放出图纸和需求来让才调强的制造商落地;
而 Anthropic + 亚马逊 AWS 就有点像鸿蒙智行。
天然英伟达、Groq 就如故阿谁铲子的东谈主。论表层算法风向怎样变,买老黄这套东西历久是适宜的选拔。
后再说说 DeepSeek。
由于我们目下能查到的信息只须 DeepSeek 说要搞理芯片,但具体怎样个搞法,目下还莫得信息出来。
不外,2025 年梁圣写过篇著述,点名下代 AI 硬件需要经管的问题就包括低精度计算、内存容量、计算率、芯片间互联和低延伸通讯。再加上 DeepSeek 模子的特色,我们也不错脑补下。
缱绻上莽撞率亦然笔据模子适配来缱绻芯片,但因为 DeepSeek 自己对 KV Cache 压缩,以及 MoE 的关系技巧,可能会有大的内存容量但化算力,或者门对通讯路由作念化,比如裁减数据精度来最初压缩,留出用数据通路等等。
天然终如故以 DeepSeek 我方的技巧论文为准,咱就未几 bb 了。
讲到后,其实大伙可能会发现,AI 厂商其真实这波经过中庸英伟达的关系似乎出现了些微♂妙的变化。
以前大齐是让 AI 模子相宜芯片,拿到什么卡,就商讨怎样切分模子、压缩 KV Cache、调教通讯,恨不成径直变成 H200 的容颜。
但当今,不是所有治安齐须要 GPU 了。以后不再是 GPU 厂商制约 AI 厂商,而是 AI 厂商不错主动选拔适我方的软硬件,以及高下贱配套。
这样来,模子公司就不必看硬件厂商的脸适配了,翻身把颂赞属于是。
那么了然于目,以后在这条时候线上很有可能发生如下画面:
模子公司终于不错对芯片团队说,我的模子很大,你忍下。
撰文:纳西
剪辑:江江 & 面线
好意思编:素描
图片、贵府起头:
OpenAI:Jalapeño ’ s first results show industry-leading speed and efficiency in AI inference
OpenAI:Trading Inference-Time Compute for Adversarial Robustness
Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures
introl:AI Inference vs Training Infrastructure: Why the Economics Diverge
Ironwood: The first Google TPU for the age of inference
Google research:In-Datacenter Performance Analysis of a Tensor Processing Unit
reuters:China's DeepSeek developing its own AI chip, sources say
Dwarkesh:TPU competition, why we should sell chips to China, & Nvidia ’ s supply chain moat
Groq Inference Tokenomics: Speed, But At What Cost?
DeepSeek、NVIDIA 等,部分图源网罗
邮箱:215114768@qq.com相关词条:管道保温 塑料管材生产线 锚索 玻璃棉毡 PVC管道管件粘结胶
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定海北设备保温施工队,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
