大理锚索 Grok4.5“快准狠”的背后,是马斯克的算力诈欺率困局仍未翻篇

新闻资讯 2026-07-29 03:02:47 157
钢绞线

本文来自微信公众号: 火星 AI 演 ,作家:火星 AI 演

7 月 9 日,SpaceXAI 发布 Grok 4.5。不拼"强",主"够用且低廉"。而就在此前两个月,马斯克接连将 GPU 租给了 Anthropic 和谷歌。

这背后是老马怎样的算盘?Grok4.5 的发布与他出租算力之间有什么共通的战术逻辑?

正文

柔和马斯克的东谈主,前两天推断齐被 Grok 4.5 刷了屏。

SpaceXAI 于 7 月 9 日阐扬发布的 Grok 4.5,有三个较着特征:

定位变了——不再死磕"强"。Grok 4.5 是 SpaceX AI 个面向编程、Agent 和学问责任场景的模子。马斯克本东谈主也很坦诚:它不如 Claude Fable,但大大批日常任务并不需要那么的能上限。

老本降了——每百万输入 tokens 订价 2 好意思元,每百万输出 tokens 订价 6 好意思元,比 Claude Opus 系列和 GPT-5.5 低廉 60 以上。

速率快了——据公开报谈大理锚索,Grok 4.5 的理速率可达 80 tokens/ 秒,妥妥的梯队。

而就在此前的 5 月和 6 月,SpaceX 先后与 Anthropic 和谷歌签下算力租赁大单,马斯克摇身酿成了"算力包租公"。

这两件事看似各说各话,实则根系承接。共同的大布景是:算力领域急剧推广,但算力诈欺率恒久上不去。

个无语的数字

本年 5 月,SpaceX 与 Anthropic 实现合同,将 Colossus 1 数据中心的沿途算力对出门租——触及过 22 万张英伟达 GPU,涵盖 H100、H200 及新的 GB200 加快卡。

6 月,就在筹划上市前周,SpaceX 同谷歌也签下了通常约:从本年 10 月起,后者将获取约 11 万张 GPU 的算力使用权。

马斯克为何甘当"包租公"?我方用不香吗?——中枢谜底独一个:自模子的算力诈欺率,真实太低了。

据公开报谈,SpaceXAI 在 Colossus 1 上进修 Grok 时,算力诈欺率仅有 11。而同业其他玩浩大能跑到 40 阁下。

这意味着 22 万张 GPU 中,快要 20 万张处于空转或低运转气象。

与其让它们白白耗电,不如租赁去换点现款流,冲抵下 SpaceX 的运营圆寂——而且出租算力并不影响 Grok 自身的进修进程。

而 Grok 4.5 的发布,恰是马斯克基于"算力诈欺率短期难以"这实践,作念出的战术回调:既然诈欺率暂时上不去,那就先作念个快、省 token、低廉的模子。

那么问题来了:算力诈欺率为什么这样低?

回话这个问题之前,有要先补充点表面学问。

、GPU 和算力的基本意见

进修 AI 使用的芯片,叫图形处理器,也便是 GPU。GPU 上头有千千万万个筹划中枢对数据作念运算,这种运算数据的才气就称之为算力,它揣测数据的运算速率(单元闲居是 FLOPS,即每秒浮点运算次数)。需要注意的是,和 CPU 主要进行串交运算不同,GPU 的这种运算是并交运算,即把个复杂的矩阵运算拆解成千千万万个浅薄小任务,让繁密的筹划中枢同期处理。因此,在运算海量数据的率上,GPU 是远胜过 CPU 的。这亦然为什么进修 AI 用的芯片是 GPU 而非 CPU:先,进修 AI 需要海量的数据;其次,AI 运算数据条目快的速率。彰着,比较串交运算的 CPU,并交运算的 GPU 具备势。

表面上,GPU 堆得越多,意味着可用于并交运算的筹划中枢总额就越多,单元时期内(如每秒)完成的浮点运算次数就越多。而算力的单元刚好是每秒浮点运算次数。由此可知,GPU 堆得越多,按理说算力就越(本文咱们称其为表面算力)。

二、三个弥留的工程问题

这里需要柔和三个容易混浊且其弥留的工程问题:

,单元时期内运算数据的速率越快,并不等同运算数据的数目越多。单张 GPU 能够骨子消化的数据的量,除了看算力,还取决于 GPU 的显存和带宽。显存通常"数据仓库",主要负责存储行将运算或者已运算完的数据;带宽则通常"数据传输带",负责将数据从显存处传输至筹划中枢。不难交融,要是显存容量不够大,或者带宽速率不够快,即便筹划中枢能以快的速率运算完批数据,可能也频频处于恭候新数据传输的闲置气象——业内将这种欢腾称为"显存饥饿"。

二,GPU 领域扩大会带来权贵的通讯支出。在多卡并行进修中,每张 GPU 完成运算后,需要同其他 GPU 交换信息,这个经由便是通讯。GPU 数目越多,通讯量就越大,且后者跟着前者领域的扩大呈非线飙升。关键的是,预应力钢绞线并交运算存在"短板应":扫数 GPU 在完老本轮数据运算、交换后要同步进入下轮运算。即便独一少数几张卡因发烧降频、网罗波动等产生狭窄延伸,齐会像多米诺骨样激勉四百四病,拖慢扫数这个词集群的进修模式。要是说,带宽决定了数据在单张 GPU 上的传输率,那么通讯支出响应的则是 GPU 之间同步所耗损的时期。两者共同决定了多卡并奇迹态下数据的传输率。

三,表面算力≠骨子算力。骨子算力才是决定模子进修率的关键参数,两者的联系不错归纳为:

骨子算力=表面算力 × 算法率 × 工程软件更正率

其中,算法是运算数据的法,可类比为 GPU 运算数据的"操作手册";好的算法能让算力一本万利。这其中个典型的例子,是 2017 年谷歌在论文《Attention Is All You Need》中建议的 Transformer 架构:相较于轮回神经网罗(RNN)按规则处理数据的式,Transformer 架构允许模子在处理长序列数据时并行,从而提了模子运算数据的才气。工程软件是将算法翻译为机器领导的"翻译器"和"调养官",主要包括通讯库、编译器和调养器。要是说 GPU 是钢筋水泥,算法是预备图纸,那么工程软件便是确保图纸落地的施工调养系统。其中,通讯库和编译器不错化数据的传输旅途,调养器能够缩小 GPU 卡顿、延伸或故障而产生的通讯支出。因此,质地的工程软件既是算法落地的保险,亦然缩小通讯支出、提高骨子算力的关键。

综上,算法和工程软件作念得越理念念,骨子算力越接近表面算力。

三、马斯克现时边临的窘境

在 AI 期间,动力、数据和算力正成为新的中枢资源。Colossus1 从运行缔造到落地、参预使用仅用了 122 天。这充分彰显了"马斯克率",平安了马斯克当作 AI 基础设施供应商的地位,为其争取到了新的资产创造机制和经济话语权。而他现在靠近的辣手问题,正值就出在上文提到的工程软件面。

先,调养器作念的还不够精。

在领有 22 万张卡的 Colossus1 集群中,由于硬件基数过于宏大,险些每隔几个小时,就可能有张卡降频、掉线——卡坏,模子进修就独一被动中断。靠近这个辣手的问题,谷歌和 Meta 等科技巨头的调养器,能在毫秒的时期内自动换卡和断点续训。SpaceXAI 当作新玩,其调养器在如斯大领域集群下的响应速率还不够快,致扫数这个词集群经常堕入"卡故障,万卡恭候"的低泥潭。

其次,编译器也还没适配。

编译器负责把设施员写的代码翻译成 GPU 能扩充的机器码。SpaceXAI 早期使用的 XLA 编译器,是谷歌 JAX 框架下的家具。XLA 自己不差,但它翻译出来的是通用的机器码,并不了罢免何特定 GPU 集群的物理布局。平直套用在 Colossus1 上,调养计谋和显存科罚齐很难通晓出 GPU 的限。

这也评释了为什么马斯克决定自研基于 C/C++ 底层框架的编译器——面,比较 Python、Java 等阶言语,C 言语接近硬件层;另面,通过自研,造出个熟谙自 GPU 集群物理布局的编译器,能够提软硬协同,进而充分"榨出" GPU 的能。

四、Grok4.5 的新亮点

那么针对上述问题,本次发布的 Grok 4.5 作念了什么校正呢?

个中枢亮点,是接收了混架构(MoE)。

在 MoE 架构下,处理不同类别数据的""被部署在不同的 GPU 组上:比如 GPU 01-10 存放"代码",GPU 11-20 存放"逻辑",GPU 21-30 存放"数学"……

当终点据进入时,MoE 会凭据数据类型只激活对应的,调养相应的 GPU 组(比如处理代码任务就只叫醒 01-10),而不需要扫数 GPU 同步参与。这就大幅缩小了通讯同步的压力,提了数据运算的率,定程度上缓解了算力诈欺率低下的问题。

不错说,老马为了"驯从"算力亦然十八般技艺用尽。但以调养器、编译器等为代表的软件短板,照旧是亟待他和团队攻破的工程难关。

结语

把闲置算力租赁去,是营业上的止损逻辑;发布个"够用但低廉"的新模子,是本事上的求实逻辑。

两件事齐指向同个真相:算力领域不等同于算力才气,"支配算力"粗略远远比"领有算力"弥留,也繁重。手机号码:13302071130相关词条:铝皮保温施工     隔热条设备     钢绞线    玻璃棉卷毡    保温护角专用胶

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定大理锚索,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。