算力世界杯体育,就像骑手一样,也要学会调遣。
假如你在夜深点了一份外卖。几分钟后,系统速即给你派来最近的骑手,他不需要全城挪动的雄师,惟一顺道接单,就能把一碗热汤准时送到你手里。
好意思团正在把这种"派单逻辑"搬到 AI 寰球。
在最新发布的 LongCat-Flash 模子里,算力不再是一股脑砸上去,而是像骑手一样被精确调遣:复杂问题派更多"能手",浅显问题就近处分,最大松手减少奢侈。
好意思团最近的财报,和所处的竞争环境,让它需要新的故事。而 LongCat-Flash,等于好意思团递出的第一张筹码:在大模子赛说念开打另一场斗争,把百万 tokens 的推理资本压到 0.7 好意思元。
以下为 LongCat-Flash 本事文档解读:像箝制骑手一样箝制算力
本事变嫌:算力活在算法中
当先,LongCat-Flash 的很是之处,不在于它"更大",而在于它会"量入制出"。
它的总参数限制有 5600 亿,但在履行推理时,每个 token 只需要调用一小部分,大要 18.6B – 31.3B。可以把它想象成一个高大的骑手团队,不是每一单齐要全员挪动,而是证实订单的难度,派出最安妥的几位骑手去送。这么一来,既能保证遮蔽面,又幸免了算力奢侈。
而所谓"零计较众人",其实等于处理浅显任务的捷径。
比如,一单仅仅送楼下便利店的一瓶水,就不需要总部复杂调遣,近邻的小哥顺道就能完成。相似,LongCat-Flash 遭受浅显的 token,就径直放行,不奢侈过剩算力,把资源留给真确复杂的任务。这种"按需分拨"的逻辑,让模子像调遣骑手一样,把活派得更合理。

上图中展示了 LongCat-Flash 的举座架构:每层由多头潜在注视力(MLA)+ MoE 众人构成,其中一部分是零计较众人,保证遭受浅显 token 时可以"零支拨"径直通过。
上图中 ( a ) 弧线自满:在换取算力预算下,加入零计较众人的模子 loss 更低,不断更快; ( b ) 激活众人数观点在 8 个傍边,平均约 27B 参数; ( c ) 不同 token 之间算力分拨相反剖析,讲明模子照确切"挑票据"。
另一个变嫌点叫 ScMoE(Shortcut-connected MoE)。传统模子要等一批任务一说念处理完,再参预下一批,就像骑手要等悉数订单派完才智外出。
ScMoE 的想路是"边派边送":骑手在送餐的同期,系统还是运行径他遐想下一单。这么,算力的使用和通讯可以同期进行,举座效果天然提高。

图中三组弧线(不同模子限制)自满:有无 ScMoE 的 loss 险些重合,质料透顶一致,但由于通讯和计较可以叠加,ScMoE 在浑沌率和推理速率上显耀提高。
工程智商:给算力买个"社保"
限制大,速率快仅仅第一步,关节是能不行观点运行。LongCat-Flash 的考研神色更像是在逐渐延迟一个骑手辘集:先在小鸿沟试运行,把调遣章程、道路遐想齐调好,再施行到更大的鸿沟,幸免一上来就乱成一团。
为了陈腐系统崩溃,它树立了"三重保险"。Router 观点,相当于幸免悉数订单齐荟萃在一条澄澈;激活观点,就像陈腐某几个骑手被派单过多而累坏;优化器观点,则保证举座调遣有节拍,永久能跑下去。恰是靠这一套机制,它在 30 天里完成了 20 万亿 tokens 的考研任务。
性能比较:发扬老成
从收成单来看,LongCat-Flash 不仅仅推理快,在各大基准测试中相似发扬老成:
通用任务:在 MMLU(89.71)和 CEval(90.44)中,LongCat-Flash 达到与外洋一线模子相当的水准。天然 CEval 分数略低于 Kimi-K2(91.26),但举座发扬依旧越过大无数基线模子,展现了可以的汉文交融智商。
复杂推理:在 GPQA-diamond(73.23)上,LongCat-Flash 与同类模子保抓附进水准;在 DROP(79.06)、ZebraLogic(89.30)、GraphWalks-128k(51.05)等测试中,也观点处于中上游梯队。
数学智商:在 MATH500(96.40)和 AIME24(70.42)上,LongCat-Flash 与 Kimi-K2、DeepSeek 比较差距不大,保管在高水平。在 BeyondAIME(43.00)上虽有下滑,但举座仍优于无数模子。
编程任务:在 HumanEval+(88.41)、MBPP+(79.63)等 benchmark 上,LongCat-Flash 发扬观点,略低于 Kimi-K2(93.29、79.87),但依旧优于 Gemini2.5 Flash、Claude Sonnet 等敌手。

实测好意思团 LongCat-Flash:快
其实从上头的测试基准中可以看到,好意思团 LongCat-Flash 的性能并莫得遥遥越过的所在,只可算是与各大主流模子智商旗饱读相当。因此在许多常用的测试中看不出分辩,但有少许:
好意思团这个模子是真实快,和买了准时宝一样。
promtps:写一个 Python 函数 is_prime ( n ) ,判断 n 是否是质数,并给出 10 个不同的测试样例。
左边模子是 LongCat-Flash 网页端,右边是 kimi 1.5(证实官网边幅,反映更快),可以看到相似的领导词,LongCat-Flash 莫得怎样想考,一排名内容径直飞出来,而 kimi 1.5 过程片时想考后,(和 LongCat-Flash 比较)慢悠悠的把内容写出来。
在中枢代码部分,二者也没分辩,可以说 LongCat-Flash 又快又好。

LongCat-Flash 的速率和价钱上风,惟恐能坐窝改写行业步地。毕竟在大模子商场,生态和用户风俗经常比性能参数更具粘性。但它却泄浮现一个信号:好意思团依然风俗用我方最擅长的叮咛,把复杂的科技问题翻译成"调遣骑手"的逻辑,再用价钱杠杆撬开商场。
这让问题变得更兴味兴味:
当 AI 巨头们在谈模子限制、参数精度时,好意思团却在谈派单效果和资本弧线。它看似"接地气"的切入点,反而可能成为搅拌步地的变量,就像也曾的 DeepSeek 那样。
十年前世界杯体育,好意思团用补贴烧出了外卖帝国。十年后,它是否能靠另一场价钱战,把我方送进大模子的牌桌?没东说念主能给出谜底,但至少可以笃定的是,好意思团还是递出了第一张筹码。