跳到主要内容

昇腾A2芯片立功!华为首次公开美团LongCat

业内人士表示,昇腾该模型是片立业界首个完全基于国产算力完成训练与推理全流程的万亿参数模型。

计算流调度上实现计算与通信双流并行,功华

昇腾A2单卡内置高速网卡可提供200Gbps传输带宽,为首Prefill阶段采用FlashComm算法降低Vector算力消耗。开美Prefill阶段采用64张昇腾A2协同调度,昇腾最终实现TPOT时延仅20ms。片立

LongCat-2.0,功华测试版本在OpenRouter总调用量已跻身全球前三。为首单机16卡。开美Decode阶段采用128卡超大规模专家并行EP部署。昇腾

Prefill阶段融合流水线并行与序列并行双重策略,片立为AI算力国产替代提供了可复用的功华技术范本。压缩MoE通信耗时10倍。为首Decode阶段利用A2超大L2 Cache优势实现模型权重异步预取,开美

此次公开的部署细节显示,

LongCat-2.0是美团继1月发布LongCat-Flash-2601后又一次重磅开源。

算法层面,最大限度利用芯片带宽与算力。

Decode阶段根据序列长度差异化切分,总参数量达1.6万亿,短请求采用DP128+EP128方案,此次华为首次公开昇腾A2完整部署方案与技术细节,标志着国产芯片已具备承载万亿参数大模型推理任务的能力,将MoE专家计算与Dense层计算拆分为独立计算流,LongCat-2.0基于昇腾Atlas A2 192卡集群部署,原生支持100万Token超长上下文。华为CANN(昇腾AI异构计算架构)团队首次公开披露了美团万亿参数大模型LongCat-2.0在昇腾A2芯片上的完整部署方案。加速矩阵运算。有效支撑大规模分布式推理。超长序列采用DP16CP8+EP128方案,将模型划分为8个独立计算Stage,

7月6日消息,

CANN推理团队针对LongCat-2.0的MoE超稀疏专家架构与百万级长序列进行了系统级优化。

延伸阅读

远离那些崇洋媚外的人。

文 | 阿杰图片 |阿杰本文字数 |1035这是阿杰为你写的第51个故事01我有个同学,去国外旅游了一周,回来逢人便说国外真好,吃吃喝喝的都是高级食材,说国外的人吃饭健康,环境也好,当然,我不否认他说

法拉第未来9款EAI机器人齐发:最贵超92万!

9月21日消息,近日,法拉第未来在919发布会上一次性推出9款EAI机器人新品,覆盖人形和四足两大形态,售价从9990美元到13.79万美元注:折合人民币约92.3万元)不等,9款产品现已全部开售并启