摩尔线程发布MTT超节点架构?万卡算力底座加速应用分发智能化

摩尔线程发布MTT超节点架构?万卡算力底座加速应用分发智能化。面对这场由底层算力驱动的产业风暴,业内顶尖的系统架构师与AI基础设施专家们给出了极其权威且肯定的判断:随着全球大模型参数规模正式迈入万亿级别,摩尔线程MTT C256超节点在WAIC 2026上的震撼亮相,标志着传统数据中心零散算力向一体化“超级计算机”的实质性跃迁。这不仅彻底打破了多层网络互联的物理枷锁,更将引发一场从云端大模型到终端智能硬件的应用生态革命,让所有依赖传统流量漏斗的增长团队不得不重新审视底层的跨端流转与意图承接能力。
在2026年7月17日于上海拉开帷幕的世界人工智能大会(WAIC)上,算力基建、超节点互联无疑成为了全场最受瞩目的核心议题。摩尔线程以“词元时代 万物智能”为主题,首次向全球公开展出了其具有划时代意义的MTT C256超节点。这一硬核算力底座的发布,不仅仅是中国本土全功能GPU在底层硬件架构上的一次暴力突破,更是整个AI产业从“模型参数竞赛”全面转向“底层算力工程化落地”的重要分水岭。
WAIC 2026的算力主战场:从“卷参数”到“卷基建”的行业拐点
要深刻理解摩尔线程MTT超节点诞生的历史必然性,我们必须首先把目光投向当前大模型产业所面临的极其残酷的物理瓶颈。根据科创板日报的现场深度追踪与行业调研,全球大模型的参数规模在经历了数年的狂飙突进后,已经正式跨越了千亿大关,稳步迈入万亿(Trillion)参数级别的无人区。以近期行业内备受瞩目的Kimi K3模型为例,其参数量据称已经达到了惊人的2.8T。不仅如此,大模型的上下文窗口(Context Window)也在呈指数级膨胀,从早期的8K、32K,一路狂飙至256K,乃至目前的1M(一百万Token),甚至业界已经开始前瞻2M到3M的超长上下文处理能力。

这种被戏称为大模型“记忆力”的疯狂扩张,带来的是对底层算力基础设施的灾难性压力。传统的单张GPU加速卡,或者是标准的8卡服务器机柜,在面对需要吞吐海量Token的万亿参数模型时,宛如一叶孤舟面对惊涛骇浪,瞬间就会被庞大的计算量和显存需求所淹没。单卡算力已经彻底失效,行业唯一的出路,就是将成千上万张GPU组合起来,进行分布式并行计算。
然而,传统的智算中心网络架构在向超大规模集群演进时,遭遇了致命的“互联墙”。过去的数据中心通常采用多层Spine-Leaf(叶脊)网络架构,当数据在不同层级的交换机之间跳跃传输时,会产生严重的带宽损耗与无法忍受的高网络延迟。在大模型的同步训练中,由于“木桶效应”,整个万卡集群的计算速度往往会被网络通信中最慢的那根网线所拖垮。这导致许多标称拥有上万张卡的智算中心,其实际的有效算力利用率甚至不到40%。数以亿计的硬件投资,在低效的多层网络损耗中化为泡影。正是为了彻底击碎这层“互联墙”,将成百上千张GPU真正聚合成为一台高度协同的“超级数据中心级计算机”,超节点(Super Node)架构应运而生,并成为了本届WAIC上各大厂商重兵把守的技术高地。
深度解构MTT C256超节点:突破物理极限的一层Scale-up网络
在这样极其苛刻的行业痛点倒逼下,摩尔线程此次展出的MTT C256超节点,交出了一份堪称惊艳的工程答卷。这款产品的核心灵魂,在于其对底层网络拓扑架构的颠覆性重构——它首创了业界罕见的一层Scale-up网络。
在传统的算力网络设计中,一层网络(无需经过复杂交换机跳跃的直连网络)的物理极限通常被死死卡在64张卡的规模。而MTT C256通过极高密度的计算与交换一体化底座设计,硬生生将这一物理天花板捅破,首次在一层Scale-up网络中实现了256张GPU卡的全互联。
这一架构创新带来的性能收益是极其暴力的。首先是极致的互联性能。在256卡全互联的单层网络内,GPU与GPU之间的通信延迟被极限压缩至亚微秒级别。这几乎抹平了跨卡通信的时间鸿沟,使得系统带宽的利用率呈现出几何级数的跃升。对于那些极度依赖高频参数同步的大模型分布式并行训练策略(如张量并行、流水线并行和数据并型的3D混合并行)而言,亚微秒级的延迟意味着算力集群终于可以毫无保留地释放其理论性能,为算法工程师提供了前所未有的优化空间。
其次是震撼行业的高密度部署能力。在寸土寸金的智算中心机房里,空间利用率直接与巨额的运营成本挂钩。MTT C256打破了传统服务器臃肿的机箱形态,单机柜的GPU部署密度领跑全行业。它仅需通过两个标准的单宽机柜,就能完成256卡的一层极速互联。这不仅成倍地节约了机架位与物理空间,更大幅缩短了内部的高速线缆长度,从物理层面上保障了信号的高保真传输。
此外,是对现有生态与工程体系的完美兼容。尽管内部架构发生了翻天覆地的变化,但MTT C256在外部物理形态上依然采用了标准的2U节点设计。这种极具前瞻性的兼容性考量,使得它可以无缝接入现有的智算软硬件生态之中,支持计算集群从目前的万卡级别,像搭积木一样平滑、无损地向未来的十万卡级规模扩展。
当然,MTT C256超节点的真正壁垒,并不仅仅停留在纸面的架构图上,更在于其背后经过无数次实战淬炼的严苛工程化体系。摩尔线程高级副总裁董龙飞在接受媒体采访时曾一针见血地指出超节点落地的残酷真相:“单台超节点最高可达到上亿元的投入,一个超节点的功耗可高达400KW,而普通服务器约10KW。算力、散热、功耗均呈数量级跃升。”面对这种炼狱级别的物理环境,摩尔线程为MTT C256配备了极其高效的液冷散热系统、创新的三盲插设计以及完善的RAS(可靠性、可用性、可服务性)容错机制。在庞大的超节点系统中,任意一个微小部件的损坏都可能导致上亿元设备的停摆,摩尔线程通过深度的硬件解耦与集群管理软件,确保了故障部件的动态隔离与灵活替换,保障了整个十万卡集群的长稳运行。这种工程能力,源自其在真实万卡训练环境中用真金白银堆出来的踩坑经验,绝非一朝一夕的概念炒作可以企及。

国产AI芯片的群雄逐鹿:超节点赛道的差异化突围
本届WAIC不仅是摩尔线程的独角戏,更是整个国产AI芯片产业链一次史无前例的“肌肉秀”。在算力封锁与自主可控的双重背景下,“四小龙”——壁仞科技、摩尔线程、燧原科技、沐曦股份,纷纷亮出了各自压箱底的超节点杀器,整个上海世博展览馆仿佛变成了一个硝烟弥漫的算力竞技场。
壁仞科技走的是分布式解耦与芯粒重构的路线。他们推出了下一代NPO光互连架构,支持单个超节点扩展至极其恐怖的1024卡Scale-up规模。其核心的BR2xx系列大算力芯片,采用了业界前沿的Chiplet(芯粒)封装架构,就像拼积木一样将多个小型计算核心组合成一颗超级芯片,以此突破单芯片面积制造的物理定律限制。同时,通过自研的BLink 2.0协议,让1024张显卡共享同一个庞大的内存空间。
燧原科技则与中兴通讯强强联手,发布了云燧ESL64-O超节点。他们另辟蹊径,采用了极具科幻感的OEX正交无背板设计,实现了惊人的“0线缆”互联,从根本上消除了线缆带来的信号衰减与高昂成本。此外,他们还展示了面向未来的CoPoS面板级先进封装技术,试图在物理层面进一步拉近芯片与芯片的距离。
沐曦股份带来的则是曦景S600超节点产品。该方案专注于单柜64卡的极致优化,采用柜内全互连架构以压低数据交互时延,并原生支持EP(专家并行)、TP(张量并行)等多维策略。沐曦股份研发副总裁黄向军明确表示,单柜64卡将是未来市场需求的主流基准节点,以此为基础进行跨柜的横向扩张,是通向十万卡集群的最稳健路径。
此外,服务器产业链的巨头们也未曾缺席。中科曙光展示了满载运行的“曙光8000”十万卡集群;超聚变推出了原生液冷整机柜,将PUE(电源使用效率)压榨到了极致的1.06;曦智科技更是拿出了斩获SAIL之星奖项的Matrix超节点,用光电共封装(CPO)技术试图用光子代替电子进行数据传输。在多元化的技术路线交锋中,摩尔线程凭借其全功能的GPU架构与扎实的落地实战数据,硬生生在巨头林立的超节点赛道中撕开了一条属于自己的高地。
“国芯训国模”的实战大考:万卡集群支撑的三大硬核里程碑
硬件的参数再华丽,如果不能在真实的模型训练中跑出成绩,也只是一堆昂贵的废铁。在WAIC现场,摩尔线程用三项标杆级的“国芯训国模”实战成果,彻底打消了外界对国产算力“能看不中用”的质疑。这不仅是MTT超节点与夸娥(KUAE)智算底座的成绩单,更是整个中国大模型产业自主工程化落地的强心剂。
第一项震撼业界的成果,是从零起步完整训练了万亿参数级的MoE-236B基础模型。
混合专家模型(MoE)是当前大语言模型突破性能瓶颈的绝对主流架构。依托摩尔线程万卡级的夸娥智算集群与深度定制的AI训练套件,该项目吞吐了高达25T+的高质量庞大语料库。更为关键的是,在长达数月的超大规模高负荷运转下,整个集群的有效训练时长占比稳定超过了90%。对于经历过大集群频繁宕机、动辄需要回滚断点续训的算法工程师来说,90%的长稳运行率是一个梦寐以求的工程奇迹。评测数据显示,该模型在MMLU等核心榜单上的精度以及整体的训练损失(Loss)曲线,与使用国际最顶尖计算卡训练出的曲线高度重合。这无可辩驳地证明了,“国产芯片+国产集群”的技术路线在挑战万亿参数极限时,已经实现了实质性的全链路跑通。
第二项突破,是支撑北京大学EvoPhys团队完成了全球首个5D世界模型EvoPhys-World的全栈原生训练。
世界模型(World Model)被视为通向通用人工智能(AGI)的终极钥匙,它不仅需要理解文本,更需要深刻理解物理世界的空间几何与时间演化规律。EvoPhys-World在发布后,曾在极具权威的斯坦福WorldScore“世界生成”榜单上蝉联全球榜首长达37天。这个涉及海量复杂视觉生成与三维物理模拟任务的巨型模型,全程是在摩尔线程MTT S5000夸娥智算集群上完成的原生训练。摩尔线程自研的MUSA软件栈提供了天衣无缝的底层接口支撑,完美验证了国产算力系统在面对高度非标准、高复杂度前沿科研任务时极其强悍的扩展性与软件生态兼容力。
第三项里程碑,是国产算力首度跑通了具身大脑的通用训练全流程。
北京智源研究院面向真实物理世界打造了通用具身大脑RoboBrain 2.5。在这个项目中,算力集群不再是处理虚拟的文本符号,而是需要评估动作的时序价值,并进行复杂的三维空间结构推理。依托摩尔线程的千卡集群与FlagOS-Robo框架,双方携手打通了具身智能大模型训练的所有堵点。这不仅为国产机器人赋予了更加聪明的“大脑”,更标志着国产算力正式从虚拟的数字空间,坚定地迈向了广阔的物理工业产线。
三大“AI工厂”的商业化落地:重塑Token时代的数字生产力
在全面展现算力底座硬实力的同时,摩尔线程创始人兼CEO张建中在大会主论坛上,首次系统地抛出了公司赋能产业的核心战略——基于夸娥智算集群打造的三大“AI工厂”:模型训练工厂、词元生产工厂与智能体生产工厂。这三大工厂矩阵,清晰地勾勒出了算力在未来数字经济中的变现图谱。
“模型训练工厂”是产业的地基,聚焦于用十万卡规模的MTT C256等超节点,夜以继日地压缩人类浩瀚的知识,支撑基础大模型的预训练与强化学习。
“词元(Token)生产工厂”则是全社会的算力发电站。在Token经济爆发的当下,摩尔线程凭借其原生支持超大规模MoE架构与百万级上下文的推理引擎,实现了对海量并发请求的低延迟、高吞吐响应。其高性能推理套件不仅深度适配了vLLM等国际主流框架,更能做到对国内主流大模型(如DeepSeek、Kimi、GLM等)的“发布即适配”。此外,其创新的PD分离异构推理方案,将高算力的预填充(Prefill)与高带宽的解码(Decode)分池部署,将智算中心的推理性价比推向了极致。
而最引人瞩目、也最深刻影响移动互联网应用生态的,无疑是“智能体(Agent)生产工厂”。在这里,摩尔线程不仅提供高达单用户100 Token/s的极速并发解码能力,更亲自下场孵化了全域数字智能体“小麦”。据官方披露,这个超级Agent目前已经掌握了60余项核心系统技能(Skills),能够直接跨越应用壁垒,自主控制多达38款主流App。为了让智能体真正融入物理世界,摩尔线程还发布了AI算力本MTT AIBOOK与家庭AI中枢MTT AICUBE两款原生终端,并构建了MT Lambda全栈具身智能仿真平台。从云端算力网络,到边缘侧智能体中枢,再到控制物理硬件的具身大脑,一条崭新的基于机器调度的应用分发链条正在成型。

算力霸权引发的分发重构:智能体跨应用调度的流量危机
当摩尔线程的“智能体工厂”源源不断地向市场输送类似于“小麦”这样能够自主跨系统操作的超级Agent,当千行百业的智能硬件(如家政机器人、智能汽车、AI中枢)接入了MTT C256超节点的庞大算力网络,一场针对所有移动App开发者与增长黑客的系统级危机已经悄然降临——传统的应用分发逻辑与流量漏斗模型正在被彻底颠覆。
过去十几年,移动互联网的分发权力牢牢掌握在应用商店和信息流广告平台手中。用户看到广告,产生兴趣,点击屏幕,跳转下载,最终在App内完成注册和消费。这套“货架式”的分发体系高度依赖真实人类的眼球注意力与物理手指的点击动作。
然而,在具身智能与超级Agent全面接管终端的时代,用户不再需要亲自去点开那38款App。用户只需要对家庭AI中枢说一句:“帮我比价并购买一台最划算的净水器,顺便把今晚的餐厅订好。”接下来,云端的万卡算力网络会瞬间解析这个复杂的意图,并由数字智能体在后台自动调用电商App的API进行比价,自动拉起本地生活App的底层接口进行锁座扣款。
整个过程跨越了多个独立的移动应用,但在前台,没有任何人类的点击、滑动与页面停留。当流量的本质从“人类的屏幕点击”异化为“云端算力网络的机器调度API指令”时,企业原有的基于前端Cookie、设备指纹以及行为轨迹追踪的广告归因系统将彻底失明。系统后台会涌入大量“零停留时间、无上一跳页面”的幽灵流量,而当这些智能体试图进行深层的跨应用跳转唤起时,由于操作系统日益严苛的隐私沙盒机制,原始的业务意图参数往往会在拉起目标App的瞬间大面积丢失。这种“场景断层”直接导致了机器调度任务的流产,让企业眼睁睁看着算力带来的巨大流量红利在系统底层化为一串乱码。

穿透自动化调度黑洞:全渠道归因与深度链接的底层革命
面对由超节点算力和超级Agent引发的分发生态地震,广大的App开发者与数据增长团队决不能坐以待毙。在极度破碎的意图入口时代,要想稳稳接住这波泼天富贵,并在算力网络的缝隙中重铸数据主权,企业必须在底层代码架构中引入极具穿透力的第三方工程基建。
首先要攻克的,是跨应用调度时的场景断裂难题。当具身智能大脑或云端Agent试图为用户直接交付某个具体服务(例如直接拉起电商App中某款特定型号净水器的购买结算页)时,开发者必须在自身应用的底层全面接入极其稳定的 深度链接(DeepLink)与场景还原 引擎基建。
这项技术的核心威力在于其对系统阻断环境的极限穿透力。当Agent在后台生成唤起指令时,底层的传参引擎能够将复杂的业务指令与用户上下文参数进行高强度加密,并挂载在一个极短的深度链接上。即使用户当前的智能设备或手机上尚未安装目标App,导致指令被强制拦截并跳转至应用商店进行漫长的下载,这套传参引擎依然能在恶劣的网络环境中暗中保持对该参数的无损追踪。当App被首次冷启动的瞬间,系统会在云端极速对齐设备指纹,并在毫秒级时间内将那些被隐藏的参数抛给应用前端。App将自动跳过所有繁琐的默认首页和验证流程,直接向用户呈现Agent最初锚定的那个服务界面。这种彻底抹平了跨端鸿沟的场景还原能力,是确保机器分发意图不被折损的绝对命脉。
其次,为了彻底扫除机器流量带来的算账迷雾,增长团队必须彻底重构底层的数据监测漏斗,部署能够量化每一笔自动化调度的 全渠道统计 中台。在万物互联的AI生态中,流量的发起点可能是汽车的中控大屏,可能是家里的AI音箱,也可能是云端静默运行的一个企业级数字员工。
面对这种错综复杂的异构流量源,全渠道统计系统能够通过深度的API级对接,为全网每一个发起调用的算力节点、每一个智能硬件终端、甚至是每一次特定的Agent任务生成独一无二、不可篡改的渠道追踪编号(ChannelCode)。当这股海量的复合流量涌入企业的服务器时,哪怕它们没有任何人类的物理交互轨迹,底层的模糊匹配算法依然能够极其犀利地穿透迷雾,精准地将每一次App激活、每一笔真实的订单转化,牢牢溯源到最初下发该指令的那个具体的AI模型或智能硬件设备上。
只有拥有了这样一套算得清、接得住的底层归因基建,企业才能在面对算力大爆发与终端分发入口剧变时,真正量化出由AI大模型生态带来的实质性ROI,从而在这个由超节点统治的全新商业纪元中,建立起坚不可摧的业务增长护城河。

从实验室里几张显卡的蹒跚学步,到WAIC 2026上MTT C256超节点的惊艳亮相,底层算力基础设施的跨越式发展,正在以前所未有的雷霆万钧之势,重塑整个数字世界的物理底座。随着以摩尔线程为代表的国产万卡集群支撑起越来越庞大的世界模型与具身大脑,我们赖以生存的应用分发逻辑正在从“人找服务”彻底翻转为“机器代行”。在这场算力网络大爆发的前夜,唯有那些率先通过底层链接重构与全域数据追踪武装自己的探索者,才能在未来的跨端流量洪流中,笑到最后。
常见问题(FAQ)
什么是超节点?它和普通的数据中心服务器有什么区别?
普通的服务器机柜通常只有几张或十几张GPU,当需要构建庞大的算力集群时,必须使用大量复杂的交换机层层连接,这会导致严重的数据传输延迟和带宽浪费。而超节点(如MTT C256)通过在底层架构上的创新,首创了一层Scale-up网络,能将成百上千张GPU在物理层面直接全互联起来,使其通信延迟达到极低的亚微秒级,整体就像是一台性能极其恐怖的超级计算机,专为攻克万亿参数的大模型训练而生。
为什么说算力网络的爆将会改变普通App的流量分发模式?
过去的大模型大多只是聊天的工具,但随着底层算力的突破与算力网络的普及,“智能体(Agent)”与具身机器人开始具备理解用户意图并直接接管操作的能力。未来的流量将不再主要由人类在手机屏幕上点击产生,而是由隐藏在云端的AI算力网络或者身边的智能硬件自动调用各个App的接口来完成。这种由“机器意图调度”代替“人类人工点击”的范式转移,将彻底颠覆现有的应用商店分发与广告引流漏斗。
面对机器引发的跨端意图跳转,App开发者应该如何应对数据丢失的问题?
当AI智能体或智能硬件试图在后台拉起某个App并传递复杂的业务指令时,极易受到操作系统的沙盒隔离限制而导致关键参数丢失,造成用户看到空白首页的“场景断层”。开发者必须在自身应用的底层基建中深度集成类似于深度链接与全场景传参的技术引擎。这类技术能够在跳转或下载的物理阻断中强力维持参数的连续性,确保无论跨越多少个终端或应用屏障,最终都能为用户无缝还原最初的业务场景,并为企业提供清晰的全渠道数据溯源。
