


一 | 7月的上海,2026世界人工智能大会(WAIC 2026)如期而至。在国产高性能通用GPU企业沐曦股份的展台,八组闪烁着蓝色灯带的黑色机柜组成的“算力墙”成为现场被围观最久的展品。 AI算力“卖水人”的造富神话仍在继续。 近日,AI云平台Together AI宣布完成8亿美元C轮融资,投后估值飙升至83亿美元(合约581亿元)。本轮融资由沙特阿美旗下Aramco Ventures领投,英伟达(NVIDIA)、Vista Equity Partners、General Catalyst等明星机构跟投。 这是沐曦本届大会正式发布的新一代AI超节点产品曦景S600——面向大模型训练、推理及智算中心建设打造的系统级算力产品。 而沐曦在WAIC 2026上讲述的故事不止于此。在展台的另一侧,沐曦集结了十大顶流开源社区,专门设置了“开源工坊”展示全栈适配成果;而在“万象应用”展示区陈列着机器人、智能座舱、卫星实物,布局跨度从地面延伸向太空。 一家GPU公司为何要“四面出击”,答案或许指向同一个底层逻辑:通用性。 当前,在大模型竞争激烈之下,这家成立仅4年的AI云平台服务商,为何能吸引巨头们争相入局?答案,或许藏在“开源模型”与“华人技术天团”的两个关键词里。 一年估值上涨1.5倍,开源AI成吸金利器 Together AI成立于2022年,几乎与ChatGPT同期诞生。 软硬件迭代周期的显著差异,决定了算力基础设施的核心竞争力,并不局限于某一场景下的峰值性能,而在于对快速演进的模型架构的持续适配能力。

二 | 成立时,公司就明确定位——做一家 “AI原生云”公司 ,核心业务是向企业出租基于英伟达GPU集群的算力,让开发者能以极低成本运行开源大模型。

三 | “今天沐曦所具备的技术能力、技术积累完全可以覆盖云端所有的产品线。

四 | ”沐曦股份研发副总裁黄向军在WAIC期间接受《国际金融报》记者等媒体采访时作了一个通俗比喻,“就像药房开了之后,我根据产品定义往里边抓什么药。 发展初期,以OpenAI为首的闭源模型,曾一度占据主导地位,但很快市场发现,企业端落地的AI业务面临一个残酷的事实:闭源前沿模型Token费用高昂,无情地吞噬了AI应用们的利润空间。

五 | 技术底座跟能力都已经在了,配方只是产品定义的问题”。

六 | 超节点成为“必答题” 华为Atlas 950 SuperPoD、中兴Matrix超节点、新华三UniPoD S80000超节点、阿里云发布灵骏真武M890超节点……在WAIC 2026上,多款国产超节点产品集中亮相说明,这已不是单个厂商的“独行”,而是国产算力对未来趋势的共识。 “超节点不是在任何场景下都起作用的。而随着DeepSeek等高性能开源模型的强势崛起,行业现状正在发生改变。 在从“闭源”向“开源”转型的过程中,Together AI直击这一痛点,通过整合DeepSeek、MiniMax、Kimi等主流开源模型,为企业级客户提供Serverless推理、专属基础设施及批量推理等多元化服务,成为这波开源模型生态爆发中,最大的受益者。 依托完善的开源模型生态布局,Together AI打造出极具性价比的开源模型“平替”方案。

七 | 数据显示,在同等甚至更优性能表现下,企业接入Together AI算力服务后,推理成本可降低6倍至60倍。 以其AI客服平台Decagon为例,当工作负载全部迁移至Together AI后,推理成本直接缩减6了倍。如果单个8卡机能够搞定计算任务,那么就不需要超节点。只有遇到比较大的模型尺寸时,才需要超节点。强大的成本优势,直接转化为真实的业绩订单:最新一季年度预订额显示,Together AI的订单量较上个季度,强势突破11.5亿美元,即从最开始的2024年初3000万美元,暴涨到现在的11.5亿美元,涨幅达38倍。”对于超节点的适用边界,黄向军在受访时给出清晰的界定。 两年暴增38倍的年度预订额,彻底引爆了Together AI在开源AI领域的商业潜力。 这也直接点明了驱动超节点诞生的逻辑,随着大模型参数规模从千亿走向万亿级别、MoE(混合专家)架构成为主流,传统GPU服务器在互联效率、算力密度、部署复杂度等方面面临多重挑战。 黄向军进一步从MoE架构的通信特点阐释称,无论训练还是推理,专家间All-to-All通信要求延迟越低越好,这意味着需要把更多GPU以更高带宽连成一个整体。

八 | 而当原有的8卡机难以承载这一需求,把多台8卡机拼在一起后,机间互联又退化为新的堵点——客观上催生了对“一个紧密互联整体”的需求。 沐曦选择将64卡作为规模锚点,原因之一在于这是当前模型尺寸与趋势下需求旺盛的节点规格。曦景S600正是基于这一判断应运而生——单机柜内64张GPU高速全互连,并支持灵活扩展至万卡乃至十万卡级别的集群,为大规模智算中心建设需求提供系统级支撑。一是,随着AI Agent的爆发,企业AI已不再需要简单的问答机器人,而是能够处理复杂工作流的数字员工,这从中催生了海量的Token调用量。 蔡淑敏/摄 S600的“零线缆”突围 当算力集群走向万卡甚至几万卡,故障率便成为了尤为重要的考虑因素,集群持续稳定工作的时间将直接决定整个系统的有效算力上限。 “过去一段时间里,就沐曦自身来讲,我们在单个GPU上或者8卡内,故障率已经控制到了非常低的状态。客观来讲,我们对于故障率的控制,跟英伟达应该是在一条水平线上。

九 | 二是,Together AI自身也通过底层技术的创新,打破算力成本的物理瓶颈。 其通过自主研发的自研ATLAS推理引擎,以及推测解码(Speculative Decoding)等前沿技术,将部分推理工作负载速度最高提升400%。”黄向军表示。

十 | 然而,在构建大规模算力集群时,单卡可靠性并不等于集群可用性。 黄向军也提到,当把多台8卡机组成集群时,光模块、网卡、磁盘等部件问题频出,散热设计也是关键,高温运行条件下更容易出故障。这种全链路的技术优化,使得Together AI能够以远低于传统云厂商的成本,交付出企业级所需的推理服务,构筑起技术壁垒。因此,超节点的稳定性、可靠性已成为整个系统设计中非常重要的一环。 让曦景S600实现技术分野的关键,在于其连接方式的创新。 也正因如此,Together AI估值持续攀升。2025年2月,在由General Catalyst领投的B轮融资中,Together AI的估值仅33亿美元。然而,16个月之后,其投后估值就达到83亿美元,这相当于一年内上涨了1.5倍。 北大校友与斯坦福教授坐镇,一支“华人技术天团”浮现 Together AI的快速崛起,除了踩准开源AI的产业风口,背后还有一支“华人核心技术团队”浮现。据介绍,该产品采用OEX架构设计,通过正交连接器与两级交换拓扑,实现GPU之间低时延、高带宽通信,有效提升分布式训练效率,能够更好满足MoE稀疏模型、万亿参数大模型等复杂AI任务对集群通信能力的要求。 翻看Together AI的官网,不难发现,其创始人团队堪称“学霸天团”,且华人占比较高。 更具突破性的是其“零线缆”设计方案——“曦景S600创新采用“三0设计”,即计算节点0线缆、交换节点0线缆以及计算节点与交换节点之间0线缆。 首先作为这支技术天团的核心代表之一,联合创始人兼CTO的张策(Ce Zhang)来自于北京大学。

十一 | 这一系统设计大幅减少传统机柜复杂布线带来的信号损耗和故障风险,进一步提升系统可靠性和长期稳定运行能力。 同时,产品采用解耦模块化设计,计算、交换、电源及液冷等关键模块均支持快速部署和维护,电源与液冷管路支持盲插热插拔,即使单节点发生故障,也不会影响整个集群运行,显著降低数据中心运维成本。履历显示,他拥有扎实的顶尖学术背景,2008年张策本科毕业于北大数学系,随后在威斯康星大学麦迪逊分校获得博士学位,且担任过苏黎世联邦理工学院计算机科学系的助理教授。 不做“某大厂的专属GPU” 硬件能力的突破之外,沐曦在本届WAIC重点释放了另一个信号:开放。 “我们不会独立依附某一个大厂,不是某一个大厂下面标签很重的专属GPU供应商。

十二 | ”黄向军在采访中明确,沐曦的生态定位是通用专业基础设施提供商,产品能够适配不同客户,不会把产能押在单一大客户身上。 这一开放逻辑同样贯穿其超节点策略。 在研究中,他始终围绕如何让机器学习更便宜、更可信、更容易被更多人使用的这一主线,认为AI不应当只是巨头们的专属工具,而是通过系统层、调度层、分布式架构的创新,把训练和推理的算力成本打下来,让个人、初创公司、传统行业都能低成本地使用开源大模型。沐曦选择与OEM合作伙伴联合打造整机产品,“我们觉得开放能促进更好的创新,避免单一供应商;各自在各自的生态位上去创新,组合在一起形成整个上下游中最有竞争力的产品。 基于这一核心理念,张策主导了Together AI在底层算力调度与推理引擎上的创新,带领团队研发自研的ATLAS推理引擎,并深度集成了NVIDIA Dynamo等先进的分布式推理技术。”黄向军认为,垂直整合在研发和效率层面具有优势,但从供应角度看未必是最优解。 在世博展台,为集中展示其计算生态开放路径和成果,沐曦专门设置了“开源工坊”展区,集结了九源联合体、龙蜥操作系统、木兰开源社区、模力方舟、vLLM、SGLang、Red Hat、CNCF、蜜瓜智能、PyTorch基金会等十大顶流开源社区,串联起一条覆盖操作系统、云原生、推理加速、模型服务、集群内核全层级软件栈的完整AI Infra开源协作链路,集中展示了沐曦股份在AI框架、算子库及多种开源模型方面的适配成果。这一系列的创新,让Together AI实现了上下文感知的智能路由与KV缓存管理,有效避免了大规模算力部署中的冗余计算问题,进而在商业上成功斩获年度预订额突破11.5亿美元的亮眼成绩。 其次,张策之外,公司联合创始人珀西·梁也是一名深耕AI领域的顶尖华人学者。

十三 | 据官方数据,自2025年2月开源以来,目前MXMACA开源社区已经汇聚超过50万技术开发者用户。

十四 | 身为斯坦福大学计算机科学系的教授,珀西·梁是斯坦福基础模型研究中心(CRFM)的主任。在自然语言处理与机器学习领域,他专注于开源基础模型的研发、模型评测体系的搭建等。 而在科学计算领域,沐曦已经实现从“兼容开源”走向“贡献开源”。沐曦深度参与GROMACS社区,其自由能微扰GPU加速代码已合入开源主线,成为国内首家对该核心模块作出重要代码贡献的企业。产业应用层面,沐曦股份携手鸿之微、深度原理、唯信科技、大湾区国创中心等产学研伙伴,在新能源材料研发、工业冷却液分子筛选和AI短临气象预报等场景形成落地成果,以自主算力赋能创新提速。

十五 | “死磕”GPU通用性 实际上,沐曦股份的开放理念同样在其产业布局上得以体现。

十六 | 在团队合作上,如果说,张策在底层架构方面,为Together AI搭建了一条高效、低成本的算力“高速公路”,那么珀西·梁则凭借深厚的学术积累与行业认知,成为公司技术落地的“导航仪”。他通过严谨的评测基准,帮助Together AI在纷繁复杂的开源模型生态中,持续筛选出最优方案,确保底层技术的可靠性与前沿性。 在张策与珀西·梁的领衔下,他们与公司首席科学家特里·陶(Tri Dao),共同撑起了公司的底层竞争力,合力将Together AI的“算力成本”实现指数级下降,并从多个维度夯实Together AI的底层算法与系统能力,让公司在算法迭代、模型选型、系统架构、算力调度等方面持续领跑。

十七 | 英伟达的“阳谋”:扶持生态卖更多GPU 再来看英伟达的出手,实际上,背后也暗含巨头布局AI算力生态的渴求。

十八 | 除了入口处最醒目的曦景S600,同样吸引观众驻足的还有沐曦展区陈列的卫星实物,这是沐曦“1+6+X”产业生态中的一环,直观地展示了国产GPU向空天算力场景延伸的布局。而在“万象应用”展区,沐曦集中展示了其高性能GPU算力平台在金融、医疗、能源、教科研、交通、大文娱六大核心赛道的赋能落地成果。 行业内更关注沐曦在具身智能方向的落子——这是今年WAIC的另一大焦点,也是沐曦当前重点布局的一大方向。

十九 | 作为跟投方,英伟达不是第一次入局Together AI。

| 此前,沐曦与“人形机器人第一股”优必选成立合资公司布局具身智能,被外界认为是向端侧延伸的重要信号。 早在2023年11月,A轮融资时,英伟达就参与了其早期融资。对于与优必选的合作,在此次WAIC上,沐曦股份高级副总裁孙国梁在受访时强调,沐曦秉持着一贯的通用开放态度,成立合资公司并不代表芯片独家供应给某一家企业,而是希望从成熟的具身智能企业获取数据、场景、使用习惯与客户需求的大量输入,加速SoC整体设计。合资之外,沐曦仍保持开源、开放、生态共赢,愿意联合各家机器人企业,在平台、数据、训练和世界模型等方面展开广泛合作。 而对于布局端侧AI算力产品这一选择,黄向军在受访时提到,沐曦已经具备了打造高性能云边端一体芯片的能力,“我需要的是合适的场景判断。合资公司的角色是定义产品规格,而沐曦在云端打造的整套软件生态链价值将会助力端侧产品加速走向成熟”。 事实上,端侧AI的载体形态远未收敛,行业内尚未形成统一的共识,而这种不确定性恰恰解释了沐曦为何始终坚持GPU通用性——端侧形态千变万化,底层不变的是Token驱动,差异在于算力规模。 “通用的含义是,一方面要能支撑今天已有的多种模型,另一方面是要能支持未来可能出现的新的模型。

| ”黄向军指出,GPU指令集粒度足够细,才能通过编译器适配现有乃至未来出现的模型,英伟达三五年前的芯片至今仍能跑最新模型,正是通用性的体现。 而通用性的前提,是软硬件解耦——模型架构和算法迭代速度远超硬件,如果芯片专为某一场景或模型定向优化,一旦端侧形态发生变化,前期的巨大资产投入将很有可能化为泡沫。

| 彼时,英伟达也作为跟投方,投资该公司,而本轮融资中,领投方为Kleiner Perkins(凯鹏华盈)和沙特阿美旗下的 Prosperity7。 英伟达之所以持续布局这家公司,目的也很明确。

| 黄向军在采访中坦言:“软件创新节奏以周为单位,芯片从定义到量产两年能做完已经非常快。如果芯片没有通用性,将是一个灾难。” 记者 蔡淑敏 文字编辑 马云飞。截至目前,被英伟达看中的Together AI,已不是一家简单的AI云服务商了,而是英伟达庞大算力帝国中不可或缺的“生态节点”。简单来说,就是通过投资,英伟达直接锁定了巨额的硬件订单。 披露显示,Together AI的商业模式是建立在英伟达的H100、H200乃至最新的Blackwell GPU之上。而Together AI年预订额突破11.5亿美元之后,势必也将对海量的GPU集群有更刚性的需求。英伟达的注资,刚好为自家芯片的持续消耗“铺路”。

| 除此之外,英伟达也正试图通过这类“新云”(Neocloud)服务商,打破传统云计算巨头的垄断,构建起更为广泛的算力分销网络。这对于英伟达来说,相当于通过扶持Together AI等服务商,将中长尾的AI开发者和企业需求打包,进而转化为更稳定、更可预期的采购曲线。 当然,更深层次的原因在于,英伟达正在从“卖硬件”的角色向“分收入”转型,做AI基础设施的合伙人。7月1日,英伟达已正式推出AI Compute Partnership(AI 算力合作计划),并明确其“产业链共建伙伴”的定位。这意味着,英伟达将不止卖硬件,还将提供信用支持和收益共享机制,让Together AI等这类企业无需承担巨额的前期资本支出,就能快速扩张算力规模。 在这一模式和新定位下,英伟达已和Together AI之外的AI云服务商,如Sharon AI、Firmus等建立合作,他们将共建基于NVIDIA DSX AI Factory架构的“AI工厂”。 最新一季财报显示,英伟达交出了一份令人瞩目的成绩单:单季营收高达816.15亿美元,同比大增85%;归母净利润更是同比飙升211%,达到583.21亿美元。

| 这一数据不仅刷新了英伟达季度营收的纪录,还助力英伟达站上5万亿美元市值,充分印证全球市场对AI算力基础设施的旺盛需求。而仔细翻阅这份绩单,不难发现,客户的多元化是此次英伟达业绩大增的一股力量之一。

| 财报显示,在数据中心业务中,英伟达的业绩增速需求,不仅来自超大规模云厂商(Hyperscaler),还广泛来源于AI云、工业、企业及主权AI客户,客户结构的分散化,降低了英伟达对单一大客户的依赖,让其构建起更具韧性的增长盘。同时,随着全球大模型迭代的加速,以及AI应用的快速落地,又进一步带动了全球AI工厂、数据中心的扩容,让下游云厂商、AI原生企业及政企的算力采购需求旺盛,增强了英伟达业绩向上的预期。

| 在英伟达的这场“阳谋”之下,Together AI也放话称,计划在未来五年内将公有云容量,也就是“算力”规模扩大50倍。

| 这意味着,当算力成本不再是行业瓶颈时,属于开源大模型的时代或将真正到来,对于AI开发者而言,届时将是真正意义上的“Together AI”。 而这家由华人技术力量主导的AI独角兽,也将乘着全球AI基础设施建设的东风,继续向前奔跑。
Current article:http://bd43.deshabisaoguonouzuo.cfd/list_ldg/00e5cqg.html
Published on:21:42:01