博客 报亭 音乐
我的阅读

    从百美元到数千美元,AI互联为什么越卖越贵?

    雷峰网 2026-09-17 10:03
    ⏎ 返回 ⭢阅读原文

    2026年的CIOE中国光博会,人潮如织。

    社交媒体上甚至有人开出2500元一场的讲解费,希望找到业内人士陪同参观。走进场馆后更直观的感受是,今年光博会几乎所有与AI相关的环节都在升温:从光模块、光器件,到高速互联和数据中心基础设施,AI需求正在把原本相对垂直的光通信产业链整体推向更高热度。

    Astera Labs也出现在今年光博会。这家2017年成立的美国半导体公司,最早从PCIe Retimer切入高速互联,如今产品已经延伸至铜互联、光互联和机架级连接;截至九月,这间公司市值已接近500亿美元。

    “算力需求越高,处理器之间的数据交换就越需要快速传输,互联这套‘神经系统’也必须跟上。”Astera Labs总裁兼COO Sanjay Gajendra对雷峰网表示。

    这股热度背后,是AI基础设施规模持续扩张带来的互联压力。当GPU从几颗扩展到几十颗甚至成百上千颗,处理器之间的数据传输效率,开始直接影响整套基础设施的性能。


    铜光之争,最后要算Token成本

    为什么早在2017年,大语言模型尚未得到广泛应用时,Astera就开始押注互联方向?

    “我们当时判断,那些为上一代处理器设计的连接架构,在单台服务器拥有10个乃至今天数十个处理单元时,将无法继续支撑系统需求。”Gajendra说。

    当时常规服务器通常围绕1至2颗CPU设计,存储、网络等设备更多作为外围I/O存在;但随着CPU、GPU、SmartNIC等越来越多处理器开始同时进入服务器,系统内部需要交换的数据量迅速上升。

    “就像一台机器里有了很多个‘大脑’,原本围绕少量处理器设计的互联架构,已经难以继续支撑它们之间的数据交换。”Gajendra解释。

    来到2026年,这一问题随着AI的发展进一步放大。Gajendra将今天互联架构面临的挑战概括为三个变量:速率、规模和功耗。Astera Labs成立前后,PCIe单通道速率还处在8 GT/s级别,如今已经提升到64 GT/s;AI系统也从早期4至8颗GPU,向数十、上百及更大规模扩展。

    为了跟上当前AI部署的步伐,数据传输速度每年都在翻倍。”Gajendra说。规模扩张带来的同时,通信延迟必须尽可能低,同时还要维持内存一致性和处理器之间的同步;系统规模扩大后,互联本身的功耗也产生了约束。

    这种扩展带来的压力,已经对铜光边界带来了改变,打破了短距离更多使用铜、长距离转向光互联的惯性思维,距离已经不再是决定使用光还是铜的主要变量。Gajendra认为,决定机架内部何时进一步从铜转向光,最核心的两个变量是传输速率和GPU规模

    对于200G/lane级别的连接,铜互联依然可以胜任;进一步走向400G/lane之后,光将更多进入机架内部,GPU数量增加带来的连接密度和散热压力,将进一步影响客户选择铜互连还是光互联。

    除了以上两点,让铜光边界变得更复杂的,还有成本。所有厂商最终都要算一笔账:不同连接方式,对应的整套系统Token成本究竟是多少。

    光博会现场,Astera Labs的工程师告诉雷峰网,下一代AI系统中,铜和光不会简单形成替代关系。大量短距离连接仍然适合使用成本更低、技术更成熟的铜;而当系统扩大到数千张GPU、跨越多个机架时,衡量连接方案的指标会进一步变成整套系统的单位Token成本。

    工程师进一步提到,以英伟达NVL72的72-GPU scale-up域为参照,当计算需求继续扩大后,更大的scale-up域可能减少数据频繁经过scale-out网络。后者通常还需要经过网卡、以太网或InfiniBand交换机等多个子系统,引入额外延迟和系统复杂度。借助光互联扩大scale-up规模,因此可能进一步优化单位Token成本

    在具体技术路径上,Gajendra判断,NPO(近封装光学)将在2027年前后开始进入scale-up部署;CPO(共封装光学)目前虽然已有小规模应用,但在scale-up域的更大规模的部署可能要到2029至2030年以后。

    从这个角度看,AI互联面对的问题已经不只是“数据怎么传得更快”,而是如何用不同的连接方式组织越来越多GPU,并让整套系统以更低成本输出更多Token。(关于scale-up域互联的更多信息,欢迎添加作者微信treelog10交流,互相学习)


    资本开支趋稳,价值量继续上移

    过去两年,AI基础设施最直接的增长逻辑,是超大规模云厂商持续提高资本开支。

    但很显然,这种投入不可能永远维持相同增速。当被问及未来一两年头部云厂商放缓AI数据中心建设,是否会影响Astera Labs这样的连接厂商时,Gajendra没有否认这种可能。

    他认为,AI目前仍处于基础设施集中建设阶段,仅美国超大规模云厂商已经公开承诺了超过1万亿美元的数据中心投资;但随着大规模建设逐渐完成,资本开支在未来几年终究会趋于稳定

    市场对这一增速能维持多久也越来越敏感。据公开信息,微软、Alphabet、亚马逊、Meta和Oracle五家AI超大规模厂商2026年的资本开支合计约7950亿美元,2027年将接近1.08万亿美元,市场在密切关注这轮支出是否会出现放缓迹象。

    对Astera而言,答案并不只是等待云厂商继续扩建更多数据中心,而是提高自己在每颗加速器周围能够获得的价值量。Gajendra给出了一组直观的数字:早期只有Aries PCIe Retimer时,Astera每颗加速器对应的产品价值量不到100美元;后来加入交换芯片和内存产品,这一数字上升到数百美元;到了scale-up交换阶段,每颗加速器对应的价值量已经达到数千美元。

    显然,scale-up是Astera正在加码的方向。Gajendra透露,公司原本预计Scorpio系列要到今年第四季度才会成为收入规模最大的产品线,但这一节点已经提前至第三季度。

    除了提高单颗加速器对应的产品价值量,Gajendra还把推理市场视为另一个增长来源。

    他认为,训练和推理虽然对互联都有高带宽、低延迟和低功耗的共同要求,但两类工作负载的侧重点并不完全相同。训练更依赖计算能力,推理则相对更看重内存和低延迟。

    与训练主要集中在大型数据中心不同,Gajendra认为推理市场的参与者和系统形态会更加分散。“尤其是在推理市场,会有更多客户进入。这是一个非常分散的市场,会有很多参与者、很多系统。”Gajendra说。

    未来的连接需求,未必只取决于少数头部云厂商继续建设多少超大规模训练集群。随着AI从训练进入大规模推理,连接需求可能进一步扩展到更多不同规模、不同部署形态的系统。

    当客户的规模和部署形态进一步增加,连接厂商面对的也不再是一套相对统一的需求。不同市场、不同类型客户对标准化程度、产品迭代速度和系统定制的要求正在逐渐拉开。

    这种差异,在中美两类AI基础设施市场中表现得尤其明显。


    系统越定制,连接方案越分化

    随着推理市场进一步分散,连接厂商面对的客户也会越来越多样。相比北美,中国AI基础设施市场已经呈现出明显不同的客户结构。

    Gajendra表示,北美市场目前主要由亚马逊、微软、Google和Meta四家超大规模云厂商主导,同时还有OpenAI、Anthropic等AI实验室;而在中国,除了字节跳动、阿里等大型互联网公司之外,还有大量不同规模的创业公司参与AI基础设施建设。

    “如果一定要总结一个区别,中国市场机会推进的速度非常快。”Gajendra说。相比北美,中国市场参与者更多,客户覆盖的应用场景也更加广泛,对供应商的响应和产品落地速度要求更高

    Astera工程师也向雷峰网提到,美国大型客户通常更强调标准化、供应链复用以及不同代际产品之间的兼容性;相比之下,中国客户更愿意尝试不同的技术方案,也更加看重产品能否快速落地。

    虽然客户内部的系统会越来越定制,但外部连接接口仍会保持标准化。“定制化会越来越多,这一趋势还会继续,但大家仍然会尽量采用开放标准。外部连接和接口会保持标准化,而处理器内部架构则会根据不同工作负载和性能指标进行定制。”Gajendra说。

    他以字节跳动和阿里为例:字节的基础设施更多服务自身业务,而阿里既需要支撑内部应用,也需要向外部客户提供云服务,因此两类公司的处理器和服务器设计不会完全相同。

    AI系统内部越来越定制,系统之间的连接接口反而更需要标准化。对于连接厂商而言,需要适配的已经不是一套统一的服务器架构,而是越来越多样的处理器、工作负载和部署形态。

    从铜光选择,到scale-up扩展,再到不同客户对定制化和标准化的不同要求,连接正在从一个相对独立的配套环节,变成AI基础设施设计的一部分。

    当连接方式开始同时影响GPU规模、系统延迟和Token成本时,它的价值也不再只是“把数据传过去”,而是决定更多算力能否真正转化成可用的系统性能。