同一家Agentic Infra为何能同时服务MiniMax和阶跃星辰?这不是巧合,是算力规模化的必然
社区讨论 · 政策

同一家Agentic Infra为何能同时服务MiniMax和阶跃星辰?这不是巧合,是算力规模化的必然

算子融合了吗算子融合了吗7月20日2026/07/20 95 浏览

WAIC论坛上,MiniMax和阶跃星辰同时出现在同一家AI Infra公司的现场,这个现象本身值得深挖。作为每天和昇腾CANN、AI编译器打交道的工程师,我第一反应是:这两家模型厂的技术栈路线大概率走向了“统一基础设施层”。这不是简单的供应商选择,而是AGI时代底层基础设施走向标准化的标志性事件。

先看数据。我整理了近期几家头部模型厂的公开部署信息:

模型厂 公开训练规模 推理部署场景 基础设施选型特征
MiniMax 千卡级集群 对话、Agent 强调高吞吐、低延迟
阶跃星辰 万卡级集群 多模态Agent 强调动态批处理、内存优化
智谱AI 千卡级 开放平台 强调算子融合、通信优化

关键点:这三家都选择了同一家Agentic Infra公司作为核心基础设施供应商。 这不是偶然,而是算力成本压力下的理性选择。

从编译器视角看,AI Infra的核心价值在于屏蔽底层硬件差异,提供统一的IR(中间表示)优化空间。过去每个模型厂都要自己搞算子融合、内存管理、通信调度,现在这个工作被抽象到Infra层。一个成熟的全栈Infra可以让模型厂的算子优化效率提升30%以上,因为所有共享的优化工作可以复用。

我注意到新闻中提到的“Agentic Infra”概念,本质上是在传统AI Infra(训练+推理)基础上增加了一层Agent执行引擎。这层引擎需要解决三个核心问题:

  • 动态图执行的可预测性:Agent场景下,模型调用是无序的、依赖环境反馈的,传统的静态图编译无法应对。需要支持动态形状、条件分支、循环的即时编译优化。
  • 多模型协同的调度开销:一个Agent可能同时调用多个模型(语言模型、视觉模型、工具调用),端到端延迟的瓶颈往往在模型切换时的上下文切换和内存搬运。优化点包括:共享KV缓存、预加载模型权重、流水线并行。
  • 资源利用率与成本权衡:模型厂需要支持多租户、多任务的混合部署,Infra能否实现隔离性和超分(overcommit) 直接决定了百万级日活场景下的成本。

我拿到过某家Infra公司的内部测试数据:在相同硬件(A800 8卡)上,使用其Agent执行引擎,端到端吞吐量比原生PyTorch部署提升2.1倍,内存占用降低35%。这些数字背后是大量的底层优化工作:

优化的典型手段:
1. 算子融合:将多个小算子合并为更大粒度,减少Kernel Launch次数
2. 内存池化:复用推理过程中的临时张量,避免碎片化
3. 通信优化:针对Agent场景设计专用AllReduce策略,减少同步开销
4. 动态shape编译器:支持变长输入,消除padding浪费

这些优化是通用的,但需要大量的工程投入。一家模型厂自己搞,可能投入50人年才能达到同等水平。而选择专业Infra供应商,相当于直接享受了数百人年的研发成果。这就是为什么不同模型厂会选同一家Infra——因为基础设施的规模效应是超线性的。

从技术实现角度看,这家Infra公司很可能采用了分层IR设计。上层是Agent逻辑的IR(描述任务依赖、函数调用),下层是硬件相关的Op IR(描述算子执行)。这种设计的好处是:模型厂可以专注于上层Agent逻辑,而底层优化由Infra自动完成。这也是我判断“AGI时代的地基终于浮出水面”的原因——当基础设施能够抽象掉硬件差异,并自动优化执行路径时,模型厂才能真正聚焦于模型能力的提升。

但也要看到风险。市场集中度风险:如果模型厂过度依赖单一Infra供应商,未来议价空间会变小。技术演进风险:Infra的能力边界取决于其编译器团队对硬件特性的理解深度,如果硬件架构发生重大变化(比如存算一体、光计算),现有Infra能否快速适配?生态锁定风险:模型厂如果深度绑定了特定Infra的IR,迁移成本会很高。

我的判断是:对于当前阶段的模型厂,选择统一Infra是最优解。因为AGI竞赛的核心是模型智能水平的提升,而不是基础设施的重复造轮子。当所有模型厂站在同一地基上,比拼的才是真正的模型能力。只有当基础设施充分竞争并标准化后,模型厂才需要考虑差异化基础设施建设。

一句话总结:AI Infra的统一化不是巧合,而是算力规模化和工程复用的必然结果,AGI时代的真正地基是那些能同时服务多家模型厂的专业基础设施层。

原文链接:https://www.qbitai.com/2026/07/455805.html

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧