过去数年,AI算力扩展方式经历两次跃迁。第一次是Scale-Up(纵向拓展)——在单个服务器机柜内通过高速互联将数百个GPU连成一体,追求极致低延迟。第二次是Scale-Out(横向拓展)——在同一数据中心内跨机架扩展,将上千块GPU组成集群。

但这两次跃迁都有一个共同的隐含前提:算力是集中在一个物理位置上的。

当大模型快速迭代、推理请求跃升万亿级、当芯片类型从一两种变成数种时,没有任何一个单一数据中心,能够同时装下所有芯片类型、模型版本和推理需求。

算力基础设施正在跨越地域限制,被一个新的概念定义——Scale-Across(跨域拓展)。

什么是Scale-Across

Scale-Across指的是将算力资源从单一数据中心内部,扩展到多个地理上分散的数据中心、边缘节点,并通过统一的调度层实现跨域的算力协同。

它与前两代扩展的区别在于:

Scale-Up解决的是“机柜内芯片怎么连”的问题,Scale-Out解决的是“机房内机架怎么连”的问题,而Scale-Across解决的是“不同地点、不同架构算力怎么协同工作”的问题。

它要求调度层能够理解异构芯片的能力差异、能够感知跨域网络的延迟与带宽、能够将推理请求精准路由到最合适的算力节点上。

Scale-Across是下一阶段的必然

IDC研究显示,全球边缘企业基础设施支出预计将从2025年的500亿美元增长至2030年的1100亿美元,主要驱动力正是AI工作负载的边缘化部署,算力供给正在从集中走向分布。 

推理负载对延迟的要求在提高。企业将模型推理从云端迁移到边缘设备,无需等待请求绕行中心数据中心产生的时延,AI运营支出可降低40%至70%。

单一芯片体系无法覆盖所有负载。 不同模型在不同芯片上的推理效率差异显著,任何一个算力平台,都必须同时纳管多种芯片架构,并根据负载特征动态分配。

家庭算力也将成为这一趋势中的新变量。随着AI PC、NAS、游戏主机、智能终端等设备算力持续提升,未来家庭中闲置的GPU/NPU资源有望接入统一调度,承接低时延或长尾推理任务,也可能成为Scale-Across网络中贴近用户的边缘算力节点。

AI Infra,必然走向跨地域、跨架构的分布式算力系统。

TOLD架构:Scale-Across的博伦智汇答案

博伦智汇现已跑通分布在全国从广东到内蒙的Scale-Across分布式Token调度,跨地域算力协同,已经在真实业务中落地。

TOLD全称Token-Oriented Large-scale Distributed Architecture,是博伦智汇自研的面向Token的大规模分布式技术栈。

它以低时延、高吞吐、低成本为目标,在控制面上完成从资源规划、资源管理到推理服务部署的全链路调度。当推理服务需求到来时,先对需求做拆分,确定需要的GPU型号、显存大小和数量,再通过资源管理系统完成真正的资源交付,最后由推理服务部署系统完成编排和自动扩缩容。交付给用户的,就是更快、更好、更便宜的Token。

博伦智汇的BooleanMix大规模调度平台,就是基于TOLD架构实现的异构算力调度系统。 它负责把TOLD的调度决策落地到具体的GPU资源上,让每一颗芯片都能在平台之上得到极致释放。

BooleanMax是面向企业的梯度Token工厂,无论底层算力来自哪个数据中心、哪种芯片架构,用户通过统一API获取的都是同一套Token服务。

未来,博伦智汇致力于将Scale-Across能力发挥极致,突破跨数据中心、跨区域的算力互联,将分布式数据中心组合成统一的超级Token工厂。

关注中国IDC圈官方微信:idc-quan 我们将定期推送IDC产业最新资讯

查看心情排行你看到此篇文章的感受是:


  • 支持

  • 高兴

  • 震惊

  • 愤怒

  • 无聊

  • 无奈

  • 谎言

  • 枪稿

  • 不解

  • 标题党
2026-09-24 10:56:00
2026-08-27 11:52:00
数据中心液冷 我国首部冷板式液冷国标正式发布!科士达深度参编,助力液冷产业迈入标准化新时代
该标准的发布,标志着我国数据中心液冷产业正式迈入标准统一、生态协同、创新加速的高质量发展新阶段。 <详情>
2026-08-26 11:21:00
边缘计算 博伦智汇完成千万级天使轮融资 布局大规模分布式推理普惠Token
本轮资金将主要用于核心技术迭代、产品打磨、核心技术团队扩充,加速公司在 AI 算力产业的市场拓展与业务落地。 <详情>