新华三创新5G

  • 产品与解决方案
  • 行业解决方案
  • 服务
  • 支持
  • 合作伙伴
  • 关于我们
banner_pc.jpg

痛点与诉求

企业在自建GPU集群过程中普遍面临四大挑战:
1.资源利用率低:GPU利用率长期偏低,负载不均衡时人工调整困难,资源闲置与排队等待并存;
2.运营处于“黑盒”状态:部署了哪些模型、占用了多少GPU、Token调用量有多少,缺乏可视化手段支撑精细化决策;
3.国产GPU“用不好”:生态适配困难,模型更新难、上层智能体开发门槛高,硬件买回来却难以发挥价值;
4.成本算不清:传统线下申请流程慢、成本无法核算到部门,导致“预算说不清、价值算不出”。

方案设计

在企业内部署一套图灵Token工厂,以模块化云原生架构组合资源调度中台、资源管控、任务引擎与可视化交互系统,构建企业统一的智算运营底座。平台可以将不同品牌、不同代际的GPU统一纳管为逻辑资源池,以容器化方式隔离任务环境,向上同时输出三种核心服务形态:
1.GPU容器服务:供开发调试、训练与微调任务随用随取;
2.Token服务:已经上架的模型,内部用户三步即可部署一个模型服务;
3.SLURM算力作业:支撑AI for Science等科学计算分析。
多厂区、多数据中心的算力资源可通过多站点并网接入统一管理中心,形成一体化智能服务中心。

运营机制

以“看清、管住、用活”为主线设计运营机制:
看清:资源视图实时呈现GPU总量、使用量、剩余量与Token调用量;
管住:资源按“1卡/1G显存”等多种规格精细划分,并按财务、生产、销售等业务部门分组管理,各部门调用对口的模型服务或算力规格;
用活:每笔资源开销记录在案,Token消耗量既作为内部结算依据,也可与成果产出关联作为工作评价依据。

业务价值

通过“算力池化→模型资产化→服务API化→运营商品化”的完整链路,内部运营模式实现四大价值:

1.降本,在不增加硬件采购的前提下,通过提升硬件占空比与弹性调度支撑更多业务并发,大幅降低单位推理成本;
2.增效,将模型从开发到生产上线的工程化周期压缩至分钟级,加速业务创新;
3.透明,资源使用、成本开销、调用情况全程可追溯,预算决策有据可依;
4.可控,从底层运维到终端应用构建全链路安全与权限闭环。
智算中心不再是只进不出的“成本中心”,而是可计量、可结算、可持续演进的“企业AI生产力中心”。

关键技术

1. 异构资源池化与统一调度
平台以Kubernetes为容器编排底座,通过驱动框架与全局池化技术将散乱的底层硬件拓扑转化为统一、可视、可控的资源池,全面兼容X86与ARM双指令集架构,跨品牌纳管先进算力及国产GPU。调度平台作为“资源大脑”动态维护硬件健康度与水位,结合跨品牌GPU调度与算力切分逻辑,确保大模型推理与微调任务的高并发处理;GPU资源实时监控与工作负载隔离,保证作业互不干扰;支持GPU细粒度切分,针对小参数模型或轻量推理任务实现“按需分配”,避免算力闲置。

2. 算力原动力与资产标准化解耦
架构精髓在于“算力原动力”与“资产标准化”的解耦协同:调度侧只管硬件健康度与水位,模型镜像库负责将模型文件、推理镜像、数据集等算法资产转化为可部署的“标准集装箱”。通过三步式(选模型文件→选推理镜像与GPU算力→提交启动命令)即可拉起推理服务,实现模型服务资产化与全生命周期管理,并支持模型跨硬件迁移——一套封装可在先进算力与国产芯片间平滑运行。

3. PD分离与多路由智能调度
网关层通过解析请求特征实现流量精准调度:负载感知路由按吞吐与请求量加权轮询或最少连接;性能优化路由基于历史性能按模型与输入长度智能匹配,降低尾延迟;PD分离路由将Prompt计算与逐字生成分离到不同类型实例,通过KV Cache共享上下文,大幅提升显存利用率与推理效率。针对国产GPU,系统可按实测数据将短文本路由至显存带宽较低节点、长上下文路由至高性能节点,实现“异构算力,同等体验”。

4. 弹性扩缩容与FinOps
基于PodAutoScaler按实时负载动态调整推理实例副本数,以KV Cache利用率、请求等待数、请求处理数为核心指标,默认每30秒检测一次,设容忍度机制防止抖动;流量低谷自动缩容,将释放的算力让给微调任务或其他业务,实现“不加硬件提算力”的存量挖掘。配套高性能存储分场景策略(纯推理/训推结合分别采用本地硬盘或高速文件系统,保障镜像拉取与checkpoint写入的毫秒级响应)与RDMA超宽网络(消除多机多卡分布式训练的通信延迟),共同支撑内部大模型训练与推理的高效运行。

分享:
新华三官网
联系我们