某AI公司弹性算力租赁

弹性算力租赁

解决方案

  • 灵活租赁模式:客户按月签订基础算力合约(保证最低资源),同时支持动态扩容——训练任务启动时,平台自动从资源池中分配所需GPU卡数,训练结束后释放资源,仅按实际使用卡时计费。
  • 专属算力资源池:在西安智算中心为客户划分物理隔离的昇腾算力专区,数据存储、模型训练、推理服务均在专属环境内完成,满足数据安全合规。
  • 全栈运维托管:中软国际提供7×24小时算力监控、驱动升级、故障自动恢复、性能调优服务,客户算法工程师无需关注底层基础设施,直接通过API或Jupyter Notebook调用算力。
  • 模型部署一体化:训练完成后,模型自动打包部署至同一专区的推理服务集群,实现训练-推理无缝衔接。

实施成效

  • 相比同等规模的自购硬件(按3年折旧)或包月租赁,弹性租赁模式下,客户仅在实际训练时付费,月均算力支出从48万元降至17万元。
  • 中软国际提供预置的深度学习框架镜像(PyTorch、TensorFlow、MindSpore)及分布式训练优化,模型迭代周期从1周缩短至4天。
  • 客户无需招聘IT运维人员,算力平台开箱即用,故障平均恢复时间(MTTR)小于30分钟。
  • 客户月活跃调用量从20万次增长至150万次,推理服务可用性保持99.95%以上,从未因算力不足导致服务中断。
  • 某次紧急监管合规检查需在48小时内完成全部历史模型的重新验证,客户一键扩容至200卡集群,任务提前6小时完成。

客户评价

中软国际的弹性算力租赁,让我们可以把所有精力放在模型算法上,而不是折腾显卡驱动和网络调优。没有这套灵活的算力服务,我们不可能在18个月内完成4个大版本的迭代。
架构图