Full-Stack AI Infrastructure

GPU云、专用集群与基础设施建设运营支持

从单一GPU实例到大规模裸金属集群。以三种服务形态满足客户的各类AI基础设施需求。可用配置和提供条件将单独告知。

Full-Stack AI Infrastructure

您希望实现什么目标?

请选择与您目标最接近的选项,查看相关服务的特点与考量要点。具体配置和职责范围将根据咨询内容逐一整理。

希望小规模开展AI开发或验证

适合希望根据所需时间和使用量灵活使用GPU环境的用户。

公有云GPU

希望搭建专属AI计算环境

适合希望根据处理规模和数据管理需求搭建专用环境的用户。

私有AI集群

希望将AI基础设施的构建与运营交由专业团队负责

适合希望通过托管支持减轻构建、监控和维护负担的用户。

托管AI工厂

即将推出

希望将AI推理能力集成到业务或自有产品中

适合希望借助推理服务支持AI回答生成和文档处理的用户。

Token Factory

希望对比各服务后再做选择?

对比三项服务

服务提供流程

01

需求调研

详细了解客户的AI工作负载、需求和预算。

02

方案设计

设计最优服务形态和基础设施配置,制作详细提案书。

03

导入建设

获批后,专业团队迅速可靠地完成导入和建设。

04

运营优化

上线后持续监控和优化,持续支撑客户的AI基础设施。

Public Cloud
01 / Public Cloud

公有云

面向开发者的按需计算服务。可快速启动Jupyter Notebook和ML环境,采用按量计费模式,支持小规模起步。

  • 快速启动环境 — 快速启动Jupyter Notebook和ML环境,立即开始开发。
  • 按量计费模式 — 灵活的按用量付费体系,降低初始成本。
  • 丰富的GPU选择 — 可从单一实例使用NVIDIA H100、A100、L40S等最新GPU。
  • 开发者友好 — 通过REST API、CLI、Web控制台管理资源,可集成到DevOps工作流。
咨询公有云事宜
Private AI Cluster

800G

InfiniBand

5,000

Max GPU

专用

Bare-Metal

※ 800G InfiniBand及最多5,000个GPU通过合作伙伴设施提供。配置和条件将单独告知。

02 / Private AI Cluster

私有AI集群

面向Tier-1客户的裸金属集群。通过高速网络架构构建大规模GPU集群,在专用环境中实现稳定性能。可用配置和提供条件将单独告知。

高速网络架构

超低延迟、超高带宽网络,优化GPU节点间通信。

大规模GPU集群

提供适用于大规模LLM训练和仿真的GPU集群配置方案。

专用裸金属环境

完全专用环境,不与其他租户共享资源,确保安全性和稳定性。

支持自定义配置

根据客户需求定制网络配置、存储、冷却系统。

咨询私有集群事宜
Managed AI Factory

基础设施配置概要

高速

网络

支持InfiniBand

大规模

GPU规模

裸金属

快速

启动时间

云环境

高可用

可用性

条件单独告知

03 / Managed AI Factory

托管AI工厂

全托管运营服务。bloomax负责建设和运营包含高速网络、NVMe分层存储、Slurm编排的环境,为客户提供专注于AI工作负载的环境。

  • Slurm编排 — 使用行业标准Slurm作业调度器,高效管理大规模HPC工作负载。
  • NVMe分层存储 — 结合高速NVMe SSD和大容量HDD的分层存储,优化I/O性能。
  • 高速网络 — 高带宽网络优化节点间通信,提升训练效率。
  • 全托管运营 — 监控、故障处理、维护全部代劳,客户可专注于AI开发。
咨询托管AI工厂事宜
服务比较

比较三种服务形态

公有云GPU

适用场景

开发、验证、小规模起步

环境形态

按需使用(按量计费)

建设·运营负责范围

客户自行管理

咨询时的确认事项

GPU类型、使用量、使用期限

私有AI集群

适用场景

大规模LLM训练和推理

环境形态

专用(裸金属)

建设·运营负责范围

bloomax支持建设(运营体制单独商议)

咨询时的确认事项

GPU数量、网络需求、安全需求

托管AI工厂

适用场景

AI工作负载的持续运营

环境形态

全托管(详情单独告知)

建设·运营负责范围

bloomax负责建设和运营

咨询时的确认事项

工作负载内容、SLA要求、运营体制

各服务的提供条件、价格和覆盖范围将单独告知。本对比表基于目前公开的信息。

CONSULTATION EXAMPLES

无论处于哪个阶段,均可咨询。

不清楚需要哪种GPU。正在考虑专用环境。想了解可以将多少构建和运营工作委托给外部。bloomax帮助您梳理需求与条件,为您的用途找到合适的AI基础设施方案。即使规格尚未确定,也欢迎随时咨询。

以下为预设咨询示例,并非实际导入案例。提供范围及条件将个别确认。

01

希望使用GPU进行AI开发与验证

适用场景

想开始验证AI模型,但不清楚应选择哪种GPU,也不确定需要多大的计算环境。希望在购买设备之前,先探索云端环境的可行方案。

相关服务:公有云GPU

咨询中梳理的内容

  • 使用的模型与处理内容(训练、推理等)
  • 预计数据量与所需GPU内存估算
  • 使用人数、验证周期、预算
  • 现有开发环境及数据处理条件

探讨的配置与推进方式

以公有云GPU为选项,探讨适合验证内容的环境。在梳理测试目标与评估条件后,为您介绍可用的GPU选项及提供条件。

02

希望建立专属AI计算环境

适用场景

随着AI使用量的增加,正在考虑专用GPU集群。不仅关注性能,还希望综合考虑与现有系统的集成、数据处理方式以及运营体制。

相关服务:私有AI集群

咨询中梳理的内容

  • 运行的AI工作负载与预计处理量
  • 所需GPU配置及未来扩展计划
  • 网络与存储需求
  • 数据存放位置、访问管理及与现有系统的集成
  • 导入时间、预算及内部运营能力

探讨的配置与推进方式

以专用GPU集群为选项,探讨涵盖计算资源、网络与存储的整体配置。明确贵方、bloomax及必要时协作的技术合作伙伴各自的职责范围,并确认导入条件。

03

希望减轻AI基础设施构建与运营的负担

适用场景

希望推进AI开发,但由内部团队负责基础设施构建、监控和维护存在困难。希望明确哪些工作由内部承担、哪些委托外部,并建立可持续运营的体制。

相关服务:托管AI工厂

咨询中梳理的内容

  • 现有设备与系统配置
  • 内部负责人及可承担的工作范围
  • 对监控、维护及故障响应的要求
  • 更新与配置变更的推进方式
  • 运营预算与所需支持范围

探讨的配置与推进方式

以托管AI工厂为选项,探讨构建与运营支持的范围。包括现有设备的可利用性,逐一明确可承担的工作、责任分工、沟通机制及合同条件。

FAQ

咨询前的常见问题

以下整理了关于所需配置、费用考量及导入后运营的常见疑问,供您在咨询前参考。即使规格和条件尚未确定,也欢迎随时咨询。

即使条件尚未确定,也欢迎咨询。

从分享您的用途和课题开始,我们将支持您推进导入方案的研究。

咨询AI基础设施导入事宜