汉得企业级大模型训练与管理平台-灵炼(英文名 H-AI TrainHub,以下简称灵炼),是汉得 AI Factory 融合解决方案的企业级一站式模型训练与管理平台,覆盖数据集管理、精调、推理部署与评测等端到端能力,专注性能与安全保障,全面支撑企业 AI 模型开发与落地。 本文将带您快速掌握灵炼模型部署的推理新能力:在现有 vLLM 推理引擎基础上,集成 NVIDIA NIM 与 NVIDIA Dynamo 推理框架,构建统一、高效且可扩展的推理平台。从镜像维护、模型版本配置,到部署选择、服务监控,再到一键对接灵猿 AI 中台,帮助您为不同业务场景选择最合适的推理方案。 为什么要引入 新的推理能力 做过大模型私有化落地的团队应该都有体会:模型部署这件事,难的从来不是“跑起来”,而是“跑得稳、跑得快、管得住”。同一个模型,换个引擎、换套参数,吞吐和时延可能差出一倍。 在推理侧,灵炼此前一直以 vLLM 作为默认引擎。vLLM 足够优秀,但随着企业 AI 应用从“试点验证”走向“规模化生产”,单一引擎的局限逐渐显现: 💢场景在分化 有的客户追求开箱即用与企业级支持保障,有的客户在多机多卡集群上追求极致吞吐,一把尺子量不了所有场景; 💢算力驱动营收 GPU 算力是企业级AI部署的核心资源,推理方案 每提升一分吞吐,就意味着处理相同工作负载时 所需的 GPU 数量更少 ——方案选择将直接影响 企业拓展营收规模与降低总体拥有成本(TCO)的能力; 💢生态在演进 基于 NVIDIA 构建的推理软件栈(TensorRT-LLM、NIM、Dynamo)持续优化 ,企业需要一条能持续吸纳新推理能力红利的路径,而不是被锁死在某一代方案上。 因此,灵炼此次升级的意义不只是“多了两个选项”,而是让平台具备了多能力栈管理的体系化能力——容器镜像、模型适配、部署选择、参数实践、监控运维一条链路打通。企业只管按场景选用,把“换推理方案”的成本压缩到一次下拉选择。 灵炼模型部署融合 NVIDIA NIM & Dynamo 部署再升级!灵炼模型部署正式接入 NVIDIA NIM 与 NVIDIA Dynamo,形成 vLLM、NIM、Dynamo 三大推理技术协同的架构,进一步提升模型服务的性能、稳定性与运维效率。 推理方案自由选 在现有 vLLM 基础上,新增对 NVIDIA NIM 与 NVIDIA Dynamo 的支持。部署时可根据模型配置按需选择推理方案,通过一套标准化流程实现多种推理技术的统一部署与管理。 镜像有章法 底层配置支持维护通用镜像;针对 NIM 模型专用镜像的特点,支持在模型仓库对应版本上维护 NIM 专用镜像,镜像跟着模型版本走,部署自动带出。 参数不用猜 平台内置各推理方案可配置的内置参数与最佳实践,部署时给出推荐配置,无需从零翻阅引擎文档调参。 监控开箱即用 NIM、Dynamo 服务指标同步支持平台监控,与 vLLM 保持一致的可观测体验。 生态一键贯通 部署完成后支持一键对接灵猿 AI 中台的模型账号维护与模型账号组合配置,推理服务直达上层应用。 认识两位新成员 先看它们所在的大图景 AI Factory 与 NVIDIA AI Enterprise 在正式介绍这两位新成员之前,有必要先理解它们从何而来。 AI Factory(AI工厂) 这是一套软硬件协同设计的完整体系,目标是让企业能够规模化、可持续地把算力高效地“炼”成 AI 生产力——这也正是 AI 推理进入生产环节后,对吞吐、时延与成本提出的现实要求。 要把这座“工厂”真正跑起来,除了底层硬件,还需要一整套经过验证、可长期维护的软件栈,这就是 NVIDIA AI Enterprise。 NVIDIA AI Enterprise 将面向 AI 开发的微服务、框架和库与先进的 GPU 编排和基础设施管理相集成,打造出全面受支持的生产就绪型商业软件套件。助力企业自信部署领先的开源工具和AI模型,提高生产力,加速价值实现,同时以优化的资源利用率大规模运行 AI 工作负载。 可以把 NVIDIA AI Enterprise 理解为 AI Factory 的软件操作系统:AI Factory 描绘了目标形态,NVIDIA AI Enterprise 则提供了让这套体系真正落地运转的标准化软件基座。 而本次要介绍的 NIM 与 Dynamo,正是 AI Factory 软件栈中两个关键组件:一个负责让单个推理服务开箱即用、跑得又快又省心;另一个负责在大规模 GPU 集群上把分布式推理编排到极致。 理解了这层归属关系,再来看它们各自的能力,就更容易把握它们在整个 AI 工厂里所扮演的角色。 NVIDIA NIM 官方预优化的“开箱即用” NVIDIA NIM 是一套易于使用的预构建容器工具,目的是帮助企业客户在云,数据中心和工作站上安全,可靠的部署高性能的 AI 模型推理。 它由 Model-Free NIM,Day0 NIM 和 Refresh NIM 组成 ,它把推理框架(vLLM/SGLang),最小运行时依赖,最佳推理实践统一打包为容器镜像 ,启动即为标准 API 服务。它的价值主要在三点: ✅ 开箱即用:无需自行处理复杂的推理框架部署和配置 ,容器启动时自动匹配当前 GPU 的最优 profile。其中: ○ Model-Free NIM 允许用户以最新的推理框架版本加载任意模型,同时兼顾合规和企业级 feature; ○ Day0 NIM 允许用户在第一时间获取最新的验证过的开箱即用模型; ○ Refresh NIM 允许用户获得对于特定模型的最佳性能。 ✅ 性能有保障:如果用户使用的是 Refresh NIM,底层是深度优化的推理路径,在 NVIDIA GPU 上通常可获得优于通用方案的吞吐与首 Token 时延。同时用户还可针对特定需求生成自定义优化方案,并将其无缝集成到 NIM; ✅ 企业级支持:具备官方的版本维护与安全更新, 没有 高危代码漏洞风险,契合合规要求高的企业客户。 需要注意的是,NIM 镜像是“多层次” 的——每个模型和框架版本对应各自的 NIM 镜像,这对平台的镜像管理能力提出了更高要求,也是灵炼本次在产品设计上重点解决的问题。 NVIDIA Dynamo 数据中心级的分布式推理框架 如果说 NVIDIA NIM 解决的是“单个服务如何跑得又快又省心”,Dynamo 瞄准的则是另一个维度:大规模分布式场景下,GPU 集群如何协同把推理跑到极致。Dynamo 是一个开源的数据中心级分布式推理框架,核心能力包括: ✅ P/D 分离(Disaggregated Serving):将推理的 Prefill(提示词计算)与 Decode(逐 Token 生成)拆到不同 GPU 组分别调度——前者吃算力、后者吃显存带宽,分开后各用其长,在长上下文、高并发场景下集群整体吞吐提升非常可观; ✅ KV Cache 感知路由:智能路由器掌握各节点的 KV Cache 分布,将请求调度到缓存命中率最高的节点,减少大量重复计算; ✅ 多级 KV 缓存管理:KV Cache可在显存、内存、本地盘之间分层流转,用更经济的存储扛住更大的缓存量; ✅ 引擎无关:底层可对接 TensorRT-LLM、vLLM、SGLang 等推理内核,Dynamo 负责上层调度与编排。 如何选择合适的推理方案? 一个务实的选型参考:日常开发验证用 vLLM;NVIDIA GPU 上的标准化高性能生产部署优先 NVIDIA NIM;当业务量大到需要跨节点扩展推理集群时,就是 NVIDIA Dynamo 的主场。 快速入门 - 配置维护 维护推理方案通用镜像 模型部署/配置维护:为各推理方案维护通用镜像。 vLLM、Dynamo 等采用“一个镜像服务所有模型”的通用镜像模式,在配置中统一登记镜像地址与版本,部署时直接引用,镜像升级只需维护一处,不再需要在各个环境里口口相传“该用哪个 tag”。 ◈ 推理方案:vLLM / NVIDIA NIM / NVIDIA Dynamo; ◈ 通用镜像:维护对应的镜像地址与版本,针对 NVIDIA NIM 的渠道类型,平台内置了 Model-Free NIM。 模型仓库 维护 NIM 专用镜像 模型仓库/模型版本:为模型版本维护 NVIDIA NIM 模型专用镜像。 与通用引擎不同,NIM 模型专用镜像与模型一一对应。灵炼将 NIM 专用镜像的维护入口设计在模型仓库的对应模型版本上,镜像与模型版本强绑定,部署时自动带出,如果官方没有发布模型专属 NIM,会默认使用 Model-Free NIM。 在模型版本上配置该版本支持的推理清单。不同模型对推理底层的适配情况不同,通过版本级的配置,部署环节只展示合法选项,从源头避免“用错引擎起不来服务”的低级错误。 模型部署 选择推理方案 模型部署:新建部署任务,选择推理方案。 ◈ 模型及版本:选择目标模型; ◈ 推理方案:从该模型版本配置的方案中选择 vLLM / NVIDIA NIM / NVIDIA Dynamo; ◈ 参数配置:平台预置各引擎默认参数与最佳实践推荐值—— vLLM 的显存利用率与最大序列长度、NVIDIA NIM 的 profile 选择、NVIDIA Dynamo 的分布式拓扑等,均给出参数说明与推荐配置,同时支持关键参数自定义调优。 同一个模型,开发环境用 vLLM 快速验证,生产环境切换NVIDIA NIM 或NVIDIA Dynamo 上强度,切换成本被压缩到一次下拉选择。 服务监控 新技术栈不能是“监控盲区”。部署完成后, NVIDIA NIM 与 NVIDIA Dynamo 服务的运行状态与推理指标已同步接入平台监控,与原有 vLLM 服务保持一致的运维体验,服务健康度、推理指标一目了然,问题快速定位。 一键对接 灵猿 AI 中台 推理服务就绪后,支持一键对接灵猿 AI 中台,自动完成模型账号维护与模型账号组合配置,无需在两个平台间手工复制接入信息,推理服务直达上层 AI 应用,打通从模型部署到应用消费的最后一公里。 推理世界迭代很快,平台的价值不在于押注某一个引擎,而在于把“换推理方案”这件事变得足够便宜。 以上内容主要讲解了灵炼模型部署接入 NVIDIA NIM 与 NVIDIA Dynamo 后的推理方案镜像维护、推理方案选择、部署参数最佳实践、服务监控、灵猿一键对接相关能力——从镜像、参数、监控到上层应用对接的整条链路都是现成的,企业只需按场景选择最合适的推理方案。 更多功能细节可参阅开放平台文档,或随时联系研发团队:openhand@vip.hand-china.com。 未来我们将持续迭代,为您带来更多 AI 模型开发与落地体验,期待与您交流!欢迎在评论区留言,一起探讨 AI 模型推理部署在您业务中的应用潜力~ 携手汉得,共铸硬核竞争力!


