handlogo
中国图标
汉得 AI Factory 融合方案|灵炼模型部署融合 NVIDIA NIM & Dynamo!

汉得企业级大模型训练与管理平台-灵炼(英文名 H-AI TrainHub,以下简称灵炼),是汉得 AI Factory 融合解决方案的企业级一站式模型训练与管理平台,覆盖数据集管理、精调、推理部署与评测等端到端能力,专注性能与安全保障,全面支撑企业 AI 模型开发与落地。


本文将带您快速掌握灵炼模型部署的推理新能力:在现有 vLLM 推理引擎基础上,集成 NVIDIA NIM 与 NVIDIA Dynamo 推理框架,构建统一、高效且可扩展的推理平台。从镜像维护、模型版本配置,到部署选择、服务监控,再到一键对接灵猿 AI 中台,帮助您为不同业务场景选择最合适的推理方案。

为什么要引入

新的推理能力

做过大模型私有化落地的团队应该都有体会:模型部署这件事,难的从来不是“跑起来”,而是“跑得稳、跑得快、管得住”。同一个模型,换个引擎、换套参数,吞吐和时延可能差出一倍。


在推理侧,灵炼此前一直以 vLLM 作为默认引擎。vLLM 足够优秀,但随着企业 AI 应用从“试点验证”走向“规模化生产”,单一引擎的局限逐渐显现:

💢场景在分化

有的客户追求开箱即用与企业级支持保障,有的客户在多机多卡集群上追求极致吞吐,一把尺子量不了所有场景;

💢算力驱动营收

GPU 算力是企业级AI部署的核心资源,推理方案 每提升一分吞吐,就意味着处理相同工作负载时 所需的 GPU 数量更少 ——方案选择将直接影响 企业拓展营收规模与降低总体拥有成本(TCO)的能力;

💢生态在演进

基于 NVIDIA 构建的推理软件栈(TensorRT-LLM、NIM、Dynamo)持续优化 ,企业需要一条能持续吸纳新推理能力红利的路径,而不是被锁死在某一代方案上。

因此,灵炼此次升级的意义不只是“多了两个选项”,而是让平台具备了多能力栈管理的体系化能力——容器镜像、模型适配、部署选择、参数实践、监控运维一条链路打通。企业只管按场景选用,把“换推理方案”的成本压缩到一次下拉选择。

灵炼模型部署融合

NVIDIA NIM & Dynamo

部署再升级!灵炼模型部署正式接入 NVIDIA NIM 与 NVIDIA Dynamo,形成 vLLM、NIM、Dynamo 三大推理技术协同的架构,进一步提升模型服务的性能、稳定性与运维效率。

推理方案自由选

在现有 vLLM 基础上,新增对 NVIDIA NIM 与 NVIDIA Dynamo 的支持。部署时可根据模型配置按需选择推理方案,通过一套标准化流程实现多种推理技术的统一部署与管理。

镜像有章法

底层配置支持维护通用镜像;针对 NIM 模型专用镜像的特点,支持在模型仓库对应版本上维护 NIM 专用镜像,镜像跟着模型版本走,部署自动带出。

参数不用猜

平台内置各推理方案可配置的内置参数与最佳实践,部署时给出推荐配置,无需从零翻阅引擎文档调参。

监控开箱即用

NIM、Dynamo 服务指标同步支持平台监控,与  vLLM 保持一致的可观测体验。

生态一键贯通

部署完成后支持一键对接灵猿 AI 中台的模型账号维护与模型账号组合配置,推理服务直达上层应用。

认识两位新成员

先看它们所在的大图景

AI Factory 与 NVIDIA AI Enterprise

在正式介绍这两位新成员之前,有必要先理解它们从何而来。

AI  Factory(AI工厂)

这是一套软硬件协同设计的完整体系,目标是让企业能够规模化、可持续地把算力高效地“炼”成  AI 生产力——这也正是 AI 推理进入生产环节后,对吞吐、时延与成本提出的现实要求。


要把这座“工厂”真正跑起来,除了底层硬件,还需要一整套经过验证、可长期维护的软件栈,这就是 NVIDIA AI Enterprise。

NVIDIA AI Enterprise

将面向 AI 开发的微服务、框架和库与先进的  GPU 编排和基础设施管理相集成,打造出全面受支持的生产就绪型商业软件套件。助力企业自信部署领先的开源工具和AI模型,提高生产力,加速价值实现,同时以优化的资源利用率大规模运行 AI 工作负载。


可以把 NVIDIA AI Enterprise 理解为 AI Factory 的软件操作系统:AI Factory 描绘了目标形态,NVIDIA AI Enterprise 则提供了让这套体系真正落地运转的标准化软件基座。


而本次要介绍的 NIM 与 Dynamo,正是 AI Factory 软件栈中两个关键组件:一个负责让单个推理服务开箱即用、跑得又快又省心;另一个负责在大规模 GPU 集群上把分布式推理编排到极致。


理解了这层归属关系,再来看它们各自的能力,就更容易把握它们在整个 AI 工厂里所扮演的角色。

1

NVIDIA NIM


官方预优化的“开箱即用”

NVIDIA NIM 是一套易于使用的预构建容器工具,目的是帮助企业客户在云,数据中心和工作站上安全,可靠的部署高性能的 AI 模型推理。


它由 Model-Free NIM,Day0 NIM 和 Refresh NIM 组成 ,它把推理框架(vLLM/SGLang),最小运行时依赖,最佳推理实践统一打包为容器镜像 ,启动即为标准 API 服务。它的价值主要在三点:

开箱即用:无需自行处理复杂的推理框架部署和配置 ,容器启动时自动匹配当前 GPU 的最优 profile。其中:

Model-Free NIM 允许用户以最新的推理框架版本加载任意模型,同时兼顾合规和企业级 feature;

Day0 NIM 允许用户在第一时间获取最新的验证过的开箱即用模型;

Refresh NIM 允许用户获得对于特定模型的最佳性能。

性能有保障:如果用户使用的是 Refresh NIM,底层是深度优化的推理路径,在 NVIDIA GPU 上通常可获得优于通用方案的吞吐与首 Token 时延。同时用户还可针对特定需求生成自定义优化方案,并将其无缝集成到 NIM;

企业级支持:具备官方的版本维护与安全更新, 没有 高危代码漏洞风险,契合合规要求高的企业客户。

需要注意的是,NIM 镜像是“多层次” 的——每个模型和框架版本对应各自的 NIM 镜像,这对平台的镜像管理能力提出了更高要求,也是灵炼本次在产品设计上重点解决的问题。

2

NVIDIA Dynamo


数据中心级的分布式推理框架

如果说 NVIDIA NIM 解决的是“单个服务如何跑得又快又省心”,Dynamo 瞄准的则是另一个维度:大规模分布式场景下,GPU 集群如何协同把推理跑到极致。Dynamo 是一个开源的数据中心级分布式推理框架,核心能力包括:

P/D 分离(Disaggregated Serving):将推理的 Prefill(提示词计算)与 Decode(逐 Token 生成)拆到不同 GPU 组分别调度——前者吃算力、后者吃显存带宽,分开后各用其长,在长上下文、高并发场景下集群整体吞吐提升非常可观;

KV Cache 感知路由:智能路由器掌握各节点的 KV Cache 分布,将请求调度到缓存命中率最高的节点,减少大量重复计算;

多级 KV 缓存管理:KV Cache可在显存、内存、本地盘之间分层流转,用更经济的存储扛住更大的缓存量;

引擎无关:底层可对接 TensorRT-LLM、vLLM、SGLang 等推理内核,Dynamo 负责上层调度与编排。

如何选择合适的推理方案?

一个务实的选型参考:日常开发验证用 vLLM;NVIDIA GPU 上的标准化高性能生产部署优先  NVIDIA NIM;当业务量大到需要跨节点扩展推理集群时,就是 NVIDIA Dynamo 的主场。

快速入门 - 配置维护

维护推理方案通用镜像

模型部署/配置维护:为各推理方案维护通用镜像。


vLLM、Dynamo 等采用“一个镜像服务所有模型”的通用镜像模式,在配置中统一登记镜像地址与版本,部署时直接引用,镜像升级只需维护一处,不再需要在各个环境里口口相传“该用哪个 tag”。

推理方案:vLLM / NVIDIA NIM / NVIDIA Dynamo;

通用镜像:维护对应的镜像地址与版本,针对 NVIDIA NIM 的渠道类型,平台内置了 Model-Free NIM。

模型仓库

维护 NIM 专用镜像

模型仓库/模型版本:为模型版本维护 NVIDIA NIM 模型专用镜像。


与通用引擎不同,NIM 模型专用镜像与模型一一对应。灵炼将 NIM 专用镜像的维护入口设计在模型仓库的对应模型版本上,镜像与模型版本强绑定,部署时自动带出,如果官方没有发布模型专属 NIM,会默认使用 Model-Free NIM。


在模型版本上配置该版本支持的推理清单。不同模型对推理底层的适配情况不同,通过版本级的配置,部署环节只展示合法选项,从源头避免“用错引擎起不来服务”的低级错误。

模型部署

选择推理方案

模型部署:新建部署任务,选择推理方案。

模型及版本:选择目标模型;

推理方案:从该模型版本配置的方案中选择  vLLM / NVIDIA NIM / NVIDIA Dynamo;

参数配置:平台预置各引擎默认参数与最佳实践推荐值—— vLLM 的显存利用率与最大序列长度、NVIDIA NIM 的 profile 选择、NVIDIA Dynamo 的分布式拓扑等,均给出参数说明与推荐配置,同时支持关键参数自定义调优。

同一个模型,开发环境用 vLLM 快速验证,生产环境切换NVIDIA NIM 或NVIDIA Dynamo 上强度,切换成本被压缩到一次下拉选择。

服务监控

新技术栈不能是“监控盲区”。部署完成后, NVIDIA NIM 与 NVIDIA Dynamo 服务的运行状态与推理指标已同步接入平台监控,与原有 vLLM 服务保持一致的运维体验,服务健康度、推理指标一目了然,问题快速定位。

一键对接

灵猿 AI 中台

推理服务就绪后,支持一键对接灵猿 AI 中台,自动完成模型账号维护与模型账号组合配置,无需在两个平台间手工复制接入信息,推理服务直达上层 AI 应用,打通从模型部署到应用消费的最后一公里。

推理世界迭代很快,平台的价值不在于押注某一个引擎,而在于把“换推理方案”这件事变得足够便宜。


以上内容主要讲解了灵炼模型部署接入 NVIDIA NIM 与 NVIDIA Dynamo 后的推理方案镜像维护、推理方案选择、部署参数最佳实践、服务监控、灵猿一键对接相关能力——从镜像、参数、监控到上层应用对接的整条链路都是现成的,企业只需按场景选择最合适的推理方案。


更多功能细节可参阅开放平台文档,或随时联系研发团队:openhand@vip.hand-china.com


未来我们将持续迭代,为您带来更多 AI 模型开发与落地体验,期待与您交流!欢迎在评论区留言,一起探讨 AI 模型推理部署在您业务中的应用潜力~

携手汉得,共铸硬核竞争力!


热点

汉得 x SKG|主数据治理项目启动,为AI领航铺路,为高效运营筑基!

汉得产品出海|HiFins汉得智慧财务套件帮助香港综合能源服务客户,构建全球化财务运营统一电子会计档案!

汉得 x 京新药业|共建企业级 AI 智能体平台,共拓医药行业智能化升级!

© Copyright Hand China Co.,Ltd. All Rights Reserved 上海汉得信息技术股份有限公司

业务咨询

完善信息后我们会第一时间跟您联系
*
*
*
*
*请输入正确的验证码
captcha
*
*
发送失败
立即咨询
咨询热线
业务咨询
微信扫码 在线咨询 微信咨询二维码
联系我们
400-168-4263
业务咨询
完善信息后我们会第一时间跟您联系