汉得企业级大模型训练与管理平台-灵炼(英文名 H-AI TrainHub,以下简称灵炼),是汉得 AI Factory 融合解决方案的企业级一站式模型训练与管理平台,覆盖数据集管理、精调、推理部署与评测等端到端能力,专注性能与安全保障,全面支撑企业 AI 模型开发与落地。本文将带您快速掌握灵炼模型部署的推理新能力:在现有 vLLM 推理引擎基础上,集成 NVIDIA NIM 与 NVIDIA Dynamo 推理框架,构建统一、高效且可扩展的推理平台。从镜像维护、模型版本配置,到部署选择、服务监控,再到一键对接灵猿 AI 中台,帮助您为不同业务场景选择最合适的推理方案。为什么要引入新的推理能力做过大模型私有化落地的团队应该都有体会:模型部署这件事,难的从来不是“跑起来”,而是“跑得稳、跑得快、管得住”。同一个模型,换个引擎、换套参数,吞吐和时延可能差出一倍。在推理侧,灵炼此前一直以 vLLM 作为默认引擎。vLLM 足够优秀,但随着企业 AI 应用从“试点验证”走向“规模化生产”,单一引擎的局限逐渐显现:💢场景在分化有的客户追求开箱即用与企业级支持保障,有的客户在多机多卡集群上追求极致吞吐,一把尺子量不了所有场景;💢算力驱动营收GPU 算力是企业级AI部署的核心资源,推理方案 每提升一分吞吐,就意味着处理相同工作负载时 所需的 GPU 数量更少 ——方案选择将直接影响 企业拓展营收规模与降低总体拥有成本(TCO)的能力;💢生态在演进基于 NVIDIA 构建的推理软件栈(TensorRT-LLM、NIM、Dynamo)持续优化 ,企业需要一条能持续吸纳新推理能力红利的路径,而不是被锁死在某一代方案上。因此,灵炼此次升级的意义不只是“多了两个选项”,而是让平台具备了多能力栈管理的体系化能力——容器镜像、模型适配、部署选择、参数实践、监控运维一条链路打通。企业只管按场景选用,把“换推理方案”的成本压缩到一次下拉选择。灵炼模型部署融合NVIDIA NIM & Dynamo部署再升级!灵炼模型部署正式接入 NVIDIA NIM 与 NVIDIA Dynamo,形成 vLLM、NIM、Dynamo 三大推理技术协同的架构,进一步提升模型服务的性能、稳定性与运维效率。推理方案自由选在现有 vLLM 基础上,新增对 NVIDIA NIM 与 NVIDIA Dynamo 的支持。部署时可根据模型配置按需选择推理方案,通过一套标准化流程实现多种推理技术的统一部署与管理。镜像有章法底层配置支持维护通用镜像;针对 NIM 模型专用镜像的特点,支持在模型仓库对应版本上维护 NIM 专用镜像,镜像跟着模型版本走,部署自动带出。参数不用猜平台内置各推理方案可配置的内置参数与最佳实践,部署时给出推荐配置,无需从零翻阅引擎文档调参。监控开箱即用NIM、Dynamo 服务指标同步支持平台监控,与 vLLM 保持一致的可观测体验。生态一键贯通部署完成后支持一键对接灵猿 AI 中台的模型账号维护与模型账号组合配置,推理服务直达上层应用。认识两位新成员先看它们所在的大图景AI Factory 与 NVIDIA AI Enterprise在正式介绍这两位新成员之前,有必要先理解它们从何而来。AI Factory(AI工厂)这是一套软硬件协同设计的完整体系,目标是让企业能够规模化、可持续地把算力高效地“炼”成 AI 生产力——这也正是 AI 推理进入生产环节后,对吞吐、时延与成本提出的现实要求。要把这座“工厂”真正跑起来,除了底层硬件,还需要一整套经过验证、可长期维护的软件栈,这就是 NVIDIA AI Enterprise。NVIDIA AI Enterprise将面向 AI 开发的微服务、框架和库与先进的 GPU 编排和基础设施管理相集成,打造出全面受支持的生产就绪型商业软件套件。助力企业自信部署领先的开源工具和AI模型,提高生产力,加速价值实现,同时以优化的资源利用率大规模运行 AI 工作负载。可以把 NVIDIA AI Enterprise 理解为 AI Factory 的软件操作系统:AI Factory 描绘了目标形态,NVIDIA AI Enterprise 则提供了让这套体系真正落地运转的标准化软件基座。而本次要介绍的 NIM 与 Dynamo,正是 AI Factory 软件栈中两个关键组件:一个负责让单个推理服务开箱即用、跑得又快又省心;另一个负责在大规模 GPU 集群上把分布式推理编排到极致。理解了这层归属关系,再来看它们各自的能力,就更容易把握它们在整个 AI 工厂里所扮演的角色。1NVIDIA NIM官方预优化的“开箱即用”NVIDIA NIM 是一套易于使用的预构建容器工具,目的是帮助企业客户在云,数据中心和工作站上安全,可靠的部署高性能的 AI 模型推理。它由 Model-Free NIM,Day0 NIM 和 Refresh NIM 组成 ,它把推理框架(vLLM/SGLang),最小运行时依赖,最佳推理实践统一打包为容器镜像 ,启动即为标准 API 服务。它的价值主要在三点:✅ 开箱即用:无需自行处理复杂的推理框架部署和配置 ,容器启动时自动匹配当前 GPU 的最优 profile。其中:○Model-Free NIM 允许用户以最新的推理框架版本加载任意模型,同时兼顾合规和企业级 feature;○Day0 NIM 允许用户在第一时间获取最新的验证过的开箱即用模型;○Refresh NIM 允许用户获得对于特定模型的最佳性能。✅ 性能有保障:如果用户使用的是 Refresh NIM,底层是深度优化的推理路径,在 NVIDIA GPU 上通常可获得优于通用方案的吞吐与首 Token 时延。同时用户还可针对特定需求生成自定义优化方案,并将其无缝集成到 NIM;✅ 企业级支持:具备官方的版本维护与安全更新, 没有 高危代码漏洞风险,契合合规要求高的企业客户。需要注意的是,NIM 镜像是“多层次” 的——每个模型和框架版本对应各自的 NIM 镜像,这对平台的镜像管理能力提出了更高要求,也是灵炼本次在产品设计上重点解决的问题。2NVIDIA Dynamo数据中心级的分布式推理框架如果说 NVIDIA NIM 解决的是“单个服务如何跑得又快又省心”,Dynamo 瞄准的则是另一个维度:大规模分布式场景下,GPU 集群如何协同把推理跑到极致。Dynamo 是一个开源的数据中心级分布式推理框架,核心能力包括:✅ P/D 分离(Disaggregated Serving):将推理的 Prefill(提示词计算)与 Decode(逐 Token 生成)拆到不同 GPU 组分别调度——前者吃算力、后者吃显存带宽,分开后各用其长,在长上下文、高并发场景下集群整体吞吐提升非常可观;✅ KV Cache 感知路由:智能路由器掌握各节点的 KV Cache 分布,将请求调度到缓存命中率最高的节点,减少大量重复计算;✅ 多级 KV 缓存管理:KV Cache可在显存、内存、本地盘之间分层流转,用更经济的存储扛住更大的缓存量;✅ 引擎无关:底层可对接 TensorRT-LLM、vLLM、SGLang 等推理内核,Dynamo 负责上层调度与编排。如何选择合适的推理方案?一个务实的选型参考:日常开发验证用 vLLM;NVIDIA GPU 上的标准化高性能生产部署优先 NVIDIA NIM;当业务量大到需要跨节点扩展推理集群时,就是 NVIDIA Dynamo 的主场。快速入门 - 配置维护维护推理方案通用镜像模型部署/配置维护:为各推理方案维护通用镜像。vLLM、Dynamo 等采用“一个镜像服务所有模型”的通用镜像模式,在配置中统一登记镜像地址与版本,部署时直接引用,镜像升级只需维护一处,不再需要在各个环境里口口相传“该用哪个 tag”。◈ 推理方案:vLLM / NVIDIA NIM / NVIDIA Dynamo;◈ 通用镜像:维护对应的镜像地址与版本,针对 NVIDIA NIM 的渠道类型,平台内置了 Model-Free NIM。模型仓库维护 NIM 专用镜像模型仓库/模型版本:为模型版本维护 NVIDIA NIM 模型专用镜像。与通用引擎不同,NIM 模型专用镜像与模型一一对应。灵炼将 NIM 专用镜像的维护入口设计在模型仓库的对应模型版本上,镜像与模型版本强绑定,部署时自动带出,如果官方没有发布模型专属 NIM,会默认使用 Model-Free NIM。在模型版本上配置该版本支持的推理清单。不同模型对推理底层的适配情况不同,通过版本级的配置,部署环节只展示合法选项,从源头避免“用错引擎起不来服务”的低级错误。模型部署选择推理方案模型部署:新建部署任务,选择推理方案。◈ 模型及版本:选择目标模型;◈ 推理方案:从该模型版本配置的方案中选择 vLLM / NVIDIA NIM / NVIDIA Dynamo;◈ 参数配置:平台预置各引擎默认参数与最佳实践推荐值—— vLLM 的显存利用率与最大序列长度、NVIDIA NIM 的 profile 选择、NVIDIA Dynamo 的分布式拓扑等,均给出参数说明与推荐配置,同时支持关键参数自定义调优。同一个模型,开发环境用 vLLM 快速验证,生产环境切换NVIDIA NIM 或NVIDIA Dynamo 上强度,切换成本被压缩到一次下拉选择。服务监控新技术栈不能是“监控盲区”。部署完成后, NVIDIA NIM 与 NVIDIA Dynamo 服务的运行状态与推理指标已同步接入平台监控,与原有 vLLM 服务保持一致的运维体验,服务健康度、推理指标一目了然,问题快速定位。一键对接灵猿 AI 中台推理服务就绪后,支持一键对接灵猿 AI 中台,自动完成模型账号维护与模型账号组合配置,无需在两个平台间手工复制接入信息,推理服务直达上层 AI 应用,打通从模型部署到应用消费的最后一公里。推理世界迭代很快,平台的价值不在于押注某一个引擎,而在于把“换推理方案”这件事变得足够便宜。以上内容主要讲解了灵炼模型部署接入 NVIDIA NIM 与 NVIDIA Dynamo 后的推理方案镜像维护、推理方案选择、部署参数最佳实践、服务监控、灵猿一键对接相关能力——从镜像、参数、监控到上层应用对接的整条链路都是现成的,企业只需按场景选择最合适的推理方案。更多功能细节可参阅开放平台文档,或随时联系研发团队:openhand@vip.hand-china.com。未来我们将持续迭代,为您带来更多 AI 模型开发与落地体验,期待与您交流!欢迎在评论区留言,一起探讨 AI 模型推理部署在您业务中的应用潜力~携手汉得,共铸硬核竞争力!
从企业应用到 AI 基础设施底座汉得以「得·灵」体系为基础携手矩阵起源打通企业 AI 智能化升级的“最后一公里”近日,上海汉得信息技术股份有限公司(以下简称汉得)参与投资的基金,参与了企业级 AI 基础设施厂商矩阵起源(MatrixOrigin)的 A 轮融资。本轮融资金额超千万美元,由汉得参与投资的基金、算力基础设施综合服务商亚康股份与澳大利亚风险投资机构 Artesian VC 共同注资。本次投资完成后,汉得与矩阵起源将进一步探讨在业务层面依托各自优势深度生态协同,使得汉得在 AI 领域的整体能力进一步向 AI 基础设施层延伸——从企业应用生态到 AI 基础设施底座,以构建更加完整的企业级 AI 解决方案能力。具体合作意向在进一步协商探讨中,若有进展公司将在指定媒体披露相关公告,敬请关注!随着 AI 在企业侧从单点应用向业务深度融合演进,我们敏锐洞察到:企业 AI 落地的真正瓶颈,不在于模型能力本身,而在于统一的 AI 平台工具、数据、AI 智能体、与企业现有业务流程和业务系统融合。汉得“得·灵”企业级 AI 产品和服务体系,涵盖灵猿 AI 中台、灵手业务智能体、灵睿垂直模型、灵炼大模型训练平台及灵策配套服务,已在多家头部企业成功落地。然而,在企业 AI 走向规模化、智能体加速进入生产环境的过程中,底层基础设施的统一性与开放性成为决定 AI 能否真正融入业务运行的关键变量。矩阵起源自主研发的 MatrixOne Intelligence 平台,基于 AI-Native 架构,将 HTAP、数据湖、元数据管理、AI 服务与智能体运行时(Agent Runtime)深度融合于同一平台,恰好填补了企业 AI 基础设施层的关键空白。汉得与矩阵起源的协同价值,体现在“自上而下”与“自下而上”的双向赋能:自上而下,场景牵引汉得凭借近三十年积累的深厚行业 Know-how 和数千家企业客户的真实业务场景,为 MatrixOne Intelligence 平台提供来自一线的需求牵引。汉得“得·灵”体系中丰富的业务智能体应用经验,能够帮助矩阵起源更精准地对接企业实际需求,加速产品在制造、金融、物流、财务、电信、快消品等行业的规模化落地。自下而上,底座支撑矩阵起源的 MatrixOne Intelligence 平台,为汉得的 AI 应用体系提供统一的数据与 AI 基础设施底座。传统架构下,企业推进 AI 应用需分别部署数据库、数据平台、AI 平台与智能体系统,四套系统各自独立运维,成本与复杂度居高不下。矩阵起源 MatrixOne Intelligence 将上述能力收敛至同一平台,与汉得的“得·灵”体系形成“基础设施+应用”的完整闭环,大幅降低企业 AI 建设门槛,帮助企业构建可信、安全、可治理且可持续演进的 AI 能力体系。汉得 COO 黄耿表示:“企业级 AI 正在从‘单点尝试’迈向‘智能化升级规模化落地’的关键拐点。汉得长期服务于企业数智化转型一线,我们深刻认识到企业级的智能化升级是需要算力、模型、数据、平台工具、智能体应用与企业的业务流程和业务系统融合的系统工程。基于汉得在 AI 能力构建上的整体战略布局,将‘得·灵’体系多年积累的行业洞察和服务能力、AI 应用产品和解决方案,与矩阵起源的数据底层技术能力深度融合后,可逐步构建从 AI 基础设施到 AI 应用的全栈解决方案,帮助客户构建 AI 时代的核心竞争力。”当前,全球企业软件市场正加速向 AI-Native 转型。Databricks、Snowflake、Palantir 等海外头部厂商相继强化自身的 AI 基础设施能力,企业级 AI 基础设施有望成为继云计算、大数据之后的新一代基础软件市场。随着智能体加速进入企业生产环境,企业 AI 的竞争焦点正从单一模型能力,转向数据、智能体、AI 基础设施底座的统一运行平台。汉得与矩阵起源将进一步探讨在业务层面依托各自优势深度生态协同。汉得将依托矩阵起源的技术底座,进一步丰富“得·灵” AI 产品体系的应用场景与底层支撑能力;矩阵起源则将借助汉得庞大的客户资源和行业经验,加速 MatrixOne Intelligence 在企业场景中的规模化落地。汉得与矩阵起源的联手,将为企业级 AI 基础设施赛道注入新的活力,助力更多企业构建可信、安全、可治理且可持续演进的 AI 能力体系。矩阵起源(MatrixOrigin)矩阵起源(MatrixOrigin)成立于2021年,是一家专注于企业级 AI 基础设施的创新科技公司,致力于构建统一的数据、AI 与智能体基础设施。公司自主研发的 MatrixOne Intelligence 是一体化 AI-Native 基础设施平台,融合统一数据平台、AI 服务、智能体运行时及企业级治理能力,为企业提供可信、安全、可持续演进的 AI 基础设施底座。目前,产品已在制造、金融、物流、财务、电信、快消品、互联网、半导体等行业实现规模化落地,累计服务企业客户超过100家。汉得信息上海汉得信息技术股份有限公司(300170.SZ)成立于2002年,是国内领先的企业级数智化产品和解决方案综合提供商。公司基于自主企业级 PaaS 平台 H-ZERO,构建了覆盖产业数字化与财务数字化的完整自主产品体系,并推出“得·灵”企业级 AI 产品和服务体系,涵盖 AI 中台、业务智能体、垂直模型、大模型训练平台及配套咨询服务。目前,汉得信息累计服务超过8000家行业头部客户,AI 应用落地覆盖制造、营销、财务、供应链、人事等全业务领域,致力于帮助企业实现从数字化到智能化的跨越。携手汉得,共铸硬核竞争力!