AREX Feed Article
NVIDIA 发布 TensorRT Model Connect 公开预览:两条命令免 ONNX 直达 C++ 推理
8 月 18 日(UTC),在 X 上宣布 TensorRT Model Connect(TRTMC)进入公开预览。这是一个 :受支持的 Hugging Face 或本地检查点,用 trtmc build 和 trtmc run 两条命令就能端到端变成 TensorRT 推理,中间没有 ONNX 导出步骤;构建产物是带版本号的 .bundle 工件,通过原生 C++ 任务 API 执行,运行路径上不再有 PyTorch。了同一消息。
NVIDIA 还在公告里披露:整个项目(模型实现、性能调优、测试、集成和文档)都由 OpenAI Codex 智能体在人工指导和审查下完成。官方 7 月 29 日的 GB300 性能快照覆盖 76 个模型家族共 105 个配置文件,其中 102 个比声明的参考基线快 5% 以上(据 MarkTechPost 对官方矩阵的归纳)。
两条命令,从检查点到 .bundle
MarkTechPost 给出的快速开始以 Qwen3-0.6B 为例:
trtmc build Qwen/Qwen3-0.6B --precision bf16 --max-cache-length 16384 --output qwen3-0.6b.bundletrtmc run ./qwen3-0.6b.bundle --prompt "What is the capital of France? Answer in one word." --chat-template --no-thinking同一个 .bundle 在 C++ 里用 trtmc::load("./qwen3-0.6b.bundle") 加载,随后调用任务 API(generate()、transcribe()、generate_image()、embed()、solve()),不需要为每个模型维护转换流程和应用胶水代码。trtmc inspect 能读出 bundle 的种类、模型家族、精度、运行时身份和引擎信息,工件可审计而不是黑盒。
分工上,Python 负责检查点解析和 TensorRT 引擎构建,原生 profile 在 C++ 中执行推理;少数混合 profile 会调用一个辅助 Python 可执行文件,其 manifest 显式声明这一依赖。按 MarkTechPost 的报道,NVIDIA 把传统路线概括为 PyTorch → ONNX 或 TorchScript → TensorRT → 模型专属 C++ 集成,并列出它消除的失败模式:导出缺口、反复的逐模型集成、验证分散在多个转换工件之间。按 MarkTechPost 的概括,项目以「模型家族各自持有」的参考实现集合交付;仓库 README 进一步说明,每个家族的 builder、运行时 pipeline、辅助 kernel 和验证契约都作为用户修改与定制的具体蓝本。
105 个配置文件、76 个模型家族,支持精确到修订版本
显示,2026 年 7 月 29 日完成的 GB300 发布对比(源码修订 508613d0bcc7003b123cf5be3d1b3f6e6c6cb667)覆盖 105 个单进程 release profile、76 个模型家族,分布式与 L0 smoke profile 不在矩阵内。矩阵用灯色标注性能:绿色表示比参考快 5% 以上,黄色在 5% 以内,红色慢 5% 以上;infer-p50 不计入 bundle 准备、模型加载、编译(如使用)和预热时间。
矩阵里的家族横跨多种任务:Qwen3 系列文本生成、Whisper 语音识别、FLUX.2 与 Wan 的图像视频生成、DeepSeek-OCR 文档解析、SAM3 分割、Chronos-Bolt 与 PatchTST 时序预测等。支持声明精确到具体检查点和修订版本:一行只对精确的 hf_id、检查点解析方式、TRTMC profile 和构建配置成立;未固定修订版本的 recipe,官方明确说不构成精确版本支持声明。
Linux aarch64 之外,x86_64 只能源码构建
MarkTechPost 把「是否可部署」作为首要问题回答:可以,但有真实条件。发布 wheel 目前只面向 Linux aarch64,要求 Python 3.10 或 3.12、glibc 2.39 及以上、TensorRT 11.1.0.106;x86_64 没有发布 wheel,用户只能走 Docker 源码构建路径。
它最贴合已经自持推理栈的团队:NVIDIA 生态创业公司、机器人与设备厂商、中大型企业的平台和推理团队;只跑 Python 服务的小团队获益有限,受监管行业的企业应等 tagged release 再标准化。官方列出的适用行业包括机器人与自主机器、工业检测制造、车载计算、医疗设备、国防航天边缘系统、媒体处理,也就是推理必须活在 C++ 二进制里而不是 Python 服务器里的场景。
仓库 README 同时划清了与 TensorRT Edge-LLM 的边界:TRTMC 用于快速探索模型、评估覆盖面;在 NVIDIA 边缘平台上做生产级 LLM/VLM 部署且性能优先时,直接使用 TensorRT Edge-LLM。项目自我定位为参考实现,用户需对自己提供的检查点、bundle、原生库和环境负责。
用 Codex 智能体写出来的 TensorRT 项目
「我们整个项目都是用 OpenAI Codex 智能体构建的,人类负责指导和审查。这包括模型实现、性能调优、测试、集成和文档。」(原文:"We also built the entire project with @OpenAIDevs Codex agents, with humans directing and reviewing the work. That includes model implementations, performance tuning, tests, integrations, and docs.")NVIDIA AI 在公告推文里写道。仓库的自我描述是「由 agentic workflow 驱动,持续为即将到来的模型添加支持,大幅减少用户的集成工作量和模型兼容所需的时间」。
这份说法在仓库里有配套的实践:README 把「AI-Native」列为推荐快速开始路径,让用户给一个带终端、Docker 和 NVIDIA GPU 的编码智能体一段目标提示词,由它读 AGENTS.md 后严格按文档完成构建、测试并汇报结果;仓库还设有专门的 AI & Agent Guide。GitHub 元数据显示仓库创建于 2026 年 4 月 20 日,公开预览公告在约四个月后发出。
TVM-FFI 与「谁先跑通 Qwen3 示例」
XGBoost 与 Apache TVM 的创建者、卡内基梅隆大学副教授兼 NVIDIA 杰出工程师 Tianqi Chen(身份据其 X 账号简介)在公告当天发了一条指向「自带 kernel」的评论:「这次 TensorRT 发布里让我特别兴奋的一点,是对 TVM-FFI 的一流支持,可以借此把自定义 DSL 和智能体生成的 kernel 带进 TensorRT 推理。」(原文:"One thing that I am really excited about this TensorRT release is the first-class support for TVM-FFI, so we can bring custom DSL and agent generated kernels to TensorRT inference.")他链接的展示了把 Qwen3-8B 计算图的一部分替换成 TVM-FFI kernel、以及把 FlashInfer 等 CUDA DSL kernel 经 TVM-FFI 绑定进 bundle 的完整流程,教程称只要 ABI 匹配,「无需修改 Model Connect 本身」。这条截至本文写作时获得 48 次点赞、7 次转发。
截至本文写作时(公告发布约 11 小时后),NVIDIA AI 的推文累计 428 次点赞、55 次转发、12 条引用推文和约 7.1 万次查看。社区账号 GGUFzy 则把问题抛回给动手的人:「105 个 release profile、76 个模型家族,支持精确到检查点加修订版本。谁第一个跑通 Qwen3 0.6B 示例?」(原文:"NVIDIA dropped TensorRT Model Connect in public preview. 105 release profiles across 76 families and support is the exact checkpoint plus revision. Who is running the Qwen3 0.6B sample first?")发布于公告后约 14 分钟。