build.nvidia.com 把 100+ 开源大模型托管在英伟达自己的 GPU 上,免费给你 OpenAI 兼容的推理 API——不用买卡、不用信用卡,Agent 直接就能调
由 网络精灵 整理 · 2026-08-25 · AI 导航原创资料 · 基于 NVIDIA 官方 FAQ 与 2026 年第三方盘点核校
NVIDIA NIM(NVIDIA Inference Microservices,英伟达推理微服务)是英伟达在 build.nvidia.com 上提供的模型托管与推理服务。它把 100+ 个开源 / 开放权重模型(Llama、DeepSeek、Qwen、Nemotron、Mistral、GPT-OSS 等)部署在英伟达自己的 GPU 集群上,对外暴露一个 OpenAI 兼容 的 Chat Completions API。
你不用自己买卡、不用管推理优化,直接换 base_url 就能用上这些大模型——这正是它和 Groq、Cloudflare Workers AI 同属"免费算力"赛道的原因。
base_url 即可迁移,无需重写。需 手机验证(一次性)。API Key 以 nvapi- 开头,约 56 字符,只显示一次,务必存好(走环境变量,别硬编码进代码)。
build.nvidia.com/settings/api-keys 生成 API Key,仅显示一次,存好。build.nvidia.com/models 按 "Free Endpoint" 筛选,每个模型页给出现成代码片段和准确 model ID。base_url 即可(见第六章代码)。| 模型 | 特点 |
|---|---|
nvidia/nemotron-3-ultra-550b-a55b | 混合 Mamba-Transformer MoE,1M 上下文,agentic 推理 / 编码 / 规划 / 工具调用 |
nvidia/nemotron-3-super-120b | 企业级 agentic 专用,函数调用强 |
nvidia/nemotron-3.5-lightning-30b-a3b | 最快 30B A3B MoE,agentic 任务精度领先 |
nvidia/nemotron-3-embed-1b | 1B embedding 模型,语义检索 / RAG 用 |
| 厂商 | 代表模型 | 备注 |
|---|---|---|
| Meta | Llama 4 Scout/Maverick、Llama 3.3 70B、Llama 3.2 系列 | 含视觉版 |
| DeepSeek | DeepSeek V4 Flash(1M 上下文)、V4、R1、V3.1 | 编码 / agent 强 |
| Qwen | Qwen3 Coder 480B(256K 上下文)、Qwen3.5 122B/397B | 编码专用 |
| OpenAI | GPT-OSS 20B / 120B | 开放权重 |
| Gemma 4 31B、Gemma 3 | 开源 | |
| Mistral | Mistral Small、Mistral Nemotron | 函数调用好 |
| MiniMax | MiniMax M2.7(230B MoE) | 平台最热免费 coding 模型 |
| Z.ai | GLM-5.2 | agentic / 编码 |
| Kimi | kimi-k2.6 | 长上下文 |
| 其他 | Poolside laguna-xs、muse-glimmer-30b、Step、GLM 等 | — |
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key="nvapi-YOUR_KEY", # 走环境变量,别硬编码
)
resp = client.chat.completions.create(
model="minimax/minimax-m2.7", # 换成任意 NIM 模型 ID
messages=[{"role":"user","content":"用 Python 写个反转字符串的函数"}],
max_tokens=512,
stream=True, # 兼容流式输出
)
for chunk in resp:
print(chunk.choices[0].delta.content or "", end="")
curl https://integrate.api.nvidia.com/v1/chat/completions \
-H "Authorization: Bearer nvapi-YOUR_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"minimax/minimax-m2.7","messages":[{"role":"user","content":"Hello"}]}'
model 参数——每个模型页给的 model ID 就是这里要填的值。若免费档限速不够,可下载 NIM 容器跑在自己 GPU / 云(AWS、Azure、GCP、OCI、Brev)上,API 与云端完全一致,零代码改动:
# 拉取并运行(以 gpt-oss-120b 为例)
docker pull nvcr.io/nim/openai/gpt-oss-120b:latest
docker run -it --gpus all -p 8000:8000 nvcr.io/nim/openai/gpt-oss-120b:latest
# 调用本地端点,参数结构同云端
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"openai/gpt-oss-120b","messages":[{"role":"user","content":"Hello"}]}'
| 平台 | 免费额度 | 限速 | 信用卡 | 特点 |
|---|---|---|---|---|
| NVIDIA NIM | 无 token 计费 | ~40 RPM 全局 | 不需要 | 模型最多(100+)、OpenAI 兼容、可自托管 |
| Groq | 每日 token 上限 | 30 RPM | 不需要 | 速度最快(500–1000 TPS) |
| Cloudflare Workers AI | 1 万 Neurons/天 | — | 不需要 | 边缘低延迟 |
| Google Gemini | 免费档有限 | — | 不需要 | 原生多模态 |
NIM 是 OpenAI 兼容端点,正好能当 dsh、Claude Code、Codex、Cline 等 Agent 框架的免费后端。等于给《AI Agent 学习路线》里"Agent 怎么低成本跑起来"补了一个真实可用的免费算力来源——尤其适合学生、个人开发者、初创做原型。
base_url=https://integrate.api.nvidia.com/v1 + nvapi- key,Agent 就能直接调 Nemotron / DeepSeek / Qwen 等。nemotron-3-embed-1b 做向量化(与《什么是 CLI》里"工具入口"思路一致)。build.nvidia.com 注册到 base_url 一行切换,最快 5 分钟跑通第一条调用。