🟩 英伟达 NVIDIA NIM 免费大模型 API 完整指南

build.nvidia.com 把 100+ 开源大模型托管在英伟达自己的 GPU 上,免费给你 OpenAI 兼容的推理 API——不用买卡、不用信用卡,Agent 直接就能调

由 网络精灵 整理 · 2026-08-25 · AI 导航原创资料 · 基于 NVIDIA 官方 FAQ 与 2026 年第三方盘点核校

📑 目录

  1. 平台是什么:NVIDIA NIM / build.nvidia.com
  2. 免费政策(关键数字与口径)
  3. 怎么开始:注册到调用的 5 步
  4. 模型清单:2026-08 在线代表
  5. 限速与坑(必读)
  6. 接入代码:OpenAI 兼容一行切换
  7. 自托管选项:无限速的 NIM 容器
  8. 与其他免费平台对比
  9. 跟你站点的关系:接进 dsh / Agent 路线
100+
免费开源模型
40
RPM 限速(全局)
0
信用卡要求
OpenAI
接口完全兼容
NVIDIA
自研 Nemotron 3

1平台是什么:NVIDIA NIM / build.nvidia.com

1.1 一句话定义

NVIDIA NIM(NVIDIA Inference Microservices,英伟达推理微服务)是英伟达在 build.nvidia.com 上提供的模型托管与推理服务。它把 100+ 个开源 / 开放权重模型(Llama、DeepSeek、Qwen、Nemotron、Mistral、GPT-OSS 等)部署在英伟达自己的 GPU 集群上,对外暴露一个 OpenAI 兼容 的 Chat Completions API。

你不用自己买卡、不用管推理优化,直接换 base_url 就能用上这些大模型——这正是它和 Groq、Cloudflare Workers AI 同属"免费算力"赛道的原因。

1.2 它解决什么痛点

官方入口:build.nvidia.com;模型目录:build.nvidia.com/models(可按 "Free Endpoint" 筛选免费模型)。

2免费政策(关键数字与口径)

2.1 官方 FAQ 原话,几个关键数字

口径矛盾提醒:部分第三方盘点(toolfreebie、hackernoon 等)提到"注册送 1,000 credits,可扩到 5,000,永不失效"。但官方 FAQ 只提 RPM 限速、明确无 token 计费。建议以官方为准——把它当成"按请求数限速"而非"按额度消耗";真要核对,看控制台右上角显示的你个人账户限速。

2.2 注册前置

手机验证(一次性)。API Key 以 nvapi- 开头,约 56 字符,只显示一次,务必存好(走环境变量,别硬编码进代码)。

3怎么开始:注册到调用的 5 步

3.1 流程

  1. 打开 build.nvidia.com,注册 NVIDIA Developer 账号(手机验证)。
  2. build.nvidia.com/settings/api-keys 生成 API Key,仅显示一次,存好。
  3. build.nvidia.com/models 按 "Free Endpoint" 筛选,每个模型页给出现成代码片段和准确 model ID。
  4. 用 OpenAI SDK 改 base_url 即可(见第六章代码)。
  5. 超限速 → 要么降速,要么下载 NIM 容器自建(第七章,API 完全一致)。
小技巧:每个模型页都自带可复制的 Python / curl 片段,直接抄就能跑,比自己拼参数省事。

4模型清单:2026-08 在线代表

4.1 英伟达自研 Nemotron 3 系列(重点)

模型特点
nvidia/nemotron-3-ultra-550b-a55b混合 Mamba-Transformer MoE,1M 上下文,agentic 推理 / 编码 / 规划 / 工具调用
nvidia/nemotron-3-super-120b企业级 agentic 专用,函数调用强
nvidia/nemotron-3.5-lightning-30b-a3b最快 30B A3B MoE,agentic 任务精度领先
nvidia/nemotron-3-embed-1b1B embedding 模型,语义检索 / RAG 用

4.2 其他厂商开放权重模型

厂商代表模型备注
MetaLlama 4 Scout/Maverick、Llama 3.3 70B、Llama 3.2 系列含视觉版
DeepSeekDeepSeek V4 Flash(1M 上下文)、V4、R1、V3.1编码 / agent 强
QwenQwen3 Coder 480B(256K 上下文)、Qwen3.5 122B/397B编码专用
OpenAIGPT-OSS 20B / 120B开放权重
GoogleGemma 4 31B、Gemma 3开源
MistralMistral Small、Mistral Nemotron函数调用好
MiniMaxMiniMax M2.7(230B MoE)平台最热免费 coding 模型
Z.aiGLM-5.2agentic / 编码
Kimikimi-k2.6长上下文
其他Poolside laguna-xs、muse-glimmer-30b、Step、GLM 等
模型可用性会变:免费模型可能提前几天通知后被弃用或转为受限。工作流要做"模型可替换"设计——一个模型没了能换另一个。

5限速与坑(必读)

把你"生产依赖"押在免费档是危险的:无 SLA + 模型可能弃用。正确做法是:用 NIM 免费档快速验证模型选型,真上线要么接付费 NIM partner 端点,要么自托管 NIM 容器。

6接入代码:OpenAI 兼容一行切换

6.1 Python(OpenAI SDK)

from openai import OpenAI
client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key="nvapi-YOUR_KEY",   # 走环境变量,别硬编码
)
resp = client.chat.completions.create(
    model="minimax/minimax-m2.7",   # 换成任意 NIM 模型 ID
    messages=[{"role":"user","content":"用 Python 写个反转字符串的函数"}],
    max_tokens=512,
    stream=True,   # 兼容流式输出
)
for chunk in resp:
    print(chunk.choices[0].delta.content or "", end="")

6.2 curl

curl https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer nvapi-YOUR_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"minimax/minimax-m2.7","messages":[{"role":"user","content":"Hello"}]}'
结构化输出、流式、function calling 在兼容模型上都支持。换模型只改 model 参数——每个模型页给的 model ID 就是这里要填的值。

7自托管选项:无限速的 NIM 容器

若免费档限速不够,可下载 NIM 容器跑在自己 GPU / 云(AWS、Azure、GCP、OCI、Brev)上,API 与云端完全一致,零代码改动

# 拉取并运行(以 gpt-oss-120b 为例)
docker pull nvcr.io/nim/openai/gpt-oss-120b:latest
docker run -it --gpus all -p 8000:8000 nvcr.io/nim/openai/gpt-oss-120b:latest

# 调用本地端点,参数结构同云端
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"openai/gpt-oss-120b","messages":[{"role":"user","content":"Hello"}]}'
价值:验证阶段用云端免费档零成本试模型;上线阶段把同一套代码迁到自托管 NIM 或 CSP partner 端点,免去重写。这就是 NIM "免费+自托管无缝衔接"的设计初衷。

8与其他免费平台对比

平台免费额度限速信用卡特点
NVIDIA NIM无 token 计费~40 RPM 全局不需要模型最多(100+)、OpenAI 兼容、可自托管
Groq每日 token 上限30 RPM不需要速度最快(500–1000 TPS)
Cloudflare Workers AI1 万 Neurons/天不需要边缘低延迟
Google Gemini免费档有限不需要原生多模态
选型建议:要"模型多 + 可平滑上生产"选 NIM;要"极致低延迟做交互 demo"选 Groq;已经在用 Cloudflare 边缘就顺手用 Workers AI。

9跟你站点的关系:接进 dsh / Agent 路线

NIM 是 OpenAI 兼容端点,正好能当 dsh、Claude Code、Codex、Cline 等 Agent 框架的免费后端。等于给《AI Agent 学习路线》里"Agent 怎么低成本跑起来"补了一个真实可用的免费算力来源——尤其适合学生、个人开发者、初创做原型。

一句话收尾:NVIDIA NIM 把"前沿开源大模型"变成任何人都能免费调的 OpenAI 兼容 API,先用来给 Agent 验证选型,真上线再切自托管或付费端点——从 build.nvidia.com 注册到 base_url 一行切换,最快 5 分钟跑通第一条调用。