← 返回工具箱
HTML 版手册

填入 API Key 后,按模型 ID 直接调用

对应 Word 文件《NVIDIA模型调用手册.docx》。点模型 ID 即可复制。文档不含真实密钥。

82目录可见模型
11当前账号确认可对话
2026-09-17 21:52:54实测时间

一、先看这三个参数

NVIDIA Build 的云端接口是 OpenAI 兼容格式。任何客户端(Python、Cursor、Cherry Studio、curl)都只需要填三项:

参数名应该等于说明
base_urlhttps://integrate.api.nvidia.com/v1接口地址,必须带到 /v1
api_keynvapi-开头的密钥在 build.nvidia.com/settings/api-keys 生成
model厂商/模型名必须填官方 ID,不能只填页面短名
最容易填错的是模型名。页面上写 glm-5-3,真正要填的是 z-ai/glm-5.3;页面上写 kimi-k3,真正要填的是 moonshotai/kimi-k3。

二、调用程序示例

1. 把密钥放进 .env

不要把密钥写进代码。在同目录建 .env:

NVIDIA_API_KEY=nvapi-你的密钥
NVIDIA_BASE_URL=https://integrate.api.nvidia.com/v1
NVIDIA_TEST_MODEL=nvidia/nemotron-3.5-lightning-30b-a3b

2. Python(推荐,OpenAI SDK)

先安装:pip install openai python-dotenv。想换模型,只改 model= 这一行。

import os
from openai import OpenAI
from dotenv import load_dotenv

load_dotenv()
client = OpenAI(
    base_url=os.environ["NVIDIA_BASE_URL"],  # https://integrate.api.nvidia.com/v1
    api_key=os.environ["NVIDIA_API_KEY"],    # nvapi-...
)

completion = client.chat.completions.create(
    model="nvidia/nemotron-3.5-lightning-30b-a3b",  # 想调哪个就换这里
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "用一句话介绍你自己"},
    ],
    temperature=0.6,
    max_tokens=1024,
    stream=False,
)
print(completion.choices[0].message.content)

3. curl 一行测试

curl https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NVIDIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3.5-lightning-30b-a3b",
    "messages": [{"role":"user","content":"连通测试,回复OK"}],
    "max_tokens": 32,
    "temperature": 0.2,
    "stream": false
  }'

4. 图形客户端怎么填

Cursor、Cherry Studio、OpenClaw、NextChat 这类「自定义 OpenAI 接口」按下面填:

界面上的栏填什么
API 地址 / Base URL / 接口https://integrate.api.nvidia.com/v1
API Key / 密钥nvapi- 开头的完整密钥
模型 / Model下表「model 参数应等于」那一列,原样复制
API 类型OpenAI / OpenAI Compatible

三、请求参数怎么设

聊天接口固定打 POST https://integrate.api.nvidia.com/v1/chat/completions,请求体常用字段如下。

字段必填建议值作用
model是见下一章完整 ID决定调用哪一个模型。必须完全一致。
messages是[{{role, content}}]对话数组。role 只能是 system / user / assistant。
max_tokens否256~4096最多生成多少 token。测通时用 8~64 即可。
temperature否0.2 测通 / 0.6 日常越大越随机。探测连通性时建议 0~0.2。
top_p否0.95 或 1核采样。一般保持默认。
stream否false 测通 / true 聊天流式输出。排查问题时先关。
extra_body否按模型而定部分 Nemotron 用来开 thinking。

Nemotron 旗舰若要打开思考过程,在 Python 里额外传:

extra_body={"chat_template_kwargs": {"enable_thinking": True}}

看图模型(如 meta/llama-3.2-11b-vision-instruct)的 user content 要写成数组:

{
  "role": "user",
  "content": [
    {"type": "text", "text": "这张图里有什么?"},
    {"type": "image_url", "image_url": {"url": "https://example.com/a.jpg"}}
  ]
}

四、当前账号实测可用(优先用这些)

下面这些模型在本机用同一把 API Key 调用 /v1/chat/completions 返回了 HTTP 200。点击模型 ID 即可复制,粘到程序的 model= 后面。

model 参数应等于厂商适合做什么实测耗时试探回复
deepseek-ai长上下文编程与对话6.14s1. The user asks to reply
googleGoogle Diffusion LLM,并行出词,适合低延迟文本0.87s有返回
meta看图问答1.73sOK
nvidia量子计算校准图解读专用,不适合日常闲聊1.99sOK
nvidiaNVIDIA 通用推理/Agent 模型,适合对话、编程、工具调用0.63sThe user asks: "Reply with the
nvidiaNVIDIA 旗舰推理模型,能力更强、响应更慢1.04sThe user wants me to reply with the
nvidia内容安全审核,返回是否安全,不是聊天助手1.42sUser Safety: safe
nvidia更快的 Agent 模型,适合日常对话和多步任务6.79sHere's a thinking process: 1.
nvidia文档/图片解析,适合 OCR 与版面提取,不是通用聊天0.7s........
nvidia翻译模型(约 12 种语言)0.97sReply with the single word OK.
nvidia翻译模型(约 37 种语言)0.74sSvar med ett enkelt ord OK

按用途怎么选

日常对话 / 写代码:nvidia/nemotron-3.5-lightning-30b-a3b(更快)或 nvidia/nemotron-3-super-120b-a12b。

最强推理:nvidia/nemotron-3-ultra-550b-a55b。

看图:meta/llama-3.2-11b-vision-instruct。

翻译:nvidia/riva-translate-4b-instruct-v2。

文档解析:nvidia/nemotron-parse-2.0。

安全审核:nvidia/nemotron-3.5-content-safety。

注意:deepseek-ai/deepseek-v4-flash-0731 虽然现在能调,但官方已标弃用,几天内会下线。

五、本机曾调通、复测可能超时

mistralai/mistral-nemotron 在建立测试脚本时成功返回「连通测试成功。」,随后高峰复测超时。热门模型 glm-5.3、kimi-k3、gpt-oss-20b、gemma-4-31b-it 当前是「连上 TLS 后一直不回包」。这通常是账号缺少 Public API Endpoints 权限,或该模型当前排队,不是 Key 填错。

model 参数应等于本次探测结果说明
超时无响应通用对话/编程
超时无响应GLM 5.3 文本推理
超时无响应GLM 5.3 Flash,更快、支持多模态
超时无响应长程编程、看图、工具调用
超时无响应较小的开源推理模型
超时无响应Gemma 4 31B 推理模型

六、如何自己测某一个模型

把下面命令里的 MODEL 换成你想试的官方 ID。成功时 HTTP 状态码是 200,并且 choices[0].message.content 有字。

export NVIDIA_API_KEY=nvapi-你的密钥
export MODEL=nvidia/nemotron-3-super-120b-a12b

curl -sS --http1.1 --max-time 30 \
  https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NVIDIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{\"model\":\"$MODEL\",\"messages\":[{\"role\":\"user\",\"content\":\"Reply OK\"}],\"max_tokens\":8,\"stream\":false}"

也可以先列出账号当前看得到的全部模型 ID:

curl -sS https://integrate.api.nvidia.com/v1/models \
  -H "Authorization: Bearer $NVIDIA_API_KEY"

本仓库已提供一键脚本:在 nvidia-api 目录执行 python3 test_nvidia_api.py。它会读取 .env 里的 NVIDIA_API_KEY 和 NVIDIA_TEST_MODEL。

测试现象含义怎么办
HTTP 200 且有 content这个模型当前可用把该 ID 填进 model=
HTTP 404 Function not found目录能看到,但账号没有推理权限换已验证可用的模型,或向 NVIDIA 申请 Public API Endpoints
HTTP 410 Gone模型已下线换新 ID
HTTP 429触发免费档限速(常见约 40 次/分钟)降速重试,过几秒再打
HTTP 000 / 超时 0 字节TLS 已连上但模型不回包多半是权限或排队,换可用模型
HTTP 400 / 500 / 503入参不对或服务端忙检查是否误把 embedding 模型拿去 chat;稍后重试

七、完整模型目录(当前账号可见 82 个)

「model 参数应等于」这一列就是程序里要写的字符串。状态为「可用」的可直接用;「列表可见但账号无权调用」复制过去会 404;「超时无响应」可以再试,但不保证。

model 参数应等于厂商实测状态耗时类型/备注
01-ai列表可见但账号无权调用0.72s目录中可见。是否能调取决于账号权限。
adept列表可见但账号无权调用0.73s目录中可见。是否能调取决于账号权限。
ai21labs列表可见但账号无权调用0.43s目录中可见。是否能调取决于账号权限。
aisingapore列表可见但账号无权调用0.44s目录中可见。是否能调取决于账号权限。
bigcode列表可见但账号无权调用0.47s代码模型。
databricks列表可见但账号无权调用0.39s目录中可见。是否能调取决于账号权限。
deepseek-ai列表可见但账号无权调用0.46s代码模型。
deepseek-ai可用6.14s长上下文编程与对话。官方已宣布弃用,约 2026-09-19 起停、09-21 下线,不建议当主力。
google列表可见但账号无权调用0.69s代码模型。
google列表可见但账号无权调用0.95s代码模型。
google列表可见但账号无权调用0.4s目录中可见。是否能调取决于账号权限。
google可用0.87sGoogle Diffusion LLM,并行出词,适合低延迟文本。
google列表可见但账号无权调用0.83s目录中可见。是否能调取决于账号权限。
google列表可见但账号无权调用0.6s目录中可见。是否能调取决于账号权限。
google列表可见但账号无权调用1.49s目录中可见。是否能调取决于账号权限。
google超时无响应20.02sGemma 4 31B 推理模型。当前账号常见超时。
google列表可见但账号无权调用0.53s目录中可见。是否能调取决于账号权限。
ibm列表可见但账号无权调用0.96s目录中可见。是否能调取决于账号权限。
ibm列表可见但账号无权调用0.48s目录中可见。是否能调取决于账号权限。
ibm列表可见但账号无权调用1.54s代码模型。
ibm列表可见但账号无权调用1.44s代码模型。
meta列表可见但账号无权调用0.47s代码模型。
meta可用1.73s看图问答。messages 里可同时放 text 和 image_url。
meta超时无响应20.02s视觉语言模型。
meta超时无响应20.03s安全审核模型。
meta列表可见但账号无权调用1.46s目录中可见。是否能调取决于账号权限。
meta超时无响应20.04s目录中可见。是否能调取决于账号权限。
microsoft列表可见但账号无权调用1.02s目录中可见。是否能调取决于账号权限。
microsoft列表可见但账号无权调用0.46s视觉语言模型。
microsoft列表可见但账号无权调用1.66s目录中可见。是否能调取决于账号权限。
mistralai列表可见但账号无权调用1.5s代码模型。
mistralai列表可见但账号无权调用0.41s目录中可见。是否能调取决于账号权限。
mistralai列表可见但账号无权调用0.43s目录中可见。是否能调取决于账号权限。
mistralai列表可见但账号无权调用0.71s目录中可见。是否能调取决于账号权限。
mistralai超时无响应20.03s通用对话/编程。本机曾成功返回中文,高峰时可能超时,可再试。
mistralai列表可见但账号无权调用0.41s目录中可见。是否能调取决于账号权限。
moonshotai列表可见但账号无权调用0.43s目录中可见。是否能调取决于账号权限。
moonshotai超时无响应20.02s长程编程、看图、工具调用。当前账号常见超时。
nv-mistralai列表可见但账号无权调用1.14s目录中可见。是否能调取决于账号权限。
nvidiaHTTP 5001.22s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.46s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用1.06s向量/检索模型,不要用 chat/completions。
nvidia可用1.99s量子计算校准图解读专用,不适合日常闲聊。
nvidia超时无响应20.03s安全审核模型。
nvidiaHTTP 5000.64s安全审核模型。
nvidia列表可见但账号无权调用0.43s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.41s目录中可见。是否能调取决于账号权限。
nvidia超时无响应20.03s安全审核模型。
nvidia列表可见但账号无权调用0.41s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.46s向量/检索模型,不要用 chat/completions。
nvidia列表可见但账号无权调用0.49s向量/检索模型,不要用 chat/completions。
nvidia列表可见但账号无权调用1.39s向量/检索模型,不要用 chat/completions。
nvidia列表可见但账号无权调用0.56s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.45s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用1.63s向量/检索模型,不要用 chat/completions。
nvidiaHTTP 5031.32s目录中可见。是否能调取决于账号权限。
nvidia可用0.63sNVIDIA 通用推理/Agent 模型,适合对话、编程、工具调用。
nvidia可用1.04sNVIDIA 旗舰推理模型,能力更强、响应更慢。可开 thinking。
nvidia可用1.42s内容安全审核,返回是否安全,不是聊天助手。
nvidia可用6.79s更快的 Agent 模型,适合日常对话和多步任务。推荐首选。
nvidia列表可见但账号无权调用0.4s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.41s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.6s目录中可见。是否能调取决于账号权限。
nvidiaHTTP 4001.17s文档解析 / OCR。
nvidia可用0.7s文档/图片解析,适合 OCR 与版面提取,不是通用聊天。
nvidia列表可见但账号无权调用0.63s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.61s向量/检索模型,不要用 chat/completions。
nvidia列表可见但账号无权调用0.39s目录中可见。是否能调取决于账号权限。
nvidia列表可见但账号无权调用0.4s翻译模型。
nvidia可用0.97s翻译模型(约 12 种语言)。
nvidia可用0.74s翻译模型(约 37 种语言)。
nvidia列表可见但账号无权调用0.43s目录中可见。是否能调取决于账号权限。
openai超时无响应20.03s较小的开源推理模型。当前账号常见超时。
poolsideHTTP 5031.54s目录中可见。是否能调取决于账号权限。
snowflake列表可见但账号无权调用0.52s向量/检索模型,不要用 chat/completions。
writer列表可见但账号无权调用1.53s目录中可见。是否能调取决于账号权限。
writer列表可见但账号无权调用0.47s目录中可见。是否能调取决于账号权限。
writer列表可见但账号无权调用1.42s目录中可见。是否能调取决于账号权限。
writer列表可见但账号无权调用0.43s目录中可见。是否能调取决于账号权限。
z-ai超时无响应20.03sGLM 5.3 文本推理。页面短名是 glm-5-3,参数必须写成 z-ai/glm-5.3。当前账号常见超时。
z-ai超时无响应20.02sGLM 5.3 Flash,更快、支持多模态。当前账号常见超时。
zyphra列表可见但账号无权调用0.59s目录中可见。是否能调取决于账号权限。

八、用量与限制

NVIDIA Build 的托管接口定位是开发试用,不绑信用卡。现在不再用旧的 credits 点数,而是按模型限速。

免费档常见上限大约每分钟 40 次请求,热门大模型会更紧。超了返回 429。

Key 可以长期用,但不是生产级无限量。要稳定高并发,需要自己部署 NIM 或走付费 Partner Endpoints。

密钥获取地址:https://build.nvidia.com/settings/api-keys

模型目录地址:https://build.nvidia.com/models

点进某个模型页后,看代码示例里的 model="...",那一串才是正确 ID。

九、最小可运行对照

假设你已经把 nvapi- 密钥放进环境变量,下面就是一次完整调用的对应关系:

你想做的事代码里写
指定接口base_url = "https://integrate.api.nvidia.com/v1"
带上密钥api_key = os.environ["NVIDIA_API_KEY"]
选日常对话模型model = "nvidia/nemotron-3.5-lightning-30b-a3b"
选看图模型model = "meta/llama-3.2-11b-vision-instruct"
选翻译模型model = "nvidia/riva-translate-4b-instruct-v2"
选最强推理model = "nvidia/nemotron-3-ultra-550b-a55b"