NeuralBridgeDocumentation

nemotron 3 120b a12b

unofficialchat
DeveloperNvidia
Identifiernvidia/nemotron-3-120b-a12b-08130

nemotron 3 120b a12b specifications

Context window256K
Max output tokens256000
Release date
InputText
OutputText

nemotron 3 120b a12b pricing in rubles

You pay for what you use, per token and per unit. The final request cost is returned in the API response.

TypePrice
Input tokens65per 1M tokens
Output tokens195per 1M tokens

Prices are in rubles and may change with exchange rates.

What nemotron 3 120b a12b can do

nemotron 3 120b a12b API: connection and code examples

The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.

OpenAI Python SDK

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.neuralbridge.ru/v1",
)

response = client.chat.completions.create(
    model="nvidia/nemotron-3-120b-a12b-08130",
    messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)

print(response.choices[0].message.content)

Python (requests)

import requests

response = requests.post(
    "https://api.neuralbridge.ru/v1/chat/completions",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    json={
        "model": "nvidia/nemotron-3-120b-a12b-08130",
        "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
    },
)

print(response.json()["choices"][0]["message"]["content"])

cURL

curl https://api.neuralbridge.ru/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-3-120b-a12b-08130",
    "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
  }'

API endpoints

POST /v1/chat/completionsprimaryChat Completions
Асноўны endpoint чата: прымае гісторыю паведамленняў і вяртае адказ мадэлі. Падтрымлівае патокавы і звычайны рэжымы.
POST /v1/responsesResponses
Альтэрнатыўны фармат чата з станам і структураваным вывадам.
POST /v1/messagesMessages
Фармат Anthropic: той жа чат для кліентаў і SDK, напісаных пад Claude.
POST /v1/converseConverse
Фармат Amazon Bedrock Converse — для кліентаў, напісаных пад яго.
POST /v1/converse-streamConverse Stream
Патокавы варыянт фармату Bedrock Converse.
POST /v1/generateContentСтварыць кантэнт
Фармат Google Gemini — для кліентаў і SDK, напісаных пад яго.
POST /v1/streamGenerateContentStream Generate Content
Патокавы варыянт фармату Gemini.

Supported request parameters

ParameterDefaultAllowed valuesDescription
temperature1Уплывае на разнастайнасць адказу: чым вышэй значэнне, тым выпадковей вывад, чым ніжэй — тым прадказальней.
top_p1Абмяжоўвае выбар доляў самых верагодных токенаў: улічваюцца толькі тыя, чые верагоднасці ў суме даюць P.
max_tokensВерхні ліміт колькасці токенаў, якія мадэль можа згенераваць у адказе.
presence_penalty0Зніжае верагоднасць токена, калі ён ужо сустракаўся ў тэксце — мадэль хутчэй пераходзіць да новых тэм.
frequency_penalty0Зніжае верагоднасць токену прапарцыянальна таму, як часта ён ужо сустракаўся — змагаецца з паўтарэннямі.
stopСпіс радкоў-абмежавальнікаў: генерацыя спыняецца, як толькі мадэль выдае любую з іх.
seedФіксуе выпадковасць: паўторны запыт з тым жа seed і тымі ж параметрамі дае той жа вынік.
response_formatФармат адказу: звычайны тэкст або строгі JSON па зададзенай схеме.
streamfalseАддаваць адказ патокам па меры генерацыі, а не адным кавалком у канцы.
tools
tool_choice
Language:РусскийEnglishУкраїнськаБеларускаяҚазақшаOʻzbekchaКыргызчаТоҷикӣՀայերենAzərbaycancaTürkmençeRomânăDeutschFrançaisEspañolItalianoPortuguêsPolskiNederlandsTürkçeΕλληνικά