NeuralBridgeDocumentation

Nemotron Safety Guard 8B v3

unofficialchat
DeveloperNvidia
Identifiernvidia/nemotron-safety-guard-8b-v3-10238

Nemotron Safety Guard 8B v3 specifications

Context window8K
Max output tokens4096
Release date
InputText
OutputText

Nemotron Safety Guard 8B v3 pricing in rubles

You pay for what you use, per token and per unit. The final request cost is returned in the API response.

TypePrice
Input tokens2,2per 1M tokens
Output tokens4,38per 1M tokens

Prices are in rubles and may change with exchange rates.

What Nemotron Safety Guard 8B v3 can do

Nemotron Safety Guard 8B v3 API: connection and code examples

The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.

OpenAI Python SDK

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.neuralbridge.ru/v1",
)

response = client.chat.completions.create(
    model="nvidia/nemotron-safety-guard-8b-v3-10238",
    messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)

print(response.choices[0].message.content)

Python (requests)

import requests

response = requests.post(
    "https://api.neuralbridge.ru/v1/chat/completions",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    json={
        "model": "nvidia/nemotron-safety-guard-8b-v3-10238",
        "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
    },
)

print(response.json()["choices"][0]["message"]["content"])

cURL

curl https://api.neuralbridge.ru/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nvidia/nemotron-safety-guard-8b-v3-10238",
    "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
  }'

API endpoints

POST /v1/chat/completionsprimaryChat Completions
Haupt-Chat-Endpunkt: akzeptiert den Nachrichtenverlauf und gibt die Modellantwort zurück. Unterstützt Streaming- und Standardmodus.
POST /v1/responsesResponses
Alternative Chat-Format mit Zustand und strukturierter Ausgabe.
POST /v1/messagesMessages
Anthropic-Format: derselbe Chat für Kunden und SDKs, die für Claude geschrieben wurden.
POST /v1/converseConverse
Amazon Bedrock Converse-Format — für darauf zugeschnittene Clients.
POST /v1/converse-streamConverse Stream
Streaming-Variante des Bedrock Converse-Formats.
POST /v1/generateContentInhalt generieren
Google Gemini-Format — für Kunden und SDKs, die dafür geschrieben wurden.
POST /v1/streamGenerateContentStream Generate Content
Streaming-Variante des Gemini-Formats.

Supported request parameters

ParameterDefaultAllowed valuesDescription
temperature1Beeinflusst die Vielfalt der Antwort: Je höher der Wert, desto zufälliger die Ausgabe, je niedriger – desto vorhersehbarer.
top_p1Begrenzt die Auswahl der wahrscheinlichsten Token-Anteile: Es werden nur die berücksichtigt, deren Wahrscheinlichkeiten zusammen P ergeben.
max_tokensObergrenze der Token-Anzahl, die das Modell in der Antwort generieren kann.
presence_penalty0Reduziert die Wahrscheinlichkeit eines Tokens, wenn er bereits im Text vorkam – das Modell wechselt eher zu neuen Themen.
frequency_penalty0Reduziert die Token‑Wahrscheinlichkeit proportional zu seiner bisherigen Häufigkeit – bekämpft Wiederholungen.
stopListe von Begrenzungsstrings: Die Generierung wird unterbrochen, sobald das Modell einen davon ausgibt.
seedFixiert die Zufälligkeit: Eine wiederholte Anfrage mit demselben seed und denselben Parametern liefert das gleiche Ergebnis.
response_formatAntwortformat: normaler Text oder striktes JSON nach vorgegebener Schema.
streamfalseAntwort als Stream während der Generierung ausgeben, statt sie am Ende als einen Block zu senden.
Language:РусскийEnglishУкраїнськаБеларускаяҚазақшаOʻzbekchaКыргызчаТоҷикӣՀայերենAzərbaycancaTürkmençeRomânăDeutschFrançaisEspañolItalianoPortuguêsPolskiNederlandsTürkçeΕλληνικά