NeuralBridgeDocumentation

qwq 32b

unofficialchat
DeveloperAlibaba
Identifierqwen/qwq-32b-08130

qwq 32b specifications

Context window24K
Max output tokens24000
Release date
InputText
OutputText

qwq 32b pricing in rubles

You pay for what you use, per token and per unit. The final request cost is returned in the API response.

TypePrice
Input tokens85,8per 1M tokens
Output tokens130per 1M tokens

Prices are in rubles and may change with exchange rates.

What qwq 32b can do

qwq 32b API: connection and code examples

The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.

OpenAI Python SDK

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.neuralbridge.ru/v1",
)

response = client.chat.completions.create(
    model="qwen/qwq-32b-08130",
    messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)

print(response.choices[0].message.content)

Python (requests)

import requests

response = requests.post(
    "https://api.neuralbridge.ru/v1/chat/completions",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    json={
        "model": "qwen/qwq-32b-08130",
        "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
    },
)

print(response.json()["choices"][0]["message"]["content"])

cURL

curl https://api.neuralbridge.ru/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen/qwq-32b-08130",
    "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
  }'

API endpoints

POST /v1/chat/completionsprimaryChat Completions
Haupt-Chat-Endpunkt: akzeptiert den Nachrichtenverlauf und gibt die Modellantwort zurück. Unterstützt Streaming- und Standardmodus.
POST /v1/responsesResponses
Alternative Chat-Format mit Zustand und strukturierter Ausgabe.
POST /v1/messagesMessages
Anthropic-Format: derselbe Chat für Kunden und SDKs, die für Claude geschrieben wurden.
POST /v1/converseConverse
Amazon Bedrock Converse-Format — für darauf zugeschnittene Clients.
POST /v1/converse-streamConverse Stream
Streaming-Variante des Bedrock Converse-Formats.
POST /v1/generateContentInhalt generieren
Google Gemini-Format — für Kunden und SDKs, die dafür geschrieben wurden.
POST /v1/streamGenerateContentStream Generate Content
Streaming-Variante des Gemini-Formats.

Supported request parameters

ParameterDefaultAllowed valuesDescription
temperature1Beeinflusst die Vielfalt der Antwort: Je höher der Wert, desto zufälliger die Ausgabe, je niedriger – desto vorhersehbarer.
top_p1Begrenzt die Auswahl der wahrscheinlichsten Token-Anteile: Es werden nur die berücksichtigt, deren Wahrscheinlichkeiten zusammen P ergeben.
max_tokensObergrenze der Token-Anzahl, die das Modell in der Antwort generieren kann.
presence_penalty0Reduziert die Wahrscheinlichkeit eines Tokens, wenn er bereits im Text vorkam – das Modell wechselt eher zu neuen Themen.
frequency_penalty0Reduziert die Token‑Wahrscheinlichkeit proportional zu seiner bisherigen Häufigkeit – bekämpft Wiederholungen.
stopListe von Begrenzungsstrings: Die Generierung wird unterbrochen, sobald das Modell einen davon ausgibt.
seedFixiert die Zufälligkeit: Eine wiederholte Anfrage mit demselben seed und denselben Parametern liefert das gleiche Ergebnis.
response_formatAntwortformat: normaler Text oder striktes JSON nach vorgegebener Schema.
streamfalseAntwort als Stream während der Generierung ausgeben, statt sie am Ende als einen Block zu senden.
reasoning_effortlow, medium, highDenkniveau: Wie viel Aufwand das Modell für das reasoning vor der Antwort aufwendet. Höheres Niveau → tiefere Analyse, mehr Zeit und Token.
Language:РусскийEnglishУкраїнськаБеларускаяҚазақшаOʻzbekchaКыргызчаТоҷикӣՀայերենAzərbaycancaTürkmençeRomânăDeutschFrançaisEspañolItalianoPortuguêsPolskiNederlandsTürkçeΕλληνικά