NeuralBridgeDocumentation

GLM-5.2

unofficialchat
DeveloperZhipu AI
Identifierz-ai/glm-5.2-01402

GLM-5.2 specifications

Context window1M
Max output tokens131072
Release date2026-06-25
InputText
OutputText

GLM-5.2 pricing in rubles

You pay for what you use, per token and per unit. The final request cost is returned in the API response.

TypePrice
Input tokens280 ₽ per 1M tokens
Output tokens880 ₽ per 1M tokens
Cache read56 ₽ per 1M tokens

Prices are in rubles and may change with exchange rates.

What GLM-5.2 can do

GLM-5.2 API: connection and code examples

The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.

OpenAI Python SDK

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.neuralbridge.ru/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.2-01402",
    messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)

print(response.choices[0].message.content)

Python (requests)

import requests

response = requests.post(
    "https://api.neuralbridge.ru/v1/chat/completions",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    json={
        "model": "z-ai/glm-5.2-01402",
        "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
    },
)

print(response.json()["choices"][0]["message"]["content"])

cURL

curl https://api.neuralbridge.ru/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.2-01402",
    "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
  }'

API endpoints

POST /v1/chat/completionsprimaryChat Completions
Endpoint principal du chat : accepte l'historique des messages et renvoie la réponse du modèle. Prend en charge les modes flux et standard.
POST /v1/responsesResponses
Format de chat alternatif avec état et sortie structurée.
POST /v1/messagesMessages
Format Anthropic : le même chat pour les clients et les SDK écrits pour Claude.
POST /v1/converseConverse
Format Amazon Bedrock Converse — pour les clients développés pour celui‑ci.
POST /v1/converse-streamConverse Stream
Version flux du format Bedrock Converse.
POST /v1/generateContentGénérer du contenu
Format Google Gemini — pour les clients et les SDK écrits pour celui-ci.
POST /v1/streamGenerateContentStream Generate Content
Version flux du format Gemini.

Supported request parameters

ParameterDefaultAllowed valuesDescription
temperature1—Influence sur la diversité de la réponse : plus la valeur est élevée, plus la sortie est aléatoire, plus elle est basse — plus elle est prévisible.
top_p1—Limite le choix des parts des tokens les plus probables : seuls ceux dont les probabilités totalisent P sont pris en compte.
max_tokens——Limite supérieure du nombre de tokens que le model peut générer dans la réponse.
presence_penalty0—Réduit la probabilité d'un token s'il est déjà présent dans le texte — le model passe plus volontiers à de nouveaux sujets.
frequency_penalty0—Réduit la probabilité d'un token proportionnellement à sa fréquence d'apparition — lutte contre les répétitions.
stop——Liste de chaînes délimitantes : la génération s'arrête dès que le modèle produit l'une d'elles.
seed——Fixe la stochasticité : une requête répétée avec le même seed et les mêmes paramètres donne le même résultat.
response_format——Format de la réponse : texte brut ou JSON strict selon le schéma spécifié.
streamfalse—Envoyer la réponse en flux au fur et à mesure de la génération, plutôt qu'en un seul bloc à la fin.
tools———
tool_choice———
parallel_tool_calls———
reasoning_efforthighnone, highNiveau de réflexion : combien d'effort le model consacre au reasoning avant la réponse. Un niveau plus élevé — analyse plus profonde, plus de temps et de tokens.
Language:РусскийEnglishУкраїнськаБеларускаяҚазақшаOʻzbekchaКыргызчаТоҷикӣՀայերենAzərbaycancaTürkmençeRomânăDeutschFrançaisEspañolItalianoPortuguêsPolskiNederlandsTürkçeΕλληνικά