NeuralBridgeDocumentation

GLM 5.3

unofficialchat
DeveloperZ-AI
Identifierz-ai/glm-5.3-12544

GLM 5.3 specifications

Context window1M
Max output tokens131072
Release date—
InputText
OutputText

GLM 5.3 pricing in rubles

You pay for what you use, per token and per unit. The final request cost is returned in the API response.

TypePrice
Input tokens136,34 ₽ per 1M tokens
Output tokens954,41 ₽ per 1M tokens

Prices are in rubles and may change with exchange rates.

What GLM 5.3 can do

GLM 5.3 API: connection and code examples

The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.

OpenAI Python SDK

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.neuralbridge.ru/v1",
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3-12544",
    messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)

print(response.choices[0].message.content)

Python (requests)

import requests

response = requests.post(
    "https://api.neuralbridge.ru/v1/chat/completions",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    json={
        "model": "z-ai/glm-5.3-12544",
        "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
    },
)

print(response.json()["choices"][0]["message"]["content"])

cURL

curl https://api.neuralbridge.ru/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.3-12544",
    "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
  }'

API endpoints

POST /v1/chat/completionsprimaryChat Completions
Endpoint principal de chat: recibe el historial de mensajes y devuelve la respuesta del modelo. Soporta modos streaming y normales.
POST /v1/responsesResponses
Formato alternativo de chat con estado y salida estructurada.
POST /v1/messagesMessages
Formato Anthropic: el mismo chat para clientes y SDK escritos para Claude.
POST /v1/converseConverse
Formato Amazon Bedrock Converse — para clientes desarrollados para él.
POST /v1/converse-streamConverse Stream
Versión streaming del formato Bedrock Converse.
POST /v1/generateContentGenerar contenido
Formato Google Gemini — para clientes y SDK escritos para él.
POST /v1/streamGenerateContentStream Generate Content
Versión de flujo del formato Gemini.

Supported request parameters

ParameterDefaultAllowed valuesDescription
temperature1—Afecta la diversidad de la respuesta: cuanto mayor el valor, más aleatoria la salida; cuanto menor, más predecible.
top_p1—Limita la selección de las fracciones de los tokens más probables: solo se consideran aquellos cuya probabilidad sumada alcanza P.
max_tokens——Límite superior del número de tokens que el modelo puede generar en la respuesta.
presence_penalty0—Reduce la probabilidad del token si ya ha aparecido en el texto — el model pasa más fácilmente a nuevos temas.
frequency_penalty0—Reduce la probabilidad del token proporcionalmente a la frecuencia con la que ya ha aparecido — combate repeticiones.
stop——Lista de cadenas delimitadoras: la generación se detiene tan pronto como el modelo produce cualquiera de ellas.
seed——Fija la aleatoriedad: una solicitud repetida con el mismo seed y los mismos parámetros produce el mismo resultado.
response_format——Formato de respuesta: texto plano o JSON estricto según el esquema especificado.
streamfalse—Entregar la respuesta en streaming a medida que se genera, en lugar de un solo bloque al final.
tools———
Language:РусскийEnglishУкраїнськаБеларускаяҚазақшаOʻzbekchaКыргызчаТоҷикӣՀայերենAzərbaycancaTürkmençeRomânăDeutschFrançaisEspañolItalianoPortuguêsPolskiNederlandsTürkçeΕλληνικά