NeuralBridgeDocumentation

DeepSeek V4 Flash (0731)

unofficialchat
DeveloperDeepSeek
Identifierdeepseek/deepseek-v4-flash-0731-12544

DeepSeek V4 Flash (0731) specifications

Context window128K
Max output tokens—
Release date—
InputText
OutputText

DeepSeek V4 Flash (0731) pricing in rubles

You pay for what you use, per token and per unit. The final request cost is returned in the API response.

TypePrice
Input tokens14,35 ₽ per 1M tokens
Output tokens100,46 ₽ per 1M tokens

Prices are in rubles and may change with exchange rates.

What DeepSeek V4 Flash (0731) can do

DeepSeek V4 Flash (0731) API: connection and code examples

The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.

OpenAI Python SDK

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.neuralbridge.ru/v1",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4-flash-0731-12544",
    messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)

print(response.choices[0].message.content)

Python (requests)

import requests

response = requests.post(
    "https://api.neuralbridge.ru/v1/chat/completions",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    json={
        "model": "deepseek/deepseek-v4-flash-0731-12544",
        "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
    },
)

print(response.json()["choices"][0]["message"]["content"])

cURL

curl https://api.neuralbridge.ru/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek/deepseek-v4-flash-0731-12544",
    "messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
  }'

API endpoints

POST /v1/chat/completionsprimaryChat Completions
Haupt-Chat-Endpunkt: akzeptiert den Nachrichtenverlauf und gibt die Modellantwort zurück. Unterstützt Streaming- und Standardmodus.
POST /v1/responsesResponses
Alternative Chat-Format mit Zustand und strukturierter Ausgabe.
POST /v1/messagesMessages
Anthropic-Format: derselbe Chat für Kunden und SDKs, die für Claude geschrieben wurden.
POST /v1/converseConverse
Amazon Bedrock Converse-Format — für darauf zugeschnittene Clients.
POST /v1/converse-streamConverse Stream
Streaming-Variante des Bedrock Converse-Formats.
POST /v1/generateContentInhalt generieren
Google Gemini-Format — für Kunden und SDKs, die dafür geschrieben wurden.
POST /v1/streamGenerateContentStream Generate Content
Streaming-Variante des Gemini-Formats.

Supported request parameters

ParameterDefaultAllowed valuesDescription
temperature1—Beeinflusst die Vielfalt der Antwort: Je höher der Wert, desto zufälliger die Ausgabe, je niedriger – desto vorhersehbarer.
top_p1—Begrenzt die Auswahl der wahrscheinlichsten Token-Anteile: Es werden nur die berücksichtigt, deren Wahrscheinlichkeiten zusammen P ergeben.
max_tokens——Obergrenze der Token-Anzahl, die das Modell in der Antwort generieren kann.
presence_penalty0—Reduziert die Wahrscheinlichkeit eines Tokens, wenn er bereits im Text vorkam – das Modell wechselt eher zu neuen Themen.
frequency_penalty0—Reduziert die Token‑Wahrscheinlichkeit proportional zu seiner bisherigen Häufigkeit – bekämpft Wiederholungen.
stop——Liste von Begrenzungsstrings: Die Generierung wird unterbrochen, sobald das Modell einen davon ausgibt.
seed——Fixiert die Zufälligkeit: Eine wiederholte Anfrage mit demselben seed und denselben Parametern liefert das gleiche Ergebnis.
response_format——Antwortformat: normaler Text oder striktes JSON nach vorgegebener Schema.
streamfalse—Antwort als Stream während der Generierung ausgeben, statt sie am Ende als einen Block zu senden.
tools———
reasoning_effort—none, highDenkniveau: Wie viel Aufwand das Modell für das reasoning vor der Antwort aufwendet. Höheres Niveau → tiefere Analyse, mehr Zeit und Token.
Language:РусскийEnglishУкраїнськаБеларускаяҚазақшаOʻzbekchaКыргызчаТоҷикӣՀայերենAzərbaycancaTürkmençeRomânăDeutschFrançaisEspañolItalianoPortuguêsPolskiNederlandsTürkçeΕλληνικά