Qwen Flash
unofficialchat
Qwen Flash specifications
| Context window | 1M |
|---|---|
| Max output tokens | 32768 |
| Release date | — |
| Input | Text |
| Output | Text |
Qwen Flash pricing in rubles
You pay for what you use, per token and per unit. The final request cost is returned in the API response.
| Type | Price |
|---|---|
| Input tokens | 9 ₽ per 1M tokens |
| Output tokens | 72 ₽ per 1M tokens |
| Cache read | 1,8 ₽ per 1M tokens |
Prices are in rubles and may change with exchange rates.
What Qwen Flash can do
- Function calling
- feature.ide
- Streaming responses
Qwen Flash API: connection and code examples
The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.
OpenAI Python SDK
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.neuralbridge.ru/v1",
)
response = client.chat.completions.create(
model="qwen/qwen-flash-01402",
messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)
print(response.choices[0].message.content)Python (requests)
import requests
response = requests.post(
"https://api.neuralbridge.ru/v1/chat/completions",
headers={"Authorization": "Bearer YOUR_API_KEY"},
json={
"model": "qwen/qwen-flash-01402",
"messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
},
)
print(response.json()["choices"][0]["message"]["content"])cURL
curl https://api.neuralbridge.ru/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen/qwen-flash-01402",
"messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
}'API endpoints
POST /v1/chat/completionsprimary | Chat Completions Endpoint principal du chat : accepte l'historique des messages et renvoie la réponse du modèle. Prend en charge les modes flux et standard. |
POST /v1/responses | Responses Format de chat alternatif avec état et sortie structurée. |
POST /v1/messages | Messages Format Anthropic : le même chat pour les clients et les SDK écrits pour Claude. |
POST /v1/converse | Converse Format Amazon Bedrock Converse — pour les clients développés pour celui‑ci. |
POST /v1/converse-stream | Converse Stream Version flux du format Bedrock Converse. |
POST /v1/generateContent | Générer du contenu Format Google Gemini — pour les clients et les SDK écrits pour celui-ci. |
POST /v1/streamGenerateContent | Stream Generate Content Version flux du format Gemini. |
Supported request parameters
| Parameter | Default | Allowed values | Description |
|---|---|---|---|
temperature | 1 | — | Influence sur la diversité de la réponse : plus la valeur est élevée, plus la sortie est aléatoire, plus elle est basse — plus elle est prévisible. |
top_p | 1 | — | Limite le choix des parts des tokens les plus probables : seuls ceux dont les probabilités totalisent P sont pris en compte. |
max_tokens | — | — | Limite supérieure du nombre de tokens que le model peut générer dans la réponse. |
presence_penalty | 0 | — | Réduit la probabilité d'un token s'il est déjà présent dans le texte — le model passe plus volontiers à de nouveaux sujets. |
frequency_penalty | 0 | — | Réduit la probabilité d'un token proportionnellement à sa fréquence d'apparition — lutte contre les répétitions. |
stop | — | — | Liste de chaînes délimitantes : la génération s'arrête dès que le modèle produit l'une d'elles. |
seed | — | — | Fixe la stochasticité : une requête répétée avec le même seed et les mêmes paramètres donne le même résultat. |
response_format | — | — | Format de la réponse : texte brut ou JSON strict selon le schéma spécifié. |
stream | false | — | Envoyer la réponse en flux au fur et à mesure de la génération, plutôt qu'en un seul bloc à la fin. |
tools | — | — | — |
tool_choice | — | — | — |
parallel_tool_calls | — | — | — |