llama 3.2 3b instruct
unofficialchat
llama 3.2 3b instruct specifications
| Context window | 80K |
|---|---|
| Max output tokens | 80000 |
| Release date | — |
| Input | Text |
| Output | Text |
llama 3.2 3b instruct pricing in rubles
You pay for what you use, per token and per unit. The final request cost is returned in the API response.
| Type | Price |
|---|---|
| Input tokens | 6,63 ₽ per 1M tokens |
| Output tokens | 43,55 ₽ per 1M tokens |
Prices are in rubles and may change with exchange rates.
What llama 3.2 3b instruct can do
- Streaming responses
llama 3.2 3b instruct API: connection and code examples
The service exposes a single OpenAI-compatible API. Set our base_url and the key from your dashboard.
OpenAI Python SDK
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.neuralbridge.ru/v1",
)
response = client.chat.completions.create(
model="meta-llama/llama-3.2-3b-instruct-08130",
messages=[{"role": "user", "content": "Привет! Расскажи о себе."}],
)
print(response.choices[0].message.content)Python (requests)
import requests
response = requests.post(
"https://api.neuralbridge.ru/v1/chat/completions",
headers={"Authorization": "Bearer YOUR_API_KEY"},
json={
"model": "meta-llama/llama-3.2-3b-instruct-08130",
"messages": [{"role": "user", "content": "Привет! Расскажи о себе."}],
},
)
print(response.json()["choices"][0]["message"]["content"])cURL
curl https://api.neuralbridge.ru/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "meta-llama/llama-3.2-3b-instruct-08130",
"messages": [{"role": "user", "content": "Привет! Расскажи о себе."}]
}'API endpoints
POST /v1/chat/completionsprimary | Chat Completions Endpoint principal de chat: aceita o histórico de mensagens e devolve a resposta do modelo. Suporta modos streaming e padrão. |
POST /v1/responses | Responses Formato alternativo de chat com estado e saída estruturada. |
POST /v1/messages | Messages Formato Anthropic: o mesmo chat para clientes e SDKs desenvolvidos para Claude. |
POST /v1/converse | Converse Formato Amazon Bedrock Converse — para clientes desenvolvidos para ele. |
POST /v1/converse-stream | Converse Stream Versão streaming do formato Bedrock Converse. |
POST /v1/generateContent | Generate Content Formato Google Gemini — para clientes e SDKs desenvolvidos para ele. |
POST /v1/streamGenerateContent | Stream Generate Content Versão em streaming do formato Gemini. |
Supported request parameters
| Parameter | Default | Allowed values | Description |
|---|---|---|---|
temperature | 1 | — | Afeta a diversidade da resposta: quanto maior o valor, mais aleatória a saída; quanto menor, mais previsível. |
top_p | 1 | — | Limita a seleção das frações dos tokens mais prováveis: são considerados apenas aqueles cujas probabilidades somam até P. |
max_tokens | — | — | Limite superior do número de tokens que o modelo pode gerar na resposta. |
presence_penalty | 0 | — | Reduz a probabilidade de um token se ele já apareceu no texto — o modelo tende a mudar para novos tópicos. |
frequency_penalty | 0 | — | Reduz a probabilidade do token proporcionalmente à frequência com que já apareceu — combate repetições. |
stop | — | — | Lista de strings delimitadoras: a geração é interrompida assim que o modelo produz qualquer uma delas. |
seed | — | — | Fixa a aleatoriedade: uma nova solicitação com o mesmo seed e os mesmos parâmetros produz o mesmo resultado. |
response_format | — | — | Formato da resposta: texto simples ou JSON estrito conforme o esquema definido. |
stream | false | — | Enviar a resposta como fluxo à medida que é gerada, em vez de um único bloco ao final. |