Docs

Modelos del clúster.

Modelos de la comunidad. A todos se accede con la misma API compatible con OpenAI y la misma base URL.

deepseek-v4-flash - 305B MoE

generación de texto, chat y visión

Modelo MoE de 305B parámetros, servido en su variante Vision-Exp: acepta imágenes de entrada. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 3B tokens al mes por miembro.

Tipo
MoE (305B total)
Cuantización
FP8
Contexto
1M tokens
Modalidades de entrada
texto · imagen
Modalidades de salida
texto
Cuota mensual
3B tokens / miembro

capacidades

  • Tool calling
  • Modo razonamiento
  • Visión (entrada de imagen)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

mimo-v2.5 - 310B-15B

omnimodal: texto, visión y audio

Modelo MoE de 310B parámetros (15B activos), omnimodal de forma nativa con codificadores dedicados de visión y audio. Contexto de 1M tokens. Tool calling y razonamiento. Cuota de 1.0B tokens al mes por miembro. Licencia MIT.

Tipo
MoE (310B total · 15B activos)
Cuantización
FP8
Contexto
1M tokens
Modalidades de entrada
texto · imagen · audio
Modalidades de salida
texto
Cuota mensual
1.0B tokens / miembro
Licencia
MIT

capacidades

  • Tool calling (function calling)
  • Modo razonamiento (se recomienda max_tokens ≥ 300)
  • Visión (entrada de imagen)
  • Audio (entrada de audio)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

glm5.3 - 753B MoE

generación de texto y chat · coding agéntico

Tier premium: solo se puede llamar con una key de la membresía premium GLM 5.3. Modelo MoE de ~753B parámetros, enfocado a coding y a tareas agénticas de largo recorrido. Contexto de 1M tokens. Entra texto y sale texto: no acepta imágenes. Tool calling y razonamiento (emite una traza de razonamiento). Cuota de 3.000M tokens por miembro, y el contador vuelve a cero cuando empieza tu periodo de facturación. Además tiene un tope de 400M tokens por ventana móvil de 4h, que es el límite con el que topa antes una sesión intensiva de agente de código.

Tipo
MoE (~753B total)
Cuantización
FP8
Atención
Sparse attention
Contexto
1M tokens
Modalidades de entrada
texto
Modalidades de salida
texto
Cuota / periodo de facturación
3.000M tokens / miembro
Ventana móvil de 4h
400M tokens

capacidades

  • Tool calling (function calling)
  • Modo razonamiento (traza de razonamiento)
  • Coding y tareas agénticas de largo recorrido
  • Contexto de 1M tokens
  • Generación en streaming (SSE)
  • Requiere el tier premium GLM 5.3

qwen3.8-flash - 125B-6B

generación de texto, chat y visión

Modelo MoE de 125B parámetros (6B activos), multimodal con visión, tool calling y razonamiento activado por defecto. Contexto de 262K tokens, la ventana nativa del modelo. Cuota de 500M tokens al mes por miembro.

Tipo
MoE (125B total · 6B activos)
Contexto
262K tokens
Modalidades de entrada
texto · imagen
Modalidades de salida
texto
Cuota mensual
500M tokens / miembro
Licencia
qwen-community-1.0

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento (activado por defecto)
  • Visión (entrada de imagen)
  • Contexto de 262K tokens
  • Generación en streaming (SSE)

glm5.3-flash - 320B-18B

generación de texto y chat multimodal

Modelo MoE de 320B parámetros (18B activos), multimodal de forma nativa, con tool calling y razonamiento. Contexto de 1M tokens. Cuota de 2B tokens al mes por miembro. Licencia MIT.

Tipo
MoE (320B total · 18B activos)
Cuantización
FP8
Contexto
1M tokens
Modalidades de entrada
texto · imagen
Modalidades de salida
texto
Cuota mensual
2B tokens / miembro
Licencia
MIT

capacidades

  • Tool calling (function calling)
  • Modo razonamiento
  • Visión (entrada de imagen)
  • Contexto de 1M tokens
  • Generación en streaming (SSE)

gemma4 - 26B-A4B

generación de texto y chat

Modelo MoE de 26B parámetros (4B activos), multimodal con visión. Tool calling y razonamiento.

Tipo
MoE (26B total · 4B activos)
Cuantización
FP8
Contexto
256K tokens
Muestreo
temp=0.6, top_p=0.95
Razonamiento
reasoning_config={}

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento
  • Multimodal (visión / imágenes)
  • Generación en streaming (SSE)

qwen3.6 - 35B-A3B

generación de texto y chat

El modelo insignia. MoE de 35B parámetros, multimodal, con tool calling y razonamiento.

Tipo
MoE (35B total)
Activos por token
3B
Cuantización
FP8
Contexto
256K tokens
Decodificación especulativa
MTP → ~2x de rendimiento
Muestreo
temp=0.6, top_p=0.95
Razonamiento
reasoning_config={}

capacidades

  • Tool calling (formato XML)
  • Modo razonamiento
  • Multimodal (visión / imágenes)
  • Generación en streaming (SSE)

qwen3-embedding - 8B

embeddings vectoriales

Modelo de embeddings vectoriales. Puntuación MMTEB de 70.58, entre los mejores modelos abiertos. Admite más de 100 idiomas, incluidos el español y el código.

Dimensión
4096
Precisión
Float32 (CPU)
RPM
60
Tamaño de lote
32

casos de uso

  • Similitud entre idiomas (ES↔EN: 0.915)
  • Búsqueda semántica
  • Clasificación de texto
  • RAG / recuperación aumentada

rerank - Qwen3-Reranker-8B

reordenado semántico

Modelo de reordenado de 8B parámetros (BF16). Reordena una lista de documentos por relevancia frente a una consulta. Completa el stack de RAG junto a qwen3-embedding: primero recuperas los top-K con embeddings y después reordenas para ganar precisión. Admite más de 100 idiomas, incluidos el español, la recuperación de código y la búsqueda entre idiomas. De los mejores en los benchmarks de reranking de MTEB.

Parámetros
8B
Precisión
BF16
Endpoints
/v1/rerank · /v2/rerank
Idiomas
100+

casos de uso

  • Reordenado en pipelines de RAG (embedding → rerank → LLM)
  • Búsqueda entre idiomas (ES↔EN, etc.)
  • Recuperación de código
  • Puntuación de relevancia consulta-documento

kokoro - v1.0

texto a voz

TTS de 82M parámetros con 67 packs de voces. Latencia por debajo del segundo en CPU.

Latencia
< 1s
Parámetros
82M
RPM
15

voces disponibles

  • af_heart · inglés (femenina)
  • ef_dora · español (femenina)
  • em_alex · español (masculina)
  • 67 packs de voces en total (ver la lista completa)

whisper - large-v3

voz a texto

STT en CPU con CTranslate2 e INT8. Aproximadamente 1x tiempo real. Más de 99 idiomas.

Tamaño
~3 GB (INT8)
WER ES
~3.2%
RPM
10

capacidades

  • Transcripción de audio a texto
  • Más de 99 idiomas
  • Detección automática de idioma
  • API compatible con OpenAI

limitaciones conocidas

Tamaño máximo de fichero: 25 MB
Tamaño máximo por petición. Los formatos comprimidos (OGG/Opus, MP3) aprovechan mucho mejor este límite que un WAV sin comprimir.
Timeout: audios de más de 2 minutos
Whisper procesa en CPU a aproximadamente 1x tiempo real. Con audios de más de 2 minutos, el proxy puede devolver un error 524 (timeout) antes de que termine la transcripción. Usa formatos comprimidos como OGG/Opus y parte los ficheros largos en tramos de 2 minutos o menos para evitarlo.
Formatos recomendados
OGG/Opus y MP3: ficheros más pequeños con la misma calidad de transcripción. Un audio de 60 minutos en OGG/Opus a 48 kbps ocupa unos 20 MB frente a los ~550 MB del WAV.

flux-2-klein

generación de imágenes

Modelo de difusión FLUX para texto a imagen e imagen a imagen. Compatible con la API de Images de OpenAI (/v1/images/generations y /v1/images/edits). Requiere membresía del tier de inferencia.

Tipo
Difusión (FLUX)
Modalidades
texto→imagen · imagen→imagen
Resolución
256 a 1536 px (múltiplos de 16)
Imágenes / petición
1 a 4 (n)
Cuota mensual
100 peticiones / miembro

capacidades

  • Texto a imagen (/v1/images/generations)
  • Imagen a imagen con hasta 4 referencias (/v1/images/edits)
  • Salida como URL temporal (R2, ~60 min) o base64
  • Reproducibilidad con seed y control de guidance

límites por API key

Peticiones / min
60 rpm
Máximo en paralelo
5 concurrentes

glm5.3 · límites del tier premium

Ventana móvil de 4h
400M tokens
Cuota / periodo de facturación
3.000M tokens
Contexto
1M tokens
Peticiones concurrentes
5

400M tokens por ventana móvil de 4 horas es el límite con el que topa antes una sesión intensiva de agente de código, mucho antes que la cuota. Cuando lo alcanzas, las peticiones a glm5.3 se rechazan hasta que la ventana avanza: es una ventana móvil, no un reinicio diario. El contador de la cuota vuelve a cero cuando empieza tu periodo de facturación, y si subes de plan a mitad de periodo esa primera cuota se prorratea a la parte del periodo que has pagado.

tokens / min por modelo

deepseek-v4-flash
1.5M tpm
mimo-v2.5
1.5M tpm
qwen3.6
1.5M tpm
gemma4
1.5M tpm

peticiones / min por modelo

rerank
1000 rpm
nan.builders © 2026
Copied to clipboard