Un único endpoint para los mejores modelos open-source. Una suscripción nan.builders repartida entre 4 usuarios — pagás una fracción y accedés a modelos premium que, al retail, costarían una fortuna.
AutisticInference es un proxy OpenAI-compatible que rutea tus peticiones a nan.builders, la comunidad de inferencia más rápida de habla hispana. En lugar de pagar cada API por separado, compartimos una suscripción premium entre 4 usuarios.
Modelos cuantizados FP8 con speculative decoding. 1.5M tokens/minuto de throughput y latencia sub-segundo en streaming SSE.
Compatible con cualquier cliente que hable OpenAI o Anthropic: pi, fx, Claude Code, Codex, opencode, Cursor, LangChain… solo cambiás el base_url.
Cifrado de extremo a extremo sobre Tailscale. Tus prompts nunca tocan la red pública. Acceso restringido por ACL y tailnet-lock.
GLM, Qwen, DeepSeek y MIMO emiten trazas de reasoning. Tool-calling nativo, visión y audio en modelos multimodales.
LiteLLM reparte el budget entre los 4 usuarios en partes iguales. Nadie se come el presupuesto de otro. Contador mensual.
Límite de 2 peticiones paralelas por usuario para que nan.builders (5 concurrentes globales) no se sature.
Si habla la API de OpenAI o Anthropic, funciona. Acá los cinco agentes de código con guías paso a paso en la docs.
Cuotas mensuales totales de la suscripción (1 miembro). Cada usuario recibe exactamente ¼ de cada límite. Los modelos ilimitados son de uso libre para todos.
| Modelo | Tipo | Contexto | Cuota / usuario | Límite global | Modalidades |
|---|---|---|---|---|---|
| glm-5.2 | 753B MoE · coding | 500K | 750M tok | 400M / 4h · 5 conc. | texto |
| qwen-3.6 | 35B flagship | 256K | ilimitado | 1.5M tpm | texto · imagen |
| deepseek-v4-flash | 284B MoE · 21B act. | 1M | 500M tok | 1.5M tpm | texto |
| mimo-v2.5 | 310B omnimodal | 1M | 250M tok | 1.5M tpm | texto · imagen · audio |
| gemma-4 | 26B · ligero | 256K | ilimitado | 1.5M tpm | texto |
tpm = tokens por minuto · conc. = peticiones concurrentes. La cuota de glm-5.2 incluye 400M tokens en una ventana rodante de 4h compartida entre los 4 usuarios.
Calculamos el valor de tu cuota mensual a precio oficial de API de cada fabricante (Z.ai, DeepSeek, Xiaomi, Alibaba). La suscripción nan.builders de 200€ se reparte entre 4 — vos pagás 1/4 y recibís 1/4 de cada cuota.
| Modelo | Tu cuota/mes | Precio oficial API | Valor retail |
|---|---|---|---|
| glm-5.2 Z.ai premium |
750M tokens | $1.19 in / $3.74 out por M | ~$1849 |
| deepseek-v4-flash DeepSeek API |
500M tokens | $0.08 in / $0.16 out por M | ~$60 |
| mimo-v2.5 Xiaomi MiMo |
250M tokens | $0.14 in / $0.28 out por M | ~$52 |
| qwen-3.6 ilimitado Alibaba DashScope |
∞ (muestra: 100M) | $0.19 in / $1.13 out por M | ~$66 / 100M · y sigue |
| gemma-4 ilimitado | ∞ | — | incluido |
| Valor retail total / mes → | ~$2027 | ||
Valores calculados con el precio oficial de API de cada proveedor (input+output promediados 50/50). Qwen 3.6 es ilimitado: el cálculo de 100M es solo ilustrativo — tu valor real es superior.
Una de las 4 plazas. Recibés ~$2027/mes en tokens a precio oficial de API por €50. Cuota equitativa, dashboard y acceso privado por Tailscale.
Lo mismo pagando por token en las APIs oficiales de cada proveedor.
Te invitamos a Tailscale. Instalás el cliente, te conectás y ya estás dentro de la red privada del grupo. Sin exponer nada a internet.
Te creamos un usuario en el proxy LiteLLM con tu cuota pre-configurada. Te logueás en el área privada y copiás tu key personal.
Apuntás tu herramienta favorita a http://llm-inference:4000/v1 y listo. Mismos parámetros que OpenAI.