Red de inferencia distribuida

Una API.
Miles de GPUs.

Sauzal conecta computadoras con GPU ociosa alrededor del mundo en una sola red de inferencia. Vos llamás un endpoint; la red decide, en cada momento, qué nodo responde — y la conversación no se entera del cambio.

$curl -X POST sauzal.ai/infer -d model=gemma3:4b -d session_id=conv_8f2a
Por qué es distinto

La red se comporta como un solo GPU, aunque nunca sea el mismo.

Instantáneo

Cada pedido se resuelve en el nodo disponible en ese instante. Sin colas fijas, sin reservar hardware por adelantado.

Distribuido

La conversación no vive en un nodo: vive en el servidor. Dos mensajes de la misma sesión pueden resolverse en dos GPUs distintas sin que se note.

Flexible

Traé tu propio modelo, encadená tareas en paralelo entre varios nodos, o mandá la misma pregunta a tres GPUs y quedate con la primera respuesta.

Dos maneras de entrar

Elegí tu lado de la red.

Para quienes construyen

Necesito cómputo

  • Sesiones con memoria real entre llamadas — no reenviás el historial cada vez
  • Tareas compuestas: batch, fan-out, pipeline, map-reduce, consenso
  • Subí tu propio modelo y corré tu propia inferencia sobre la red
POST https://api.sauzal.ai/infer
Authorization: Bearer sk_live_••••3f2a

{
  "model": "gemma3:4b",
  "prompt": "¿Cuál es mi auto favorito?",
  "session_id": "conv_8f2a"
}
// → resuelto por el nodo disponible,
// con toda la memoria de la sesión
Para quienes tienen hardware ocioso

Tengo una GPU

  • Activación en minutos — el nodo llama al servidor, nunca al revés (no exponés puertos)
  • Telemetría en vivo: VRAM, temperatura, consumo y costo de energía
  • Cobrás por lo que tu GPU realmente aporta a la red, no por tenerla prendida
GPURTX 4070 · 12GB
Horas activa / día · uso de la red~8h · 50%
bruto/mes, antes de electricidad≈ $18–39/mes