Si estás manejando múltiples proveedores de modelos, la propuesta práctica aquí es consolidación sin costo adicional. Este gateway de código abierto coloca tus modelos autohospedados, de frontera y de código abierto detrás de una interfaz única, y normaliza las diferencias molestas entre proveedores: formatos de streaming, sintaxis de llamadas de herramientas, nombres de parámetros, límites de velocidad y manejo inconsistente de errores. Es la infraestructura que la mayoría de los equipos terminan reconstruyendo internamente.

Escrito en Rust y construido para concurrencia, lo que se refleja en los números: el equipo afirma menos de 1 ms de latencia agregada para solicitudes con clave propia y menos de 2 ms cuando el servicio proporciona la clave del proveedor. El catálogo cubre cada proveedor de inferencia importante y más de 1.000 modelos, actualizados diariamente por un agente que abre un pull request cuando aparecen modelos nuevos. En la práctica, esto significa menos mantenimiento manual para mantener tu lista de modelos actualizada.

Lo que diferencia esta herramienta de otras similares es el modelo de negocio y la capa de enrutamiento. Es completamente de código abierto, no cobra margen sobre tokens y te permite combinar modelos locales con un marketplace. Su argumento es directo: el enrutamiento básico no justifica un recargo del 10% en tokens, y es un punto válido si ejecutas alto volumen.

Un gateway de modelos de código abierto en Rust que enruta solicitudes y convierte tu tráfico en un modelo optimizado

La afirmación sobre enrutamiento más inteligente es donde se pone interesante. Utilizando trazas OpenTelemetry estandarizadas, el sistema extrae tareas representativas reales, simula cómo diferentes modelos las manejarían, califica resultados con un juez LLM y ajusta un clasificador de vecino más cercano sobre embeddings de prompts para elegir el mejor modelo por solicitud. El objetivo es una curva de Pareto costo/calidad mejor que fijar todo a un modelo. No será perfecto, pero como heurística inicial puede detectar casos donde un modelo más barato es suficientemente bueno.

Los mismos datos de simulación alimentan otros resultados: sugerencias de optimización de aciertos de caché, recomendaciones para nuevos modelos a probar y entrenamiento opcional de un modelo ajustado a tu tráfico. Nota el marco de participación voluntaria: tus solicitudes solo se usan para esto si lo eliges, lo que vale la pena confirmar antes de enrutar tráfico de producción.

Qué puedes hacer con esto: autohospedarlo en tu propia infraestructura para control total, o usar la versión alojada sin margen si prefieres evitar las operaciones. De cualquier forma, comienza dirigiendo tráfico no crítico a través de él para verificar las afirmaciones de latencia y ver si el enrutamiento realmente mejora tu costo por calidad antes de comprometer cargas de trabajo reales.