Ir al contenido
  1. Blog/

Todos están construyendo routers de LLM, nosotros deprecamos el nuestro.

·818 palabras·4 mins
Articoli LLM Natural Language Processing Model Routing Foundation Model Machine Learning Go Cloud AI
Articoli Interessanti - Este artículo es parte de una serie.
Parte : Este artículo
Change My Mind meme with the caption: LLM routing doesn’t save money
#### Fuente

Tipo: Artículo Web
Enlace original: https://manifest.build/blog/why-we-deprecated-our-llm-router/
Fecha de publicación: 2026-07-30

Autor: Bruno Perez

Resumen
#

Introducción
#

Imagina construir un sistema que elige automáticamente el modelo de IA más económico para cada solicitud. Parece perfecto sobre el papel: ¿por qué pagar por GPT-4 cuando Claude 3 Haiku podría ser suficiente? Es exactamente lo que muchas empresas están haciendo en estos meses, lanzando routers LLM sofisticados que prometen reducir drásticamente los costos de inferencia. Pero hay un problema: Manifest, una plataforma que construyó y lanzó su router en marzo de 2026, decidió deprecarlo completamente después de solo cuatro meses. Su conclusión es sorprendente y contraintuitiva: para la mayoría de los casos de uso, el routing inteligente no es la solución que parece ser. Este cambio de dirección ofrece una lección importante para cualquiera que esté considerando implementar esta tecnología.

De Qué Trata
#

El artículo de Bruno Perez cuenta la historia detrás de una decisión difícil: por qué Manifest desmanteló una característica que había sido presentada como central en su puerta de enlace LLM. Su router clasificaba cada solicitud en cuatro niveles de complejidad (simple, estándar, complejo y reasoning) para dirigirla al modelo más apropiado. Parece lógico, pero después de cuatro meses de uso entre miles de usuarios en la nube, el equipo descubrió que los beneficios prometidos no se materializaban como se esperaba. En lugar de reducir los costos generales, el routing estaba creando problemas ocultos que compensaban los ahorros aparentes.

Por Qué Es Relevante
#

La relevancia de esta historia va mucho más allá de Manifest. Mientras el mercado de routers LLM explota con nuevos actores que prometen ahorros significativos, esta experiencia real muestra que la realidad es mucho más compleja de lo que parece.

El primer problema es fundamental: la complejidad de una tarea no puede deducirse solo del prompt. Cuando le pides a un modelo que “evalúe y mejore las pruebas de un repositorio”, el nivel de dificultad real depende de factores que emergen solo durante la ejecución: si el repositorio es un simple sitio HTML o el kernel de Linux. El router toma la decisión a ciegas, basándose en información incompleta.

El segundo aspecto es económico pero contraintuitivo: el almacenamiento en caché es mucho más efectivo que el routing para reducir costos. Las lecturas de caché cuestan entre un 90% y un 95% menos que las entradas no almacenadas en caché. Cuando un router mantiene “stickiness” con el mismo modelo para aprovechar el almacenamiento en caché del prompt del sistema e historial de conversación, termina sin hacer routing. En otras palabras, el router logra eficiencia económica dejando de hacer su trabajo principal.

El tercer problema es cualitativo: el routing rompe la coherencia comportamental. Cambiar de un modelo a otro durante una sesión de trabajo degrada la calidad general y aleja a los ingenieros de dominar sus herramientas. Es como pedirle a un pintor que cambie de pincel a mitad de la obra porque uno cuesta menos.

Aplicaciones Prácticas
#

Esta lección es particularmente relevante si estás construyendo sistemas agentic o flujos de trabajo automatizados. Cuando añades una capa de incertidumbre en el routing, todo se vuelve más difícil de mantener: las evaluaciones, los prompts del sistema, la observabilidad. Cada vez que no sabes qué modelo manejó una solicitud, se vuelve más complejo depurar comportamientos anómalos u optimizar el rendimiento.

Para la mayoría de los equipos, la mejor estrategia es elegir conscientemente un modelo probado en batalla y construir alrededor de él. Esto significa invertir tiempo en entender los compromisos entre los modelos disponibles, tal como un artesano sabe exactamente qué herramienta usar. Si el costo es un problema, el enfoque debería estar en estrategias de almacenamiento en caché inteligente y optimización de prompts, no en routing dinámico.

Consideraciones Finales
#

La experiencia de Manifest representa un momento de madurez en la industria de LLM. No todo lo que parece eficiente sobre el papel lo es en la práctica. El routing de LLM probablemente tendrá casos de uso legítimos, pero no es la solución universal que sugiere el marketing de la industria. La verdadera lección es que simplificar a menudo supera a la automatización sofisticada cuando el costo oculto de la automatización es mayor que el beneficio aparente. En un ecosistema donde los modelos evolucionan rápidamente y los costos cambian constantemente, tener control y previsibilidad podría valer mucho más que algunos puntos porcentuales de ahorro económico.

Casos de Uso
#

  • Private AI Stack: Integración en pipelines propietarios
  • Client Solutions: Implementación para proyectos de clientes

Recursos
#

Enlaces Originales
#

Artículo reportado y seleccionado por el equipo Human Technology eXcellence procesado mediante inteligencia artificial (en este caso con LLM HTX-EU-Claude-Haiku-4.5) el 2026-08-18 08:11 Fuente original: https://manifest.build/blog/why-we-deprecated-our-llm-router/

Artículos Relacionados
#

Descubre ORCA de HTX
¿Está tu empresa lista para la IA?
Haz la evaluación gratuita →
Articoli Interessanti - Este artículo es parte de una serie.
Parte : Este artículo