Salta al contenuto principale
  1. Blog/

Everyone is building LLM routers, we deprecated ours

·780 parole·4 minuti
Articoli LLM Natural Language Processing Model Routing Foundation Model Machine Learning Go Cloud AI
Articoli Interessanti - This article is part of a series.
Part : This Article
Change My Mind meme with the caption: LLM routing doesn’t save money
#### Fonte

Tipo: Web Article
Link originale: https://manifest.build/blog/why-we-deprecated-our-llm-router/
Data pubblicazione: 2026-07-30

Autore: Bruno Perez

Sintesi
#

Introduzione
#

Immagina di costruire un sistema che automaticamente sceglie il modello AI più economico per ogni richiesta. Sembra perfetto sulla carta: perché pagare per GPT-4 quando Claude 3 Haiku potrebbe bastare? È esattamente quello che molte aziende stanno facendo in questi mesi, lanciando LLM router sofisticati che promettono di ridurre drasticamente i costi di inferenza. Ma c’è un problema: Manifest, una piattaforma che ha costruito e lanciato il suo router nel marzo 2026, ha deciso di deprecarlo completamente dopo soli quattro mesi. La loro conclusione è sorprendente e controintuitiva: per la maggior parte dei casi d’uso, il routing intelligente non è la soluzione che sembra essere. Questo cambio di rotta offre una lezione importante a chiunque stia considerando di implementare questa tecnologia.

Di Cosa Parla
#

L’articolo di Bruno Perez racconta il dietro le quinte di una decisione difficile: perché Manifest ha dismesso una feature che era stata presentata come centrale nella loro LLM gateway. Il loro router classificava ogni richiesta in quattro livelli di complessità (semplice, standard, complesso e reasoning) per indirizzarla al modello più appropriato. Sembra logico, ma dopo quattro mesi di utilizzo tra migliaia di utenti cloud, il team ha scoperto che i benefici promessi non si concretizzavano come atteso. Invece di ridurre i costi complessivi, il routing stava creando problemi nascosti che compensavano i risparmi apparenti.

Perché È Rilevante
#

La rilevanza di questa storia va ben oltre Manifest. Mentre il mercato degli LLM router esplode con nuovi player che promettono risparmi significativi, questa esperienza reale mostra che la realtà è molto più complessa di quanto sembri.

Il primo problema è fondamentale: la complessità di un compito non può essere dedotta dal solo prompt. Quando chiedi a un modello di “valutare e migliorare i test di un repository”, il livello di difficoltà reale dipende da fattori che emergono solo durante l’esecuzione: se il repo è un semplice sito HTML o il kernel Linux. Il router prende la decisione al buio, basandosi su informazioni incomplete.

Il secondo aspetto è economico ma controintuitivo: il caching è molto più efficace del routing per ridurre i costi. Le letture da cache costano tra il 90% e il 95% meno degli input non cachati. Quando un router mantiene “stickiness” con lo stesso modello per sfruttare il caching di system prompt e cronologia conversazionale, finisce per non fare routing. In altre parole, il router raggiunge l’efficienza economica smettendo di fare il suo lavoro principale.

Il terzo problema è qualitativo: il routing rompe la coerenza comportamentale. Saltare da un modello all’altro durante una sessione di lavoro degrada la qualità complessiva e allontana gli ingegneri dal padroneggiare i loro strumenti. È come chiedere a un pittore di cambiare pennello a metà opera perché uno costa meno.

Applicazioni Pratiche
#

Questa lezione è particolarmente rilevante se stai costruendo sistemi agentic o workflow automatizzati. Quando aggiungi un layer di incertezza nel routing, tutto diventa più difficile da mantenere: gli evals, i system prompt, l’osservabilità. Ogni volta che non sai quale modello ha gestito una richiesta, diventa più complesso debuggare comportamenti anomali o ottimizzare le performance.

Per la maggior parte dei team, la strategia migliore è scegliere consapevolmente un modello battle-tested e costruire intorno a quello. Questo significa investire tempo nel capire i trade-off tra i modelli disponibili, proprio come un artigiano conosce esattamente quale strumento usare. Se il costo è un problema, il focus dovrebbe essere su strategie di caching intelligente e sull’ottimizzazione dei prompt, non sul routing dinamico.

Considerazioni Finali
#

L’esperienza di Manifest rappresenta un momento di maturità nel settore degli LLM. Non tutto ciò che sembra efficiente sulla carta lo è nella pratica. Il routing degli LLM avrà probabilmente casi d’uso legittimi, ma non è la soluzione universale che il marketing del settore suggerisce. La vera lezione è che semplificare spesso batte l’automazione sofisticata quando il costo nascosto dell’automazione è più alto del beneficio apparente. In un ecosistema dove i modelli evolvono rapidamente e i costi cambiano costantemente, avere il controllo e la prevedibilità potrebbe valere molto più di qualche percentuale di risparmio economico.

Casi d’uso
#

  • Private AI Stack: Integrazione in pipeline proprietarie
  • Client Solutions: Implementazione per progetti clienti

Risorse
#

Link Originali #

Articolo segnalato e selezionato dal team Human Technology eXcellence elaborato tramite intelligenza artificiale (in questo caso con LLM HTX-EU-Claude-Haiku-4.5) il 2026-08-18 08:11 Fonte originale: https://manifest.build/blog/why-we-deprecated-our-llm-router/

Articoli Correlati
#

Scopri ORCA di HTX
La tua azienda è pronta per l'AI?
Fai l'assessment gratuito →
Articoli Interessanti - This article is part of a series.
Part : This Article