Tipo: Web Article
Link originale: https://manifest.build/blog/why-we-deprecated-our-llm-router/
Data pubblicazione: 2026-07-30
Autore: Bruno Perez
Sintesi #
Introduzione #
Immagina di costruire un sistema che automaticamente sceglie il modello AI più economico per ogni richiesta. Sembra perfetto sulla carta: perché pagare per GPT-4 quando Claude 3 Haiku potrebbe bastare? È esattamente quello che molte aziende stanno facendo in questi mesi, lanciando LLM router sofisticati che promettono di ridurre drasticamente i costi di inferenza. Ma c’è un problema: Manifest, una piattaforma che ha costruito e lanciato il suo router nel marzo 2026, ha deciso di deprecarlo completamente dopo soli quattro mesi. La loro conclusione è sorprendente e controintuitiva: per la maggior parte dei casi d’uso, il routing intelligente non è la soluzione che sembra essere. Questo cambio di rotta offre una lezione importante a chiunque stia considerando di implementare questa tecnologia.
Di Cosa Parla #
L’articolo di Bruno Perez racconta il dietro le quinte di una decisione difficile: perché Manifest ha dismesso una feature che era stata presentata come centrale nella loro LLM gateway. Il loro router classificava ogni richiesta in quattro livelli di complessità (semplice, standard, complesso e reasoning) per indirizzarla al modello più appropriato. Sembra logico, ma dopo quattro mesi di utilizzo tra migliaia di utenti cloud, il team ha scoperto che i benefici promessi non si concretizzavano come atteso. Invece di ridurre i costi complessivi, il routing stava creando problemi nascosti che compensavano i risparmi apparenti.
Perché È Rilevante #
La rilevanza di questa storia va ben oltre Manifest. Mentre il mercato degli LLM router esplode con nuovi player che promettono risparmi significativi, questa esperienza reale mostra che la realtà è molto più complessa di quanto sembri.
Il primo problema è fondamentale: la complessità di un compito non può essere dedotta dal solo prompt. Quando chiedi a un modello di “valutare e migliorare i test di un repository”, il livello di difficoltà reale dipende da fattori che emergono solo durante l’esecuzione: se il repo è un semplice sito HTML o il kernel Linux. Il router prende la decisione al buio, basandosi su informazioni incomplete.
Il secondo aspetto è economico ma controintuitivo: il caching è molto più efficace del routing per ridurre i costi. Le letture da cache costano tra il 90% e il 95% meno degli input non cachati. Quando un router mantiene “stickiness” con lo stesso modello per sfruttare il caching di system prompt e cronologia conversazionale, finisce per non fare routing. In altre parole, il router raggiunge l’efficienza economica smettendo di fare il suo lavoro principale.
Il terzo problema è qualitativo: il routing rompe la coerenza comportamentale. Saltare da un modello all’altro durante una sessione di lavoro degrada la qualità complessiva e allontana gli ingegneri dal padroneggiare i loro strumenti. È come chiedere a un pittore di cambiare pennello a metà opera perché uno costa meno.
Applicazioni Pratiche #
Questa lezione è particolarmente rilevante se stai costruendo sistemi agentic o workflow automatizzati. Quando aggiungi un layer di incertezza nel routing, tutto diventa più difficile da mantenere: gli evals, i system prompt, l’osservabilità. Ogni volta che non sai quale modello ha gestito una richiesta, diventa più complesso debuggare comportamenti anomali o ottimizzare le performance.
Per la maggior parte dei team, la strategia migliore è scegliere consapevolmente un modello battle-tested e costruire intorno a quello. Questo significa investire tempo nel capire i trade-off tra i modelli disponibili, proprio come un artigiano conosce esattamente quale strumento usare. Se il costo è un problema, il focus dovrebbe essere su strategie di caching intelligente e sull’ottimizzazione dei prompt, non sul routing dinamico.
Considerazioni Finali #
L’esperienza di Manifest rappresenta un momento di maturità nel settore degli LLM. Non tutto ciò che sembra efficiente sulla carta lo è nella pratica. Il routing degli LLM avrà probabilmente casi d’uso legittimi, ma non è la soluzione universale che il marketing del settore suggerisce. La vera lezione è che semplificare spesso batte l’automazione sofisticata quando il costo nascosto dell’automazione è più alto del beneficio apparente. In un ecosistema dove i modelli evolvono rapidamente e i costi cambiano costantemente, avere il controllo e la prevedibilità potrebbe valere molto più di qualche percentuale di risparmio economico.
Casi d’uso #
- Private AI Stack: Integrazione in pipeline proprietarie
- Client Solutions: Implementazione per progetti clienti
Risorse #
Link Originali #
- Everyone is building LLM routers, we deprecated ours - Link originale
Articolo segnalato e selezionato dal team Human Technology eXcellence elaborato tramite intelligenza artificiale (in questo caso con LLM HTX-EU-Claude-Haiku-4.5) il 2026-08-18 08:11 Fonte originale: https://manifest.build/blog/why-we-deprecated-our-llm-router/
Articoli Correlati #
- Nativ — Run AI locally on your Mac - Foundation Model, LLM, Computer Vision
- GDPR e Intelligenza Artificiale: Guida Pratica per Aziende Europee - GDPR, AI Act, Compliance
- Google Antigravity - Go