ANTARES: il copilota di rete che porta l’AI nei data centre GARR
| Erika Trotto | Networking
Un sistema multi-agente che introduce intelligenza e collaborazione nell’analisi della rete. Il lavoro di Francesco Lombardo (team Data Centre Network GARR).
Nel mondo delle reti complesse, dove infrastrutture distribuite e servizi critici richiedono continuità e precisione assoluta, l’automazione è da tempo una componente essenziale.
Tuttavia, negli scenari più dinamici e meno prevedibili, i workflow predefiniti non sono più sufficienti. In questo contesto prende forma Antares, un sistema multi-agente basato su intelligenza artificiale sviluppato all’interno di GARR. Il progetto nasce con l’obiettivo di portare gli agenti AI nei processi di analisi e troubleshooting della rete nei data centre, introducendo un livello di intelligenza sopra l’automazione tradizionale.
Non si tratta di sostituire gli strumenti esistenti, ma di affiancarli con un sistema capace di interpretare le richieste, ragionare su più fonti e orchestrare azioni complesse in modo dinamico. Antares si configura così come un Network Co-Pilot, in grado di supportare gli operatori trasformando l’interazione con la rete da sequenza di comandi a processo guidato dall’intento.
Un cambio di paradigma: dall’automazione agli agenti AI
Come spiega Francesco Lombardo del team Data Centre Network GARR, l’automazione tradizionale si basa su procedure rigide e input strutturati: è affidabile, ma poco flessibile quando lo scenario cambia o i dati non sono completamente prevedibili. Con gli agenti AI il paradigma si evolve. Non si eseguono più semplici comandi, ma si parte da un obiettivo che il sistema è in grado di comprendere, scomporre e tradurre in una sequenza di azioni. In questo passaggio, il focus si sposta dall’esecuzione imperativa “esegui questo script” a un approccio basato sull’intento “analizza perché questa sessione BGP non è attiva”.
I building block di Antares
Agenti AI: ragionare e agire. Un agente AI non coincide con un semplice modello linguistico (LLM). È un sistema che combina capacità di ragionamento e strumenti operativi. Da un lato interpreta l’intento, pianifica i passaggi e analizza i dati, dall’altro interagisce concretamente con l’infrastruttura attraverso API, esecuzione di script e interrogazione di sistemi e documentazione. In questo modo si passa da un modello statico a un sistema che agisce come un copilota operativo.
RAG: collegare l’AI alla conoscenza interna. Il Retrieval-Augmented Generation (RAG) consente di collegare il modello a delle informazioni interne di GARR. La documentazione, le topologie e le procedure operative diventano parte del contesto a disposizione degli agenti, riducendo il rischio di risposte generiche e migliorando l’aderenza alla realtà dell’infrastruttura.
LangGraph: orchestrare processi complessi. Il terzo pilastro è LangGraph, framework che permette di costruire sistemi di agenti stateful e orchestrati. Il troubleshooting di rete non è un processo lineare, ma una sequenza iterativa di decisioni. Con LangGraph, ogni passaggio dipende dall’esito del precedente: esecuzione di uno strumento, analisi del risultato e scelta del passo successivo.
Skills: documentazione che si esegue. Un quarto elemento distintivo di Antares è il sistema di skill: procedure operative articolate in più passaggi, scritte in formato markdown dagli stessi ingegneri di rete, che rendono le procedure complesse interpretabili dagli agenti. Una skill non è uno script rigido né un prompt generico: è logica condizionale e competenza specialistica espressa in linguaggio naturale strutturato, versionata su Git, testabile e condivisibile. L’agente legge la skill, la interpreta e la esegue adattandosi al contesto reale. Questo approccio sposta il controllo della conoscenza operativa direttamente nelle mani di chi la possiede: gli esperti di dominio definiscono i workflow, l’AI li esegue.
Antares è strutturato come un ecosistema di agenti specializzati coordinati da un agente supervisore. Questo supervisore agisce come un project manager: interpreta la richiesta iniziale, pianifica le attività e le assegna agli agenti più adatti. Accanto a lui operano diversi specialisti: agenti di rete dedicati ai principali vendor (Arista, Cisco e Juniper), un agent documentale basato su RAG per la conoscenza interna, agenti per l’analisi dei log e dei sistemi di monitoraggio. Il supervisor dispone, inoltre, di strumenti diretti per interrogare NetBox (inventory di dispositivi, siti e IPAM) senza necessità di un agente dedicato.
Il risultato è un processo di diagnosi progressivo, non uno script statico, ma un ciclo di ragionamento che evolve in base ai dati raccolti. In questo flusso, l’elemento umano resta centrale: l’operatore può intervenire, validare e guidare il sistema in ogni fase.
Architettura e deployment
Il sistema è interamente ospitato nell’ecosistema GARR, senza dipendenze da cloud pubblici esterni. La componente di inferenza LLM vive sulla GARR Cloud, dove sono disponibili risorse GPU dedicate (NVIDIA A100), adottando Ollama come interfaccia di erogazione. La logica degli agenti e l’accesso ai sistemi di rete operano invece su un data centre interno GARR, in un ambiente isolato destinato ai servizi interni. Questa separazione garantisce sovranità del dato, nessuna dipendenza da vendor esterni e controllo completo sull’intera infrastruttura.
Lo stack tecnologico di Antares si articola su più livelli. L’orchestrazione degli agenti è gestita da LangGraph, mentre Redis supporta la gestione dello stato e della memoria conversazionale. La componente di intelligenza artificiale si basa su Ollama per l'esecuzione dei modelli linguistici, come GPT-OSS 120B e Gemma4, e su nomic-embedding per la generazione delle rappresentazioni vettoriali, archiviate nel database vettoriale ChromaDB. L'interfaccia utente è realizzata con OpenWebUI. Sul fronte infrastrutturale, il sistema integra strumenti come Terraform, Docker e Ansible, oltre a connessioni verso NetBox e i sistemi dei vendor tramite API o SSH.
L’impatto del progetto, lo stato e gli sviluppi futuri
Le attività di analisi che richiedevano minuti o ore possono essere completate in pochi secondi. Il sistema non solo accelera le operazioni, ma rende anche più accessibili diagnosi complesse a operatori meno esperti, mantenendo coerenza e ripetibilità dei risultati. Come sottolinea Francesco Lombardo: “Antares non nasce per sostituire il lavoro degli ingegneri di rete, ma per amplificarne le capacità. L’obiettivo è passare da un modello basato su comandi e procedure a un approccio guidato dall’intento, in cui l’AI supporta l’analisi e accelera le decisioni, mantenendo sempre il controllo umano al centro del processo”.
Antares è attualmente in fase di prototipo funzionante: diversi agenti sono già operativi con 38 strumenti distribuiti su tre produttori e l'intera infrastruttura LLM è ospitata all'interno dell'infrastruttura GARR, senza dipendere da servizi cloud esterni.
La Direttrice GARR Claudia Battista e il CTO GARR Massimo Carboni in un momento del Workshop GARR 2025
Lo sviluppo del progetto si muove su più fronti. Nel breve periodo, il focus è sull’arricchimento della libreria di skill — i workflow complessi che codificano l’expertise dei network engineer — e sul production hardening del sistema in termini di alta disponibilità e fault tolerance.
Sul fronte infrastrutturale, è in corso la valutazione di un cluster di inferenza basato su vLLM con KV cache routing, che permetterebbe di gestire richieste concorrenti in modo più efficiente rispetto all’attuale istanza singola.
La direzione di ricerca più interessante riguarda l’orchestrazione multi-modello: anziché affidarsi a un unico LLM per tutti i casi d’uso, l’obiettivo è costruire un portfolio di modelli open-source self-hosted (modelli leggeri per query semplici e veloci e modelli più capaci per ragionamenti complessi) con routing automatico basato sulla complessità della richiesta. Un approccio pragmatico che mantiene il controllo completo sull’infrastruttura e zero dipendenze da API esterne.
Le lezioni emerse finora evidenziano il ruolo centrale dell’architettura rispetto al singolo modello, l’importanza dell’osservabilità nei sistemi complessi e il valore di un approccio ibrido tra AI e codice tradizionale. Fondamentale anche il design degli strumenti, che devono essere pensati non solo per esporre dati, ma per renderli realmente utilizzabili dagli agenti. Infine, e forse più importante: sono le conoscenze specialistiche del settore a definire cosa significa “buono”; l’AI lo abilita, non lo sostituisce.
In breve
Che cos'è Antares?
Antares è un sistema multi-agente basato su AI, sviluppato da GARR con l'obiettivo di supportare con agenti AI i processi di analisi e troubleshooting della rete dei data centre.
Come funziona?
Antares è un ecosistema di agenti specializzati coordinati da un agente supervisore; questa struttura permette un processo di diagnosi progressivo, non uno script statico ma un ciclo di ragionamento che evolve in base ai dati raccolti.
Come si integra nelle attività?
Antares supporta il lavoro degli ingegneri di rete nell'analisi e nelle decisioni, amplificandone le capacità e mantenendo il controllo umano al centro del processo.




