Apprendimento per rinforzo profondo multi-agente distribuito per l'anti-jamming: spettro, LEO e droni

Il reinforcement learning multi-agente distribuito sta ridefinendo l'anti-jamming: satelliti LEO, droni e radio cognitive imparano ad accedere allo spettro senza un piano di frequenze manuale. Ecco meccanismi, algoritmi e numeri reali.
Perché le reti di satelliti LEO sono così vulnerabili al jamming e all'interferenza co-canale?
I satelliti LEO viaggiano a poche centinaia di chilometri dalla superficie, e questo li espone parecchio: qualsiasi collegamento finisce prima o poi nel raggio d'azione di interferenze basate a terra. C'è poi un secondo punto debole, forse ancora più insidioso: le traiettorie orbitali sono altamente prevedibili, quindi pianificare un disturbo intenzionale diventa molto più semplice di quanto si pensi. E non è finita qui. Decine, a volte centinaia di satelliti condividono fasci e frequenze sovrapposti, per cui all'interferenza co-canale si somma il jamming vero e proprio.
Il vero punto debole, me ne rendo conto ogni volta che lavoro con le architetture di rete satellitare, è questo: basta un solo collegamento inter-satellite compromesso e il guasto si propaga a cascata su tutta la regione. Perché la rete non è un insieme di nodi che se ne stanno ognuno per conto proprio, è un sistema interconnesso dove tutto si tiene. Tradotto in pratica? Proteggere un singolo canale o un terminale non serve a niente. Quello che serve davvero è una politica di accesso allo spettro capace di adattarsi in tempo reale, perché le interferenze cambiano continuamente e non si possono prevedere in anticipo.
Come l'apprendimento per rinforzo multi-agente abilita l'accesso allo spettro anti-jamming?
In una costellazione LEO ogni satellite — o ogni radio — si comporta come un agente autonomo, e decide basandosi solo su ciò che riesce a osservare localmente: la potenza ricevuta, i livelli di interferenza misurati sul canale, lo stato delle code di trasmissione, la propria posizione orbitale o geografica. Non è un dettaglio da poco. Sotto jamming, infatti, anche i collegamenti verso un coordinatore centrale possono essere disturbati o saltare del tutto; affidarsi unicamente a ciò che l'agente percepisce sul posto rende quindi l'intero sistema molto più robusto. C'è però una fase, quella di addestramento, in cui entra in scena un critico centralizzato: è lui a valutare il risultato congiunto delle azioni di tutti gli agenti e a restituire un segnale di apprendimento che tiene conto dell'effetto collettivo, non solo di quello del singolo. Così, episodio dopo episodio, gli agenti imparano politiche di accesso allo spettro e di puntamento dei fasci capaci di schivare il jamming e l'interferenza co-canale, senza che nessuno abbia progettato a mano un piano di frequenze. La coordinazione, in sostanza, emerge dall'esperienza condivisa e non da regole imposte dall'esterno.
È proprio questo approccio distribuito a rendere il sistema robusto: la politica di decisione non dipende da un collegamento verso un controllore centrale che, in un ambiente conteso, rischierebbe di essere disturbato a sua volta. Li et al. (IEEE, 2026) hanno proposto DMDRLA, un metodo di anti-jamming basato su DRL multi-agente distribuito pensato per le costellazioni LEO mega: le simulazioni mettono a confronto il costo di addestramento con l'ottimizzazione delle prestazioni, cercando un equilibrio tra i due. Cao et al., invece, su MDPI Electronics 14(16):3307 del 2025, applicano una value decomposition network all'accesso allo spettro anti-jamming nelle reti satellitari LEO.
Che ruolo gioca l'addestramento centralizzato con esecuzione decentralizzata?
Il CTDE — centralized training with decentralized execution — è quel compromesso che rende l'anti-jamming multi-agente praticabile su scala reale. In fase di addestramento c'è un critico centralizzato che osserva lo stato congiunto e le ricompense di tutti gli agenti, così può valutare come le azioni individuali incidono sul risultato collettivo: l'apprendimento resta stabile e la coordinazione ne beneficia. In esecuzione, però, la rete centrale sparisce. Ogni satellite si arrangia con la propria politica e con quello che vede in locale — potenza ricevuta, livelli di interferenza, stato delle code, posizione. I vantaggi sono due, e nemmeno banali. Primo: si elimina la dipendenza da un collegamento attivo verso un controllore a terra o verso tutti gli altri satelliti, che in un ambiente contestato sarebbe probabilmente il primo bersaglio del jammer. Secondo: cala il volume di comunicazione necessario, dettaglio tutt'altro che secondario quando si parla di costellazioni con decine o centinaia di nodi. È la stessa impostazione scelta da Cao et al. (MDPI Electronics, 2025) per l'accesso allo spettro anti-jamming nelle reti LEO, dove il CTDE migliora l'efficienza di addestramento e riduce l'overhead di comunicazione, e da Nguyen et al. (arXiv 2512.08341, IEEE ICC 2026) nei relay UAV sotto jamming, dove gli agenti tirano fuori una strategia anti-jamming emergente senza che sia stata programmata esplicitamente. Il conto da pagare è computazionale: addestrare un critico centralizzato costa tempo e campioni, e la qualità della credit assignment dipende da come il valore congiunto viene scomposto tra i singoli agenti.
In pratica, questa architettura separa in modo netto due momenti che spesso vengono confusi. Da una parte c'è la fase di addestramento, in cui un critico centrale può osservare lo stato globale del sistema: pensiamo all'insieme delle interferenze, alle condizioni di canale di più nodi, alle azioni congiunte degli agenti. Dall'altra c'è la fase operativa, dove ogni satellite, UAV o radio cognitiva decide in autonomia basandosi solo sulle proprie osservazioni locali, ossia potenza ricevuta, livello di interferenza, stato delle code e posizione. Il vantaggio è duplice. Da un lato si sfruttano informazioni privilegiate che a runtime non sarebbero disponibili; dall'altro si evita di dipendere da collegamenti di comunicazione che, in uno scenario di jamming, potrebbero essere i primi a saltare. È una separazione elegante tra il momento in cui il sistema impara e quello in cui agisce, e proprio per questo CTDE è diventato lo schema dominante nell'anti-jamming multi-agente: permette di coordinare decine o addirittura centinaia di nodi senza bisogno di uno scambio continuo di messaggi in volo, mantenendo l'esecuzione leggera, distribuita e resiliente anche quando la rete è sotto attacco.
Quali algoritmi alimentano l'anti-jamming distribuito: VDN, QMix e MP-DQN
Il punto chiave di tutta la coordinazione è come si scompone il valore. La value decomposition network, cioè VDN, prende la funzione di valore-azione congiunta e la spezza in valori per singolo agente: così diventa possibile assegnare il credito su decine, persino centinaia di nodi. In sostanza, ogni satellite o radio impara a capire quanto pesa il proprio contributo sul risultato collettivo, senza dover osservare l'intero stato globale. È esattamente la strada scelta da Cao et al. per l'accesso allo spettro anti-jamming nelle reti LEO: qui la scomposizione tiene il training sotto controllo anche quando il numero di agenti sale. QMix va oltre, aggiungendo una mixing network più espressiva, in grado di cogliere interazioni non lineari tra gli agenti che la semplice somma pesata della VDN non riesce a rappresentare. Ed è proprio per questa maggiore flessibilità che Cai et al. (2025) l'hanno applicato al processo decisionale di jamming cooperativo, dove una coordinazione fine tra più nodi è ciò che separa una contromisura efficace da una collisione di spettro.
Wang et al. (2025) hanno sviluppato un algoritmo di reinforcement learning multi-agente con un obiettivo preciso: rendere l'addestramento in scenari anti-jamming più stabile e più rapido. L'idea di fondo non è solo quella di riproporre le transizioni più informative tramite prioritized experience replay, ma di affiancarvi altri due meccanismi. Da un lato c'è una regolarizzazione entropica, che serve a mantenere un certo margine di esplorazione anche quando la politica inizia a irrigidirsi; dall'altro un reward centering, che normalizza i segnali di ricompensa e riduce la varianza tra agenti che inseguono obiettivi diversi. Zhang et al. (2021), invece, si sono concentrati sull'accesso ai canali anti-jamming in contesti multi-utente con canali parzialmente sovrapposti (POC). È una situazione piuttosto realistica, in cui le trasmissioni non sono né del tutto separate né del tutto in conflitto, e la difficoltà sta nel coordinare più utenti che competono per lo stesso spettro senza pestarsi i piedi a vicenda. La tabella che segue raccoglie i riferimenti principali e il contributo di ciascuno.
| Riferimento | Contributo principale |
|---|---|
| Wang et al. (2025) | Algoritmo MARL con prioritized experience replay, regolarizzazione entropica e reward centering |
| Zhang et al. (2021) | Accesso ai canali anti-jamming multi-utente con canali parzialmente sovrapposti (POC) |
Quali guadagni di prestazioni e compromessi riportano le simulazioni?
Nguyen et al. (arXiv 2512.08341, inviato il 9 dicembre 2025, per IEEE ICC 2026) hanno applicato il paradigma CTDE — ossia addestramento centralizzato con esecuzione decentralizzata — a reti di relay UAV collaborative sotto jamming. In pratica, durante la fase di training un critico centralizzato valuta l'esito congiunto delle azioni, mentre in esercizio ogni drone decide in autonomia sulla base delle proprie osservazioni locali. I risultati parlano di circa il 50% in più di throughput totale di sistema e di un tasso di collisione quasi nullo. Il dato più interessante, però, non è numerico ma qualitativo: gli agenti sviluppano una strategia anti-jamming emergente, coordinata senza che sia stata programmata esplicitamente. È uno dei risultati più concreti disponibili pubblicamente e conferma quanto il CTDE convenga in scenari dove i link di coordinamento sarebbero essi stessi vulnerabili al jamming.
Il nodo centrale rimane sempre lo stesso: coordinarsi conviene, perché permette di reagire al jamming in modo più efficace e collettivo, ma questa cooperazione ha un prezzo in termini di tempo di addestramento e di campioni necessari per convergere. In pratica, ogni agente deve imparare non solo a difendersi dalle interferenze, ma anche a tenere conto delle scelte degli altri nodi, e questo allunga il percorso di apprendimento. Elleuch et al. (2021) hanno studiato proprio questo scenario, analizzando il RL multi-agente distribuito anti-jamming in cui gli utenti apprendono in modo cooperativo. Nelle loro simulazioni, l'approccio cooperativo ha prodotto tassi di trasmissione più alti, ha eliminato l'interferenza reciproca tra gli utenti e ha mostrato la velocità di convergenza più elevata tra i metodi messi a confronto. È un risultato che conferma come la coordinazione, pur costosa in fase di training, possa ripagare in termini di prestazioni una volta che gli agenti hanno appreso una strategia condivisa.
Come differiscono le applicazioni anti-jamming per relay UAV e radar?
Nel campo dei sistemi aerei senza pilota, Aref et al. affrontano il problema dell'anti-jamming ricorrendo a radio cognitive autonome a banda larga (WACR) calate in un ambiente multi-agente, dove più nodi intelligenti devono imparare a convivere nello stesso spettro. L'obiettivo non è solo respingere un attacco intenzionale, ma trovare politiche ottimali che bilancino due esigenze in tensione tra loro: massimizzare la resilienza al jamming e, allo stesso tempo, evitare l'interferenza reciproca tra gli stessi utenti. È qui che emerge il valore dell'apprendimento multi-agente: invece di ottimizzare un singolo radio isolato, il sistema cerca un equilibrio collettivo, perché le decisioni di un nodo ricadono inevitabilmente sugli altri. Su un piano complementare, la survey di Yang et al. (arXiv 2508.11687, 11 agosto 2025) offre una cornice teorica più ampia, formalizzando gli agenti anti-jamming intelligenti per le comunicazioni UAV attraverso un ciclo chiuso Percezione-Decisione-Azione. In questo schema, l'agente osserva l'ambiente radio, decide come agire e verifica l'esito, aggiornando di conseguenza la propria strategia; la teoria dei giochi fornisce il linguaggio per modellare l'interazione strategica tra jammmer e comunicatori, mentre il reinforcement learning offre gli strumenti pratici per apprendere tali politiche sul campo. Le due prospettive si integrano: Aref et al. mostrano il "come" applicativo su radio cognitive, Yang et al. ne delineano il "perché" teorico e il quadro di riferimento per i droni.
Nel dominio radar, Feng Xie et al. (Journal of Radars, 12(6):1290-1304, 2023) propongono un DRL nel dominio complesso per il radar anti-jamming a frequenza agile: il tempo medio di decisione si riduce a 405,3 ms rispetto a due algoritmi RL classici. Janiar et al. (2023) aggiungono il transfer learning, così un agente DRL impara rapidamente in reti wireless dinamiche sotto attacchi di jamming. La differenza chiave è il vincolo temporale: il radar richiede decisioni in millisecondi, mentre le reti satellitari possono pianificare su orizzonti più lunghi.
Quali numeri e riferimenti conviene tenere a mente
Per chi progetta o valuta queste architetture, i riferimenti chiave sono pochi ma densi. La tabella qui sotto raccoglie i lavori citati, l'anno e il contributo principale, utile come mappa rapida del settore.
Domande frequenti sull'anti-jamming multi-agente
Le domande che ricevo più spesso riguardano il funzionamento pratico, i guadagni misurabili e i limiti di questi sistemi. Qui sotto trovi le risposte sintetiche, basate sui lavori citati e sulle simulazioni pubblicate.
Domande frequenti
Come abilita l'apprendimento per rinforzo multi-agente l'accesso allo spettro anti-jamming?
Ogni satellite o radio agisce come agente usando solo osservazioni locali come potenza ricevuta, livelli di interferenza, stato delle code e posizione. Durante l'addestramento un critico centralizzato valuta il risultato congiunto e, su molti episodi, gli agenti apprendono politiche di accesso allo spettro e di puntamento dei fasci che evitano jamming e interferenza co-canale senza un piano di frequenze progettato a mano.
Che cos'è l'addestramento centralizzato con esecuzione decentralizzata nell'anti-jamming?
CTDE consente a un critico centralizzato di vedere stato e ricompense congiunti durante l'addestramento, mantenendo l'apprendimento stabile e abilitando la coordinazione. In fase di esecuzione ogni satellite si affida solo alla propria politica e alle osservazioni locali, quindi in un ambiente conteso non serve un collegamento attivo verso un controllore a terra né verso tutti gli altri satelliti.
Quali guadagni di prestazioni riportano i sistemi anti-jamming basati su CTDE?
Nguyen et al. (arXiv 2512.08341, inviato il 9 dicembre 2025, per IEEE ICC 2026) hanno combinato un critico centralizzato con attori decentralizzati in reti di relay UAV collaborative sotto jamming. I risultati mostrano circa il 50% in più di throughput totale di sistema e un tasso di collisione quasi nullo, con una strategia anti-jamming emergente sviluppata senza programmazione esplicita.
Perché le reti di satelliti LEO sono vulnerabili a jamming e interferenza co-canale?
I satelliti LEO orbitano a poche centinaia di chilometri, quindi ogni collegamento è alla portata di interferenze da terra, e le traiettorie orbitali sono altamente prevedibili. Decine o centinaia di satelliti condividono fasci e frequenze sovrapposti, così l'interferenza co-canale si somma al jamming deliberato, e un singolo collegamento inter-satellite compromesso può causare un guasto regionale a cascata.