Distribueret multi-agent deep reinforcement learning gør det muligt for satellitter, droner og radarer at undgå jamming uden en central frekvensplan. Centraliseret træning med decentral eksekvering (CTDE) og værdidekomponering som VDN og QMix står centralt i de nyeste resultater.

Hvorfor er LEO-satellitnetværk så sårbare over for jamming og co-channel-interferens?

LEO-satellitter bevæger sig kun et par hundrede kilometer over jordoverfladen. Det gør ondt værre, end man lige tror: hvert eneste radiolink er inden for rækkevidde af jordbaseret interferens, og banerne er tilmed stærkt forudsigelige. En modstander behøver altså ikke jagte et tilfældigt mål — han kan planlægge jammingen efter bestemte tidspunkter og geometrier. Det giver et trusselsbillede, der grundlæggende adskiller sig fra geostationære systemer, hvor afstanden og signaturerne trods alt giver en vis naturlig beskyttelse.

LEO-konstellationer bygges jo netop til masseproduktion og tæt dækning, og det betyder, at snesevis eller ligefrem hundredvis af satellitter kredser i relativt lave baner, hvor dækningsområderne uundgåeligt overlapper hinanden. Konsekvensen er, at mange satellitter deler de samme stråler og frekvensbånd — og derfor ikke bare kan rammes af bevidst jamming, men også af co-channel-interferens, hvor signaler fra nærliggende satellitter eller brugere oven i købet lægger sig oven på hinanden. Den slags interferens er ikke et sjældent teknisk uheld, men en strukturel følge af, at spektret genbruges så aggressivt for at opnå høj kapacitet og lav latenstid. Kommer jamming oveni, bliver situationen ekstra kritisk, fordi et svækket inter-satellit-link ikke nødvendigvis forbliver et isoleret problem — fejl i synkronisering, rutning eller kanalfordeling kan brede sig gennem netværket og i værste fald udløse en regional afbrydelse, hvor flere brugere mister forbindelsen på samme tid. Man har vel alle prøvet, hvordan selv kortvarige forstyrrelser i et enkelt bånd får flere brugere til at skifte kanal i samme øjeblik, hvilket blot flytter problemet og skaber ny interferens et andet sted i spektret. Og det er præcis den kobling mellem fysisk sårbarhed og delt spektrum, der gør problemet svært at løse med statiske frekvensplaner: en fast plan kan ikke reagere på, at forstyrrelserne opstår lokalt, spreder sig dynamisk og hele tiden ændrer, hvilke kanaler der reelt er brugbare.

Tidligere har man typisk løst jamming og co-channel-interferens ved at bruge foruddefinerede frekvenshoppemønstre og reserverede bånd. Det fungerer egentlig ganske godt, så længe der er rigeligt med spektrum, og antallet af brugere er nogenlunde overskueligt. Men i en mega-LEO-konstellation med hundredvis af satellitter, der alle sammen konkurrerer om de samme få frekvensbånd, er den tilgang bare ikke holdbar. En central planlægningsenhed skal jo indsamle tilstandsinformation fra hele konstellationen, regne tildelinger ud og sende dem tilbage igen – og netop det koordinationslink bliver et svagt punkt, fordi det selv kan blive udsat for jamming. Oveni det vokser beregningsbyrden og signaleringsomkostningerne hurtigt, efterhånden som antallet af noder stiger, så beslutningerne ender med at komme for sent i forhold til de interferensmønstre, de skal reagere på. Derfor er interessen i stigende grad vendt mod lærende agenter, hvor hver satellit eller radio selv observerer lokale forhold som modtaget effekt, interferensniveau, køstatus og position, og derefter træffer beslutninger om spektrumadgang og beamvalg i realtid. Agenternes politikker kan tilpasses lokalt, uden at hele konstellationen først skal koordineres via et link, der i sig selv kan være jammed – og det er præcis den decentralisering, der gør multi-agent reinforcement learning så interessant i en LEO-sammenhæng.

Hvordan muliggør multi-agent reinforcement learning anti-jamming spektrumadgang?

I multi-agent reinforcement learning fungerer hver satellit eller radio som en selvstændig agent, der træffer sine beslutninger på baggrund af egne lokale observationer – det kan for eksempel være modtaget effekt, interferensniveau, kø-tilstand eller position. Denne detalje er faktisk ret afgørende, fordi den netop forhindrer, at agenterne bliver afhængige af kommunikationslinks, som i praksis risikerer at være jammede eller slet ikke tilgængelige. Under træningen er det en centraliseret kritiker, der vurderer det samlede udfald af agenternes handlinger, og gennem mange episoder lærer agenterne efterhånden at vælge spektrumadgangs- og strålepolitikker, der undgår jamming og co-channel-interferens – uden at nogen på forhånd har lagt en manuelt designet frekvensplan. Og netop fordi læringen foregår på tværs af mange agenter og gentagne episoder, kan politikkerne tilpasse sig dynamiske forstyrrelsesmønstre, som det ellers ville være svært at håndtere med statiske regler.

Pointen er, at agenten slet ikke behøver gætte, hvad modstanderen prøver på. Den lærer simpelthen mønstrene at kende undervejs: hvilke kanaler der giver god gennemstrømning, og hvilke der gang på gang bliver jammed. Det er netop den tilgang, Elleuch et al. (2021) tog under lup, da de undersøgte distribueret multi-agent RL til anti-jamming, hvor brugerne lærer i fællesskab i stedet for hver for sig. Resultaterne fra deres simulationer pegede i en klar retning: bedre transmissionsrater, ingen gensidig interferens, og samtidig den hurtigste konvergens blandt de metoder, de sammenlignede med.

Skaleringen er ikke bare et spørgsmål om antal, når vi taler mega-LEO-konstellationer med hundredvis eller måske tusindvis af satellitter — den er selve knudepunktet i problemet. Li et al. (IEEE, 2026) foreslår DMDRLA, en distribueret multi-agent DRL-metode, der netop er målrettet mega-LEO-konstellationer. Det afgørende her er, at den enkelte satellit ikke kan træffe beslutninger ud fra et fuldstændigt billede af hele netværket; i praksis må den handle på lokale observationer som modtaget effekt, interferensniveauer, køstatus og position. Metoden lader derfor agenterne lære koordineret adfærd, mens simulationerne eksplicit vejer træningsomkostningerne op mod den opnåede ydeevneoptimering. Pointen er ikke, at flere agenter altid er bedre, men at koordineringen skal kunne betale sig i forhold til den båndbredde og regnekraft, den kræver. Det er en subtil, men vigtig forskel: i et jammet miljø kan selv en lille forbedring i spektrumadgang være værdifuld, men hvis koordineringen kræver kommunikation, der selv kan blive forstyrret, eller hvis træningen trækker ud i uger, falder gevinsten hurtigt. Spørgsmålet om skalerbarhed er derfor ikke kun teknisk, men også økonomisk og operationelt.

Aspekt Udfordring i mega-LEO DMDRLA's tilgang
Beslutningsgrundlag Fuld netværksinformation er urealistisk Lokale observationer pr. satellit
Koordinering Skal opveje båndbredde og regnekraft Afvejning af træningsomkostning mod ydeevne
Skala Hundredvis til tusindvis af agenter Distribueret multi-agent DRL

Cao et al. (MDPI Electronics 14(16):3307, 2025) tager fat på netop den udfordring og bruger et value decomposition network (VDN) til anti-jamming-spektrumadgang i LEO-satellitnetværk. Idéen bag VDN er ret ligetil: man splitter den fælles handlingsværdifunktion op i separate værdier for hver agent, så hver enkelt satellit eller radio kan tildeles sin egen del af æren — også selvom den kun handler ud fra lokale observationer. På den måde kan spektrumvalg koordineres på tværs af mange noder, uden at man behøver træffe alle beslutninger centralt, når systemet først er i drift. Forfatterne kombinerer det med centraliseret træning og decentral eksekvering: under træningen sidder en central kritiker og vurderer de samlede udfald, hvorefter hver agent selv eksekverer sin politik lokalt. Ifølge artiklen giver det en bedre træningseffektivitet og et markant lavere kommunikationsoverhead end mere centraliserede tilgange. Og det er faktisk en vigtig pointe — koordinering koster under træning, men hvis man kan flytte den væk fra driftstidspunktet, bliver den operationelle byrde meget mindre. Det er afgørende i et miljø, hvor selve kommunikationslinkene risikerer at være jammede.

Hvilken rolle spiller centraliseret træning med decentral eksekvering?

Centraliseret træning med decentral eksekvering – forkortet CTDE – er en arkitektur, hvor en central kritiker under træningen har adgang til den samlede tilstand og de fælles belønninger, mens hver agent i driftstiden kun læner sig op ad sine egne lokale observationer. Denne opdeling er med til at holde indlæringen stabil og gør det samtidig muligt at koordinere på tværs af agenter, fordi kritikeren kan vurdere, hvordan én agents valg påvirker de andre. Det kan for eksempel være en LEO-satellit, der vælger et bestemt frekvensbånd, og dermed ændrer interferensbilledet for nabosatellitterne. Uden det globale overblik bliver kreditfordelingen mellem mange noder hurtigt støjende og langsom at få til at konvergere – især når der er tale om snesevis eller ligefrem hundredvis af agenter. Netop derfor er CTDE attraktiv i anti-jamming-scenarier: koordineringen foregår i træningsfasen, hvor man godt kan tillade sig at samle information ind, mens den udrullede politik ikke er afhængig af kommunikationslinks, som fjenden måske selv forsøger at jamme.

Når systemet først er i drift, ser billedet helt anderledes ud. Hver satellit står alene med sin egen politik og sine egne lokale observationer – der er ingen live-forbindelse tilbage til en jordbaseret controller, og ingen løbende snak med alle de andre satellitter i konstellationen. Og det er faktisk ikke bare en teknisk detalje. Det er hele grunden til, at CTDE er så attraktivt i anti-jamming-sammenhæng: de kommunikationslinks, man ellers ville bruge til at koordinere over, er nemlig præcis dem, en modstander først går efter at jamme.

Nguyen et al. (arXiv 2512.08341, indsendt 9. december 2025, til IEEE ICC 2026) tog en anden tilgang og kombinerede en centraliseret kritiker med decentraliserede aktører i collaborative UAV-relaynetværk under jamming. Det gav omkring 50 procent højere samlet systemgennemstrømning og en kollisionsrate tæt på nul. Det interessante er, at agenternes anti-jamming-strategi ikke var programmeret eksplicit — den opstod af sig selv gennem træningen.

Centraliseret træning med decentral eksekvering – det, man i daglig tale kalder CTDE – er efterhånden blevet den faste opskrift i nyere anti-jamming-forskning, og resultaterne ovenfor viser hvorfor. Ideen er egentlig ret ligetil: mens modellen trænes, får en central kritiker lov at kigge på hele systemets tilstand og på de samlede konsekvenser af agenternes valg. På den måde lærer agenterne at koordinere deres spektrumbeslutninger i stedet for at konkurrere i blinde. Når træningen er overstået, klipper man navlestrengen – hver satellit, UAV eller radio kører nu sin egen politik alene, udelukkende på baggrund af lokale observationer som modtaget effekt, interferensniveau, køstatus og position. Og netop det er afgørende i et jammet miljø, for man kan ikke regne med, at linket til en central enhed overhovedet er intakt. Regningen kommer på træningssiden: CTDE kræver mere infrastruktur, mere regnekraft og flere samples, før politikkerne er modne nok. Det er præcis det trade-off, Li et al. peger på som centralt for mega-LEO-konstellationer, hvor hundredevis af noder skal koordineres – og hvor selv en beskeden forbedring i sample-effektivitet kan være det, der afgør, om systemet nogensinde bliver færdigtrænet.

Hvilke algoritmer driver distribueret anti-jamming: VDN, QMix og MP-DQN?

Forskellen mellem VDN, QMix og MP-DQN ligger først og fremmest i måden, hvorpå en fælles belønning fordeles ud til de enkelte agenter – det er nemlig den såkaldte kreditfordeling, der afgør, om læringen overhovedet skalerer. VDN tager den mest ligetil vej og dekomponerer den fælles action-value-funktion i separate per-agent-værdier, typisk som en sum af de enkeltes bidrag. Det gør kreditfordelingen håndterbar, selv når snesevis eller hundredvis af noder skal koordineres, og det er netop derfor, metoden har fundet vej til anti-jamming-spektrumadgang i LEO-satellitnetværk. QMix løsner denne stive antagelse og blander de individuelle værdier mere fleksibelt, så også ikke-lineære samspil mellem agenter kan fanges – en fordel, når f.eks. flere satellitter eller radioer konkurrerer om de samme kanaler. MP-DQN sigter derimod mod et andet problem: handlinger, der består af flere diskrete parametre. Det passer præcist til beslutninger, hvor både kanalvalg og strålevalg skal træffes samtidig, og hvor en enkelt flad handlingsdimension ellers ville vokse eksplosivt. Kort sagt handler valget mellem de tre algoritmer om, hvor komplekst samspillet er, og hvor mange diskrete beslutninger der skal træffes i ét træk.

Cai et al. (2025) anvender QMix-algoritmen til kooperativ jammingsbeslutningstagning. Wang et al. (2025) designer en multi-agent RL-algoritme, der integrerer prioriteret experience replay, entropiregularisering og reward centering. Zhang et al. (2021) undersøger multi-user anti-jamming kanaladgang med delvist overlappende kanaler (POC), hvor interferensgrænserne ikke er skarpe. Janiar et al. (2023) tilføjer transfer learning, så en DRL-agent hurtigt kan lære i dynamiske trådløse netværk under jammingangreb.

Tabel 1 nedenfor opsummerer de vigtigste algoritmiske byggeklodser og deres rolle i anti-jamming. Tabellen er ikke udtømmende, men viser, hvordan valget af algoritme hænger sammen med, om problemet handler om kreditfordeling, ikke-lineær koordinering eller store handlingsrum.

AlgoritmeKernefunktionTypisk anvendelse
VDNDekomponerer fælles action-value i per-agent-værdierAnti-jamming spektrumadgang i LEO-satellitnetværk
QMixIkke-lineær blanding af individuelle værdierKooperativ jammingsbeslutningstagning
MP-DQNHåndterer parametriserede diskrete handlingerKanal- og strålevalg
Transfer learningGenbrug af viden på tværs af miljøerDynamiske trådløse netværk under jamming

For mig at se er den vigtigste indsigt, at algoritmevalget følger af koordineringsbehovet. VDN og QMix løser kreditfordelingsproblemet, mens MP-DQN løser handlingsrumsproblemet. I praksis kombineres de ofte med teknikker som prioriteret replay og entropiregularisering for at få stabil indlæring i støjende spektrummiljøer.

Hvilke præstationsgevinster og trade-offs rapporterer simulationerne?

De offentliggjorte tal peger i samme retning: koordinering hjælper, men koster træningstid og sample-effektivitet. Nguyen et al. rapporterer omkring 50 procent højere samlet systemgennemstrømning og næsten nul kollisionsrate i UAV-relaynetværk under jamming. Elleuch et al. (2021) viser forbedrede transmissionsrater og eliminering af gensidig interferens med den højeste konvergenshastighed blandt de testede metoder. Begge resultater kommer fra simuleringer, hvilket er værd at holde sig for øje, når man vurderer den operationelle betydning.

På radarsiden er billedet mere præcist kvantificeret. Feng Xie et al. (Journal of Radars, 12(6):1290-1304, 2023) foreslår complex-domain DRL til radar-anti-jamming i frekvensagile radarer. Den gennemsnitlige beslutningstid blev reduceret til 405,3 ms sammenlignet med to klassiske RL-algoritmer. Det er en konkret måling, der viser, at DRL kan levere beslutninger inden for tidsrammer, som frekvensagile radarer faktisk arbejder i.

Trade-offet er dog ikke til at komme udenom. CTDE undgår at afhænge af links, som selv kan være jammed, men det flytter kompleksiteten til træningsfasen. For mega-LEO-konstellationer betyder det, at man skal investere i simulerings- og træningsinfrastruktur, før man ser gevinsten i drift. Li et al. (IEEE, 2026) vejer netop disse træningsomkostninger mod ydeevneoptimering i deres DMDRLA-evaluering.

Jeg vil også fremhæve, at sample-effektivitet er en reel flaskehals. Når handlingsrummet vokser med antallet af kanaler og stråler, stiger antallet af nødvendige episoder. Derfor er teknikker som prioriteret experience replay og entropiregularisering ikke kosmetik, men nødvendige for at gøre distribueret anti-jamming praktisk anvendeligt i stor skala.

Hvordan adskiller UAV-relay- og radar-anti-jamming-anvendelser sig?

UAV-relaynetværk og radarer deler de samme algoritmiske byggeklodser, men har vidt forskellige krav til latens og beslutningsrum. I UAV-relaynetværk handler det om at opretholde forbindelsen mellem mobile noder, hvor agenterne kan koordinere over korte afstande og flytte sig fysisk for at undgå jamming. Nguyen et al. viser, at CTDE her kan give en emergent anti-jamming-strategi uden eksplicit programmering, hvilket er attraktivt i scenarier, hvor trusselsbilledet ændrer sig hurtigt.

For frekvensagile radarer er målet et andet: at vælge den næste frekvens og bølgeform hurtigt nok til at undgå forstyrrelser, mens målet stadig spores. Her er beslutningstiden kritisk, og Feng Xie et al.s resultat på 405,3 ms er netop interessant, fordi det ligger inden for radarens operative kadence. Radaren har heller ikke samme mulighed for at flytte sig fysisk, så anti-jamming bliver i højere grad et spørgsmål om spektral og tidsmæssig agilitet.

Cognitive radio- og WACR-systemer (wideband autonomous cognitive radios) udgør en tredje kategori. Aref et al. undersøger anti-jamming med WACR i et multi-agent-miljø og søger optimale politikker for både anti-jamming og interferensundgåelse. Her er agenterne typisk stationære, men skal navigere i et bredt spektrum med mange samtidige brugere, hvilket gør kreditfordeling og spektrumkoordinering til det centrale problem.

Yang et al.s survey (arXiv 2508.11687, 11. august 2025) formaliserer intelligente anti-jamming-agenter for UAV-kommunikation med en Perception-Decision-Action-lukket sløjfe og bruger spilteori og RL som rammeværk. Det er en nyttig systematisering, fordi den viser, at på trods af forskellige anvendelser deler de alle den samme grundstruktur: sanse, beslutte, handle og lære af udfaldet.

Hvilke praktiske hensyn bør man tage, før man ruller distribueret anti-jamming ud?

Før man går fra simulation til drift, bør man spørge, hvor meget koordinering der reelt er nødvendig. Hvis agenterne kan klare sig med lokale observationer og en politik, der er trænet centralt, sparer man den sårbare kommunikationskanal i driftstiden. Det er hele logikken bag CTDE, og det bør være det første designvalg, man tager stilling til.

Dernæst kommer skalaen. Med snesevis eller hundredvis af noder vokser kreditfordelingsproblemet, og VDN eller QMix bliver relevante. Man bør tidligt beslutte, om handlingsrummet er rent diskret, eller om det har flere parametre, fordi det afgør, om MP-DQN-lignende tilgange er nødvendige. Endelig bør man planlægge træningsinfrastrukturen som en del af systemet og ikke som et engangsprojekt, da modstanderens adfærd kan ændre sig over tid.

Endnu et hensyn er evalueringen. De fleste offentliggjorte resultater er simuleringsbaserede, og selv lovende tal som 50 procent højere gennemstrømning skal verificeres under realistiske kanalforhold og med reelle hardwarebegrænsninger. Jeg anbefaler at opstille klare baselines – statisk frekvensplan, reaktiv kanalskift og klassiske RL-metoder – og måle både gennemstrømning, kollisionsrate, konvergenstid og beslutningslatens.

Endelig er der det langsigtede perspektiv: anti-jamming er et vedvarende kapløb snarere end et engangsproblem. Transfer learning, som Janiar et al. (2023) bruger, er et skridt i retning af agenter, der hurtigt kan tilpasse sig nye trusler. For organisationer, der driver LEO-konstellationer eller UAV-netværk, betyder det, at man bør opbygge en løbende trænings- og evalueringscyklus frem for at låse sig fast på én model.

Ofte stillede spørgsmål om distribueret multi-agent DRL og anti-jamming

Hvordan muliggør multi-agent reinforcement learning anti-jamming spektrumadgang?

Hver satellit eller radio fungerer som en agent, der kun bruger lokale observationer som modtaget effekt, interferensniveau, kø-tilstand og position. Under træningen evaluerer en centraliseret kritiker det fælles udfald, og gennem mange episoder lærer agenterne spektrumadgangs- og strålepolitikker, der undgår jamming og co-channel-interferens uden en manuelt designet frekvensplan.

Hvad er centraliseret træning med decentral eksekvering i anti-jamming?

CTDE lader en centraliseret kritiker se den fælles tilstand og de fælles belønninger under træningen, hvilket holder indlæringen stabil og muliggør koordinering. I driftstiden er hver satellit alene med sin egen politik og sine lokale observationer, så der kræves ingen live-forbindelse til en jordbaseret controller eller til alle andre satellitter i et omstridt miljø.

Hvilke præstationsgevinster rapporterer CTDE-anti-jammingsystemer?

Nguyen et al. (arXiv 2512.08341, indsendt 9. december 2025, til IEEE ICC 2026) kombinerede en centraliseret kritiker med decentraliserede aktører i collaborative UAV-relaynetværk under jamming. Resultaterne viser cirka 50 procent højere samlet systemgennemstrømning og en næsten nul kollisionsrate, hvor agenterne udviklede en emergent anti-jamming-strategi uden eksplicit programmering.

Hvorfor er LEO-satellitnetværk sårbare over for jamming og co-channel-interferens?

LEO-satellitter kredser et par hundrede kilometer oppe, så hvert link ligger inden for rækkevidde af jordbaseret interferens, og kredsløbsbanerne er stærkt forudsigelige. Snesevis eller hundredvis af satellitter deler overlappende stråler og frekvenser, så co-channel-interferens lægger sig oven i bevidst jamming, og ét svækket inter-satellit-link kan kaskadevidere til en regional afbrydelse.