Wie verteiltes Multi-Agent Deep Reinforcement Learning (DRL) Satelliten, UAVs und Radare gegen Jamming und Ko-Kanal-Interferenzen absichert. Wir vergleichen Mechanismen, Algorithmen wie VDN und QMix sowie die gemessenen Leistungsgewinne und ihre Kosten.

Warum sind LEO-Satellitennetze so anfällig für Jamming und Ko-Kanal-Interferenzen?

LEO-Satelliten ziehen in nur wenigen hundert Kilometern Höhe über uns hinweg. Das hat eine unangenehme Konsequenz: Jede Funkverbindung liegt im Reichweitenbereich von Störsendern am Boden, und die Flugbahnen lassen sich mit hoher Genauigkeit vorhersagen. Wer den Orbit kennt, weiß also ziemlich genau, wann ein Satellit über einer bestimmten Region steht – und kann in genau diesem Moment gezielt stören. Eine statisch geplante Frequenznutzung, wie sie klassische Systeme verwenden, wird damit angreifbar.

Dazu kommt die pure Dichte: In Mega-Konstellationen überlappen sich bei Dutzenden bis Hunderten Satelliten die Strahlen und Frequenzbänder, Ko-Kanal-Interferenzen sind also nicht die Ausnahme, sondern der Normalfall. Und wenn zu diesen wechselseitigen Störungen noch eine gezielte Jamming-Quelle dazukommt, überlagern sich beide Effekte – die absichtliche Störung hebt das ohnehin schon hohe Interferenzniveau weiter an, und irgendwann verschwimmt die Grenze zwischen „läuft nur langsam" und „ist komplett weg". Richtig kritisch wird es durch die Verkettung: Es genügt eine einzige gestörte Inter-Satelliten-Verbindung, damit der Verkehr umgeleitet wird, benachbarte Knoten überlastet werden und daraus eine Kettenreaktion bis zum regionalen Ausfall entsteht. Genau dieses Zusammenspiel – exponierte Physik mit begrenzter Sendeleistung, langen Wegen und starker Dämpfung auf der einen, geteiltes Spektrum auf der anderen Seite – macht statische, vorab konfigurierte Schutzmechanismen so anfällig. Adaptive, selbstlernende Verfahren sind deshalb attraktiv: Sie behandeln Störungen nicht als Ausnahmefall, sondern als dynamische Umgebung, an die sich das Netzwerk laufend anpasst.

Wenn ich mit Netzbetreibern spreche, höre ich fast immer dasselbe: Das eigentliche Problem ist nicht der einzelne Störsender, sondern die Kettenreaktion, die er in Gang setzt. Ein Link bricht weg, das Routing verschiebt die Last von einer Sekunde auf die andere auf benachbarte Pfade, dort überlagern sich die Strahlen – und plötzlich ist nicht mehr ein Knoten betroffen, sondern gleich eine ganze Region. Aus einer lokalen Störung wird so ein Flächenproblem, weil die Systeme aufeinander reagieren und sich gegenseitig hochschaukeln. Ein manuell gepflegter Frequenzplan kommt gegen diese Dynamik nicht an: Er wird typischerweise im Rhythmus von Stunden oder Tagen aktualisiert, während sich die Interferenzlage im Sekundentakt verändert. Genau hier setzen verteilte, lernende Verfahren an. Sie sollen die einzelnen Satelliten oder Funkgeräte dazu bringen, ihre Spektrum- und Strahlentscheidungen laufend selbst anzupassen – statt auf einen zentralen Plan zu warten, der immer zu spät kommt.

Wie ermöglicht Multi-Agent Reinforcement Learning Anti-Jamming-Spektrumzugang?

Jeder Satellit bzw. Funkknoten agiert hier als eigenständiger Agent und verlässt sich dabei ausschließlich auf lokale Beobachtungen – also etwa die empfangene Signalstärke, den momentanen Interferenzpegel, den Zustand der eigenen Warteschlange und die eigene Position. Dass man sich bewusst auf dieses lokale Wissen beschränkt, hat einen guten Grund: In einer Mega-LEO-Konstellation mit Dutzenden bis Hunderten von Knoten wären zentrale Steuerungskanäle selbst ein dankbares Ziel für Störangriffe. Beim Training kommt allerdings ein zentraler Kritiker ins Spiel, der das gemeinsame Ergebnis aller Agenten bewertet und damit Rückschlüsse darauf zulässt, welcher Beitrag einzelner Knoten zum Gesamterfolg beigetragen hat. Über viele Episoden hinweg verinnerlichen die Agenten so Spektrumzugriffs- und Strahlrichtlinien, die Jamming und Ko-Kanal-Interferenzen aktiv ausweichen – und das ganz ohne einen von Hand entworfenen Frequenzplan. Genau dieses Zusammenspiel aus dezentraler Ausführung und zentraler Bewertung macht den Ansatz für den Anti-Jamming-Spektrumzugang in LEO-Satellitennetzen so attraktiv.

Genau hier liegt der Kern der Frage, wie Multi-Agent Reinforcement Learning den Anti-Jamming-Spektrumzugang möglich macht: An die Stelle einer globalen Instanz, die jeden Kanal einzeln zuteilt, tritt ein verteiltes System, in dem sich koordinierte Muster gewissermaßen von selbst aus dem lokalen Lernen der einzelnen Agenten herausbilden. Elleuch et al. (2021) konnten in ihren Simulationen zeigen, dass kooperativ lernende Nutzer nicht nur ihre Übertragungsraten erhöhen und gegenseitige Interferenzen auflösen, sondern dabei auch die schnellste Konvergenz erreichen.

Der eigentliche Knackpunkt ist die Abgrenzung zur zentralen Steuerung. Ein Bodenkontrollzentrum müsste jeden Satelliten einzeln über einen Funklink erreichen – und genau dieser Link kann im Ernstfall selbst gestört oder ausgefallen sein. Dann hängt die komplette Reaktion auf einen Angriff an einem einzigen verwundbaren Nadelöhr. Verteilte Agenten umgehen diese Abhängigkeit: Zur Laufzeit braucht jeder Satellit nur seine eigene trainierte Richtlinie und die Beobachtungen, die er ohnehin lokal empfängt – etwa empfangene Leistung, Störpegel, Warteschlangenzustand und Position. Selbst wenn die Verbindung zum Kontrollzentrum komplett wegbricht, bleibt das System handlungsfähig. Genau diese Unabhängigkeit macht den Ansatz für umkämpfte Funkumgebungen attraktiv, in denen Ausfälle und Jamming eher der Normalfall sind als die Ausnahme.

Welche Rolle spielt Centralized Training with Decentralized Execution?

Centralized Training with Decentralized Execution – kurz CTDE – trennt bewusst zwei Dinge, die im Alltag vieler Funksysteme nur schwer zusammengehen: das Lernen und den Betrieb. In der Trainingsphase sammelt ein zentraler Kritiker den gemeinsamen Zustand und die Belohnungen aller Agenten ein. So behält er das Gesamtbild im Blick, erkennt Konflikte zwischen den Knoten und kann die einzelnen Richtlinien so nachjustieren, dass sie sich gegenseitig unterstützen statt stören – was den Lernprozess spürbar stabilisiert. Die zentrale Instanz muss dafür aber nicht jede Aktion vorgeben. Im laufenden Betrieb verlässt sich jeder Satellit dann ausschließlich auf seine eigene trainierte Richtlinie und seine lokalen Beobachtungen, etwa empfangene Leistung, Interferenzpegel, Warteschlangenzustand oder Position. Eine Live-Verbindung zurück zum Bodenkontrollzentrum oder zu jedem anderen Satelliten braucht es dann nicht mehr. Und genau darin liegt der entscheidende Vorteil in einer Jamming-Umgebung: Der Koordinationskanal, über den sonst Informationen ausgetauscht würden, könnte selbst gestört oder ausgefallen sein. CTDE verlagert die Abstimmung also in eine Phase, in der sich Störungen kontrollieren lassen, und hält den eigentlichen Betrieb robust und unabhängig.

Cao et al. (MDPI Electronics 14(16):3307, 2025) setzen für den Anti-Jamming-Spektrumzugang in LEO-Satellitennetzen auf ein Value Decomposition Network, kurz VDN. Die Grundidee dahinter: Trainiert wird zentral, entschieden wird dezentral – jeder Satellit handelt im Betrieb also autonom vor Ort. Genau dieses Muster kennt man unter dem Kürzel CTDE, Centralized Training with Decentralized Execution. Und der Kniff zahlt sich aus. Die Trainingsschleife konvergiert schneller, und weil die Agenten im Einsatz nicht permanent über den Funkkanal miteinander verhandeln müssen, fällt auch der Kommunikationsaufwand deutlich geringer aus. Das ist alles andere als ein Nebeneffekt, sondern im Gegenteil entscheidend: Jeder einzelne Austausch zwischen den Knoten wäre selbst ein potenzielles Ziel für Störsender. Li et al. (IEEE, 2026) beschreiten mit DMDRLA einen ganz ähnlichen Weg, skalieren ihn allerdings auf Mega-LEO-Konstellationen mit erheblich mehr Agenten. In ihren Simulationen stellen sie die Trainingskosten – Rechenzeit, Probenkomplexität, Abstimmungsaufwand – systematisch der erzielten Anti-Jamming-Leistung gegenüber. So lässt sich abschätzen, wo sich der zusätzliche Koordinationsaufwand am Ende wirklich lohnt.

Der praktische Nutzen von CTDE – also Centralized Training with Decentralized Execution – wird am besten an zwei Punkten deutlich. Erstens: Während des Trainings darf ein zentraler Kritiker den gemeinsamen Zustand aller Agenten bewerten, doch im laufenden Betrieb entscheidet jeder Knoten für sich, allein auf Grundlage seiner lokalen Beobachtungen – empfangene Leistung, Störpegel, Warteschlangenstatus, Position. Das ist alles andere als ein Detail, denn ein zentraler Koordinationskanal wäre im Ernstfall vermutlich das erste Ziel von Jamming. Wer sich im Betrieb auf ihn verlässt, verliert die Kontrolle also genau in dem Moment, in dem er sie am dringendsten braucht. Zweitens lässt sich dieser Ansatz auf Dutzende bis Hunderte Knoten skalieren, wie sie in Mega-LEO-Konstellationen oder kooperativen UAV-Netzen vorkommen. Genau diese Mischung – stabile Lernphase hier, autonome Laufzeit dort – hat CTDE zum Standardbaustein moderner Anti-Jamming-MARL-Systeme gemacht. Ein gutes Beispiel ist die Wertzerlegung über VDN: Sie löst den gemeinsamen Aktionswert in Einzelwerte pro Agent auf und macht die Kreditzuweisung über viele Knoten hinweg überhaupt erst praktikabel.

Welche Algorithmen treiben verteiltes Anti-Jamming an: VDN, QMix und MP-DQN?

Die Algorithmenfamilie ist breit aufgestellt, doch im Grunde übernehmen alle dieselbe Rolle: Sie zerlegen ein gemeinsames Problem in lernbare Einzelbeiträge. VDN, das Value Decomposition Network, faktorisiert die gemeinsame Aktionswertfunktion in Werte pro Agent. Das klingt erst einmal technisch, ist aber im Kern eine Buchhaltungsfrage – wenn Dutzende oder Hunderte Knoten gleichzeitig über Spektrum und Beam entscheiden, muss das System im Nachhinein wissen, welcher Beitrag zum Erfolg oder Misserfolg geführt hat. Genau diese Credit-Zuweisung erleichtert VDN, indem es den Gesamtwert als Summe individueller Werte darstellt. Cao et al. haben diesen Ansatz 2025 in MDPI Electronics 14(16):3307 für Anti-Jamming-Spektrumzugang in LEO-Satellitennetzen genutzt und ihn mit zentralisiertem Training und dezentraler Ausführung kombiniert, um die Trainingseffizienz zu steigern und den Kommunikationsaufwand zu senken. QMix geht noch einen Schritt weiter: Statt einer starren Summe erlaubt es komplexere, monotone Mischungen der Einzelwerte und kann dadurch Abhängigkeiten zwischen Agenten besser abbilden. Cai et al. (2025) haben QMix auf kooperative Jamming-Entscheidungen angewendet. Daneben gibt es MP-DQN, das für Multi-Policy-Szenarien mit diskreten und kontinuierlichen Aktionen gedacht ist; in der Anti-Jamming-Literatur taucht es als Alternative auf, wenn ein einzelner Agent mehrere Entscheidungsebenen gleichzeitig bedienen muss.

Wang et al. (2025) haben einen Multi-Agent-RL-Algorithmus vorgestellt, der prioritäres Experience Replay, Entropie-Regularisierung und Reward-Centering miteinander verbindet – der Ansatz zielt darauf ab, Exploration und Stabilität in ein ausgewogenes Verhältnis zu bringen. Zhang et al. (2021) wiederum haben sich mit dem Anti-Jamming-Kanalzugriff bei mehreren Nutzern befasst, wobei sie teilweise überlappende Kanäle (POC) betrachtet haben. Die nachfolgende Übersicht soll die zentralen Ansätze und ihre jeweiligen Beiträge einordnen.

AnsatzBeitragQuelle
VDNZerlegt den gemeinsamen Aktionswert in Einzelwerte, verbessert Trainingseffizienz und senkt KommunikationsaufwandCao et al., MDPI Electronics 14(16):3307 (2025)
QMixKooperative Jamming-Entscheidungen über komplexere Werte-MischungCai et al. (2025)
Erweitertes MARLPrioritäres Replay, Entropie-Regularisierung, Reward-CenteringWang et al. (2025)
POC-ZugriffMehrnutzer-Kanalzugriff mit teilweise überlappenden KanälenZhang et al. (2021)
Transfer LearningSchnelles Lernen in dynamischen drahtlosen Netzen unter JammingJaniar et al. (2023)

In der Praxis entscheidet nicht der Algorithmus allein, sondern die Passung zur Konstellation. VDN ist einfacher und kommunikationsärmer, QMix ausdrucksstärker, aber schwerer zu trainieren. Wer Hunderte Satelliten koordinieren muss, achtet zuerst auf Sample-Effizienz und stabile Credit-Zuweisung, nicht auf maximale Modellkomplexität.

Welche Leistungsgewinne und Trade-offs melden die Simulationen?

Die konkreten Zahlen sind überschaubar, aber aussagekräftig. Nguyen et al. (arXiv 2512.08341, eingereicht am 9. Dezember 2025, für IEEE ICC 2026) kombinierten einen zentralen Kritiker mit dezentralen Akteuren in kooperativen UAV-Relay-Netzen unter Jamming. Das Ergebnis: rund 50 Prozent höherer Gesamtdurchsatz des Systems und eine nahezu verschwindende Kollisionsrate. Die Agenten entwickelten eine emergente Anti-Jamming-Strategie, ohne explizit programmiert zu werden.

Feng Xie et al. (Journal of Radars, 12(6):1290–1304, 2023) zeigten komplexwertiges DRL für frequenzagiles Radar. Die durchschnittliche Entscheidungszeit sank auf 405,3 ms – deutlich unter zwei klassischen RL-Algorithmen. Aref et al. untersuchten Anti-Jamming mit breitbandigen autonomen kognitiven Funkgeräten (WACR) in einer Multi-Agent-Umgebung und suchten optimale Richtlinien zur Störungsvermeidung.

Der Trade-off ist klar: Koordination verbessert die Anti-Jamming-Ergebnisse, kostet aber Trainingszeit und Sample-Effizienz. Li et al. (IEEE, 2026) adressieren genau diese Abwägung für Mega-LEO-Konstellationen. Wer den Rechenaufwand im Training scheut, zahlt ihn später in Form langsamerer Anpassung im Feld.

Wie unterscheiden sich UAV-Relay- und Radar-Anti-Jamming-Anwendungen?

UAV-Relays und Radar teilen die Grundidee, unterscheiden sich aber in Randbedingungen und Zielgrößen. UAVs sind mobil, energiebegrenzt und auf kurze Reaktionszeiten angewiesen; Radar arbeitet mit frequenzagilen Wellenformen und hat harte Echtzeitanforderungen an die Entscheidungsfindung. Yang et al. (arXiv 2508.11687, 11. August 2025) formalisieren intelligente Anti-Jamming-Agenten für die UAV-Kommunikation in einem geschlossenen Wahrnehmungs-Entscheidungs-Handlungs-Zyklus mit Spieltheorie und RL.

Bei UAV-Relays steht der Systemdurchsatz im Vordergrund, bei Radar die Entscheidungszeit und die Trefferleistung unter Störung. Das erklärt, warum Radararbeiten häufig komplexwertige DRL-Varianten und frequenzagile Anpassung betonen, während UAV-Arbeiten auf CTDE und emergente Koordination setzen. Für LEO-Konstellationen wiederum ist die Skalierung über viele Knoten der entscheidende Faktor.

In der Praxis heißt das: Ein Verfahren, das bei einem Radar mit 405,3 ms Entscheidungszeit glänzt, ist nicht automatisch für Hunderte Satelliten geeignet. Umgekehrt hilft die bei UAVs gezeigte CTDE-Koordination direkt bei der Frage, wie sich Mega-Konstellationen ohne zentrale Steuerung gegen Jamming absichern lassen.

Welche praktischen Grenzen sollte man kennen?

Simulationsergebnisse sind kein Feldtest. Die zitierten Arbeiten berichten Verbesserungen unter modellierten Bedingungen; reale Störumgebungen enthalten Hardwarefehler, unvollständige Beobachtungen und nichtstationäre Angreifer. Wer ein System beschafft, sollte Sample-Effizienz, Trainingskosten und die Robustheit gegen veränderte Störstrategien getrennt prüfen.

Ein zweiter Punkt ist die Beobachtbarkeit. Agenten treffen Entscheidungen auf Basis lokaler Messgrößen wie Empfangsleistung und Interferenzpegel. Sind diese verrauscht oder manipulativ verfälscht, sinkt die Qualität der gelernten Richtlinie. Genau hier werden Verfahren wie Transfer Learning nach Janiar et al. (2023) interessant, weil sie schnelles Anpassen in dynamischen drahtlosen Netzen ermöglichen.

Drittens bleibt die Frage der Zertifizierung. Wer für kritische Infrastruktur verantwortlich ist, braucht nachvollziehbare Entscheidungen. Emergente Strategien sind effektiv, aber schwer zu auditieren. Ein ausgewogener Ansatz kombiniert gelernte Richtlinien mit überprüfbaren Sicherheitsgrenzen, statt sich allein auf das Modell zu verlassen.

Wie sollte man mit dem Einstieg beginnen?

Für Teams, die erste Schritte planen, empfehle ich eine klare Reihenfolge: zuerst die Beobachtungs- und Belohnungsstruktur definieren, dann CTDE mit VDN als robuste Basis aufsetzen und erst danach komplexere Mischungen wie QMix testen. Die Simulationsumgebung sollte Jamming, Ko-Kanal-Interferenzen und den Ausfall einzelner Links abbilden, sonst sind die Ergebnisse wenig aussagekräftig.

Sinnvoll ist außerdem, den Trainingsaufwand früh zu messen. Li et al. (IEEE, 2026) zeigen für Mega-LEO-Konstellationen, dass Trainingskosten und Leistung in einem direkten Spannungsverhältnis stehen. Wer diese Kurve kennt, kann entscheiden, ob sich zusätzliche Koordination für die eigene Konstellation überhaupt auszahlt.

Abschließend: Der größte Hebel liegt nicht in einem einzelnen Algorithmus, sondern in der Kombination aus verteilter Ausführung, stabiler Credit-Zuweisung und realistischen Störszenarien. Wer diese drei Elemente zusammendenkt, baut Anti-Jamming-Systeme, die auch dann funktionieren, wenn der zentrale Link längst ausgefallen ist.

Was bedeutet das für Betreiber und Investoren?

Aus Betreibersicht verschiebt sich der Wettbewerb von der Hardware zur Software. Satellitenkonstellationen werden zunehmend danach bewertet, wie schnell sie sich auf neue Störungen einstellen. Das erhöht den Wert von Teams, die MARL, CTDE und Spektrummanagement beherrschen, und es macht Trainingsinfrastruktur zu einem strategischen Kostenfaktor.

Forschung zu diesem Thema erscheint zunehmend in IEEE- und MDPI-Publikationen sowie auf arXiv, was auf eine Reifung des Feldes hindeutet. Wer heute in verteiltes Anti-Jamming investiert, sollte dennoch realistisch bleiben: Die gemessenen Gewinne stammen aus Simulationen, nicht aus großflächigen Feldtests.

Dieser Artikel ist keine Anlageberatung. Er fasst öffentlich zugängliche Forschung zusammen und ordnet Mechanismen, Algorithmen und berichtete Leistungsdaten ein, damit Leser die Tragweite der Ergebnisse selbst bewerten können.

Wie geht es weiter?

Die nächste Entwicklungsstufe dürfte die Kombination mehrerer Lernziele sein: Spektrumzugang, Strahlformung und Routing gleichzeitig zu optimieren, statt sie getrennt zu behandeln. Erste Arbeiten zu kognitiven Funkgeräten und frequenzagilem Radar deuten in diese Richtung. Entscheidend bleibt, ob sich die Trainingskosten so senken lassen, dass der Ansatz für große Konstellationen wirtschaftlich wird.

Ich erwarte außerdem mehr Arbeiten zu Robustheit und Auditierbarkeit. Solange emergente Strategien schwer zu erklären sind, werden Betreiber Sicherheitsgrenzen und formale Garantien verlangen. Wer beides liefern kann – hohe Leistung und nachvollziehbare Entscheidungen –, wird sich in diesem Feld durchsetzen.

Häufige Fragen zu MARL und Anti-Jamming

FrageKurzantwort
Was ist der Kern von CTDE?Zentraler Kritiker im Training, dezentrale Ausführung zur Laufzeit.
Welche Gewinne sind belegt?Rund 50 % höherer Durchsatz und nahezu keine Kollisionen bei UAV-Relays.
Warum VDN?Einfache Credit-Zuweisung über viele Knoten bei geringem Kommunikationsaufwand.

Häufig gestellte Fragen

Wie ermöglicht Multi-Agent Reinforcement Learning Anti-Jamming-Spektrumzugang?

Jeder Satellit oder Funkknoten agiert als Agent und nutzt nur lokale Beobachtungen wie Empfangsleistung, Interferenzpegel, Warteschlangenzustand und Position. Im Training bewertet ein zentraler Kritiker das gemeinsame Ergebnis. Über viele Episoden lernen die Agenten Spektrumzugriffs- und Strahlrichtlinien, die Jamming und Ko-Kanal-Interferenzen vermeiden, ohne dass ein Frequenzplan manuell entworfen werden muss.

Was bedeutet Centralized Training with Decentralized Execution beim Anti-Jamming?

CTDE erlaubt einem zentralen Kritiker, im Training den gemeinsamen Zustand und die Belohnungen zu sehen, was das Lernen stabilisiert und Koordination ermöglicht. Zur Laufzeit verlässt sich jeder Satellit nur auf seine eigene Richtlinie und lokale Beobachtungen. Dadurch ist keine Live-Verbindung zum Bodenkontroller oder zu allen anderen Satelliten nötig, was in umkämpften Umgebungen entscheidend ist.

Welche Leistungsgewinne melden CTDE-Anti-Jamming-Systeme?

Nguyen et al. (arXiv 2512.08341, eingereicht am 9. Dezember 2025, für IEEE ICC 2026) kombinierten einen zentralen Kritiker mit dezentralen Akteuren in kooperativen UAV-Relay-Netzen unter Jamming. Die Ergebnisse zeigen rund 50 Prozent höheren Gesamtdurchsatz und eine nahezu verschwindende Kollisionsrate. Die Agenten entwickelten eine emergente Anti-Jamming-Strategie, ohne explizit programmiert zu werden.

Warum sind LEO-Satellitennetze anfällig für Jamming und Ko-Kanal-Interferenzen?

LEO-Satelliten kreisen nur wenige hundert Kilometer über der Erde, sodass jede Verbindung für bodengestützte Störsender erreichbar ist und die Bahnkurven vorhersagbar bleiben. Dutzende bis Hunderte Satelliten teilen sich überlappende Strahlen und Frequenzen. Dadurch addieren sich Ko-Kanal-Interferenzen zur absichtlichen Störung, und ein gestörter Inter-Satelliten-Link kann zu einem regionalen Ausfall führen.