El anti-jamming con aprendizaje por refuerzo profundo multiagente distribuido (DMDRL) permite que satélites LEO, radios cognitivas y drones elijan espectro y haces sin un plan de frecuencias manual. Aquí reviso mecanismos, algoritmos como VDN y QMix, y los resultados que reportan las simulaciones.

¿Por qué las redes de satélites LEO son tan vulnerables a la interferencia intencional y co-canal?

Los satélites LEO orbitan a unos cuantos cientos de kilómetros de altura, y eso los deja muy expuestos: cualquier interferencia lanzada desde tierra puede alcanzar el enlace, sobre todo porque las trayectorias orbitales se pueden predecir con bastante precisión. Ahí el atacante lleva las de ganar, pues sabe dónde va a estar el satélite y en qué momento. Y si a eso le sumamos que decenas o cientos de satélites comparten haces y frecuencias que se traslapan, la interferencia co-canal termina encimándose al jamming intencional.

Lo que de verdad preocupa en operación es el efecto cascada. Basta con que un solo enlace inter-satélite se degrade para que los errores de enrutamiento se vayan propagando y acabemos con una caída del servicio a nivel regional. Revisando arquitecturas de mega constelaciones me he dado cuenta de que el cuello de botella no está nada más en la potencia de la señal, sino en la coordinación: si cada nodo elige su frecuencia por su cuenta, el sistema entero pierde eficiencia espectral. Justo por eso los enfoques distribuidos con aprendizaje multiagente se convirtieron en el centro de la investigación reciente.

¿Cómo habilita el aprendizaje por refuerzo multiagente el acceso al espectro anti-interferencia?

Cada satélite o radio opera como un agente autónomo que decide con puros datos locales: la potencia que recibe, los niveles de interferencia que alcanza a detectar a su alrededor, el estado de su cola de transmisión y su posición dentro de la constelación o la red. Con esa información tan limitada, y sin una vista completa del sistema, el agente tiene que resolver en qué frecuencia transmitir y cómo apuntar sus haces. Aquí entra el crítico centralizado: durante el entrenamiento se encarga de evaluar el resultado conjunto de las acciones de todos los agentes, de manera que cada uno recibe retroalimentación sobre qué tan buena fue su aportación al desempeño global. Tras repetir ese ciclo durante muchos episodios, terminan aprendiendo políticas de acceso al espectro y de conformación de haces que les permiten esquivar el jamming y la interferencia co-canal sin que nadie les haya diseñado a mano un plan de frecuencias. Y esto es clave, porque en un entorno congestionado no puedes confiarte de un controlador central que reciba telemetría en tiempo real: los enlaces de retorno podrían estar interferidos justo cuando más se necesitan, y la latencia de coordinar cada decisión desde un solo punto volvería imposible reaccionar a un ataque dinámico. Al repartir la inteligencia en cada nodo, la red conserva su capacidad de adaptación incluso cuando la coordinación central se cae.

El mecanismo se apoya en el bucle percepción-decisión-acción que Yang et al. formalizaron en su encuesta arXiv 2508.11687 (11 de agosto de 2025) para comunicaciones con drones, donde combinan teoría de juegos con aprendizaje por refuerzo. En la práctica, esto tiene una ventaja bien concreta: el agente no necesita conocer de antemano el modelo del jammer, sino que va aprendiendo por prueba y error qué combinaciones de frecuencia, potencia y haz le reportan la mejor recompensa acumulada. Y en simulaciones, ese aprendizaje emergente suele quedar por encima de las políticas heurísticas de salto de frecuencia, sobre todo cuando hay varios interferidores con patrones que cambian con el tiempo.

¿Qué papel juega el entrenamiento centralizado con ejecución descentralizada (CTDE)?

El entrenamiento centralizado con ejecución descentralizada, mejor conocido como CTDE por sus siglas en inglés, ataca uno de los problemas más incómodos del anti-jamming distribuido: ¿cómo le haces para coordinar decenas o hasta cientos de nodos sin depender de enlaces que el propio interferidor puede tirar? Durante el entrenamiento, un crítico centralizado observa el estado conjunto y las recompensas de todos los agentes, lo cual da una señal de aprendizaje bastante más estable y permite que las políticas individuales se ajusten pensando en el resultado colectivo, no nada más en el beneficio local. A la hora de ejecutar, en cambio, cada satélite se apoya solo en su propia política y en sus observaciones locales —potencia recibida, niveles de interferencia, estado de las colas, posición—, así que no necesita tener un enlace vivo hacia un controlador terrestre ni hacia el resto de la constelación en un entorno disputado. Esa separación entre entrenar con información global y operar con información local es justo lo que hace viable el despliegue en constelaciones grandes, y por eso trabajos como el de Cao et al. (MDPI Electronics, 2025) reportan mejoras en eficiencia de entrenamiento y menor sobrecarga de comunicación al aplicar CTDE con redes de descomposición de valor.

Cao et al., en MDPI Electronics 14(16):3307 (2025), aplicaron la descomposición de valor (VDN) al acceso anti-jamming en redes satelitales LEO, y lo hicieron bajo el esquema CTDE para mejorar la eficiencia de entrenamiento y reducir el overhead de comunicación entre nodos. Vale la pena detenerse en el matiz: el crítico centralizado solo existe durante la fase de aprendizaje, cuando alguien puede observar el resultado conjunto de las acciones de todos los agentes. Ya con el sistema desplegado, cada satélite decide con lo que tiene a la mano —potencia recibida, niveles de interferencia, estado de colas— y ningún nodo depende de la retroalimentación central para actuar. Esa independencia es justo lo que permite aguantar la pérdida de enlaces. Y en un escenario donde el propio enlace de control puede estar interferido, esa propiedad no es un lujo, es un requisito.

¿Qué algoritmos impulsan el anti-jamming distribuido: VDN, QMix y MP-DQN?

Los algoritmos de descomposición de valor son, sin duda, el pilar sobre el que se sostienen estos sistemas. VDN, por ejemplo, parte de la función de valor-acción conjunta y la divide en valores individuales por agente; así se puede asignar el crédito entre decenas o cientos de nodos sin que el espacio de acciones se vuelva inmanejable. Por su parte, QMix —que Cai et al. (2025) usaron para la toma cooperativa de decisiones de jamming— lleva esa descomposición un paso más allá: emplea una red de mezcla monotónica que flexibiliza las restricciones de VDN y logra capturar interacciones entre agentes más complejas.

Wang et al. (2025) armaron un algoritmo multiagente que combina tres cosas: repetición de experiencia priorizada, regularización por entropía y centrado de recompensas. La idea es atacar un problema de siempre en el aprendizaje por refuerzo: cuando varios agentes están aprendiendo a la vez, el entorno deja de ser estacionario desde la perspectiva de cada uno, porque las políticas de los demás van cambiando sobre la marcha. La repetición priorizada hace que el aprendizaje se concentre en las transiciones más informativas, la entropía mantiene un poco de exploración y el centrado de recompensas evita que los cambios de escala desestabilicen las actualizaciones. Del lado del radar, Feng Xie et al. (Journal of Radars, 12(6):1290-1304, 2023) propusieron DRL en dominio complejo para radar ágil en frecuencia, y lograron bajar el tiempo de decisión promedio a 405.3 ms frente a dos algoritmos clásicos de RL. Aquí lo interesante es que procesar las señales directamente en el dominio complejo deja aprovechar la información de fase que los enfoques basados solo en magnitud normalmente tiran a la basura, y eso es clave cuando el radar tiene que ir saltando entre frecuencias para esquivar la interferencia. La siguiente tabla resume el enfoque y el aporte de cada trabajo.

Trabajo Enfoque Aporte principal
Wang et al. (2025) Algoritmo multiagente con repetición de experiencia priorizada, regularización por entropía y centrado de recompensas Mejora la estabilidad y la exploración en entornos no estacionarios
Feng Xie et al. (Journal of Radars, 12(6):1290-1304, 2023) DRL en dominio complejo para radar ágil en frecuencia Tiempo de decisión promedio de 405.3 ms, frente a dos algoritmos clásicos de RL

¿Qué ganancias de rendimiento y compensaciones reportan las simulaciones?

Los números publicados apuntan todos hacia lo mismo: coordinar a los agentes mejora el desempeño anti-jamming, sí, pero no es gratis. Sale caro en tiempo de entrenamiento y en eficiencia de muestras. Un caso que lo ilustra bien es el de Nguyen et al. (arXiv 2512.08341, enviado el 9 de diciembre de 2025 para IEEE ICC 2026). Ellos combinaron un crítico centralizado con actores descentralizados en redes colaborativas de relés con drones que operan bajo jamming. En sus simulaciones reportaron alrededor de 50% más de throughput total del sistema y una tasa de colisión prácticamente nula. Además, los agentes desarrollaron una estrategia anti-jamming emergente sin que nadie la programara de forma explícita. O sea, la ganancia en rendimiento es clara, pero se paga con un proceso de aprendizaje más pesado y demandante en cómputo. Es un compromiso que se repite en buena parte de la literatura reciente sobre MARL anti-jamming.

Las simulaciones reportadas en la literatura reciente coinciden en una idea central: coordinar a varios agentes mejora la capacidad anti-jamming, pero esa mejora viene acompañada de costos que conviene mirar con lupa. Li et al. (IEEE, 2026) proponen DMDRLA, un método DRL multiagente distribuido pensado para mega constelaciones LEO, y en sus experimentos el eje del análisis es precisamente ese equilibrio: cuánto cuesta entrenar el sistema frente a cuánto se gana en optimización del rendimiento. En una línea parecida, Elleuch et al. (2021) estudiaron RL multiagente distribuido donde los usuarios aprenden de forma cooperativa; sus simulaciones no solo elevaron las tasas de transmisión y lograron eliminar la interferencia mutua, sino que además mostraron la mayor velocidad de convergencia entre los esquemas comparados, un punto clave cuando el entorno cambia rápido. Aref et al. atacaron el problema desde otra trinchera: radios cognitivas autónomas de banda ancha (WACR) operando en un entorno multiagente, con el objetivo de encontrar políticas óptimas de anti-jamming y de evitación de interferencia. Zhang et al. (2021) se enfocaron en el acceso multi-usuario a canales con canales parcialmente superpuestos (POC), un escenario donde la interferencia no es binaria sino gradual, y Janiar et al. (2023) sumaron aprendizaje por transferencia para que un agente DRL aprenda rápido en redes inalámbricas dinámicas bajo ataques de jamming, reduciendo así el tiempo de adaptación. Visto en conjunto, el patrón es consistente: la cooperación distribuida rinde frutos en throughput, interferencia y convergencia, siempre que se acepte el precio en complejidad de entrenamiento y eficiencia de muestras.

¿En qué se diferencian las aplicaciones de relés con drones y de radar anti-jamming?

En el caso de los relés con drones, lo que se busca por encima de todo es que el enlace de datos no se caiga mientras la flota se reposiciona; por eso el agente tiene que mover varias palancas a la vez: la trayectoria de vuelo, la potencia de transmisión y la selección de canal. Es un problema de movilidad y conectividad, donde el entorno cambia rápido porque los propios nodos se mueven. En cambio, un radar ágil en frecuencia opera bajo otra lógica: aquí el agente decide qué frecuencia emitir en cada pulso para esquivar la interferencia sin sacrificar la detección. El objetivo ya no es el throughput ni la latencia, sino la probabilidad de detección y el tiempo de decisión. Feng Xie et al. (Journal of Radars, 2023) reportan que su enfoque de DRL en dominio complejo para radar ágil redujo el tiempo promedio de decisión a 405.3 ms, muy por debajo de dos algoritmos clásicos de RL. Son, pues, dominios distintos: uno pelea por mantener vivo el flujo de datos entre nodos móviles; el otro, por ver sin ser visto en un espectro hostil.

Las radios cognitivas de banda ancha (WACR, por sus siglas en inglés) ocupan un punto intermedio entre esos extremos, y no es un lugar cómodo. A diferencia de un satélite LEO, que puede planear sus decisiones de espectro con relativa holgura, una WACR tiene que barrer un rango amplio de frecuencias, detectar qué porciones están siendo atacadas y reaccionar en cuestión de milisegundos, todo con un hardware mucho más limitado en antenas, filtros y capacidad de cómputo. Esa asimetría explica por qué Aref et al. plantean el anti-jamming en radios cognitivas como un problema multiagente: varias radios compiten y cooperan al mismo tiempo por el mismo espectro, y una política óptima de evitación de interferencia para una puede degradar a las demás si no se coordinan. En los drones, en cambio, el reto dominante suele ser mantener el enlace del relé bajo jamming mientras se vuela; en el radar de frecuencia ágil, lo que pesa es la latencia de decisión, como muestran Feng Xie et al. al bajar el tiempo promedio de decisión a 405.3 ms frente a dos algoritmos clásicos de RL. La siguiente tabla compara los cuatro escenarios en términos de métrica principal y reto dominante.

Escenario Métrica principal Reto dominante Referencia
Constelaciones LEO masivas Rendimiento anti-jamming vs. costo de entrenamiento Coordinar decenas o cientos de nodos con observaciones locales Li et al. (IEEE, 2026); Cao et al. (MDPI Electronics, 2025)
Relés con drones Throughput total del sistema (~50% mayor) y tasa de colisión casi nula Mantener el enlace bajo jamming con política emergente Nguyen et al. (arXiv 2512.08341, IEEE ICC 2026)
Radios cognitivas de banda ancha Política óptima de anti-jamming y evitación de interferencia Sentir espectro amplio y decidir en milisegundos con hardware limitado Aref et al. (WACR, multiagente)
Radar de frecuencia ágil Tiempo promedio de decisión (405.3 ms) Latencia estricta y decisiones en dominio complejo Feng Xie et al. (Journal of Radars, 2023)

¿Cuáles son los compromisos reales al desplegar MARL anti-jamming?

El primer compromiso es entre coordinación y eficiencia de muestras. Un crítico centralizado acelera la convergencia, pero exige episodios de entrenamiento con estado conjunto que en el mundo real son costosos de recolectar o simular con fidelidad. El segundo es la no estacionariedad: cuando todos los agentes aprenden a la vez, el entorno de cada uno cambia constantemente, y técnicas como la repetición priorizada o la regularización por entropía de Wang et al. (2025) existen precisamente para amortiguar ese efecto.

El tercero es la transferencia al hardware. Un agente entrenado en simulador puede degradarse en órbita por latencia, ruido térmico o fallas parciales, y por eso el aprendizaje por transferencia que propone Janiar et al. (2023) resulta relevante: permite adaptar políticas ya entrenadas a condiciones nuevas sin reentrenar desde cero. Mi lectura es que el campo avanza hacia políticas más robustas y menos dependientes de supuestos ideales sobre los enlaces de control.

¿Qué viene en la investigación de MARL para espectro anti-jamming?

La agenda se está moviendo en tres direcciones claras. Primero, escalar la descomposición de valor a cientos de nodos sin que el crítico centralizado se vuelva el cuello de botella, que es justo lo que ataca DMDRLA de Li et al. para mega constelaciones. Segundo, integrar percepción y decisión en un solo bucle cerrado, como formaliza la encuesta de Yang et al. (arXiv 2508.11687, 11 de agosto de 2025) para drones. Tercero, validar en hardware real y no solo en simulador.

Para quien opera constelaciones LEO, la implicación práctica es que el plan de frecuencias estático ya no es suficiente frente a jammers adaptativos. Los resultados reportados, desde el 50% más de throughput de Nguyen et al. hasta la convergencia más rápida de Elleuch et al. (2021), apuntan a que el valor está en la coordinación aprendida, no en reglas fijas. Eso sí, conviene medir el costo de entrenamiento antes de prometer mejoras en producción.

Preguntas frecuentes sobre anti-jamming con MARL

EscenarioMétrica principalReto dominanteReferencia
Mega constelación LEORendimiento vs. costo de entrenamientoEscalar la asignación de créditoLi et al., IEEE 2026
Acceso al espectro LEOEficiencia de entrenamientoOverhead de comunicaciónCao et al., MDPI 2025
Relés con dronesThroughput totalColisiones y movilidadNguyen et al., arXiv 2512.08341
Radar ágil en frecuenciaTiempo de decisión (405.3 ms)Detección bajo interferenciaFeng Xie et al., 2023

Preguntas frecuentes

¿Cómo habilita el aprendizaje por refuerzo multiagente el acceso al espectro anti-interferencia?

Cada satélite o radio actúa como un agente que usa solo observaciones locales: potencia recibida, niveles de interferencia, estado de la cola y posición. Durante el entrenamiento un crítico centralizado evalúa el resultado conjunto, y tras muchos episodios los agentes aprenden políticas de acceso al espectro y de haces que evitan el jamming y la interferencia co-canal sin un plan de frecuencias diseñado a mano.

¿Qué es el entrenamiento centralizado con ejecución descentralizada en anti-jamming?

CTDE permite que un crítico centralizado vea el estado y las recompensas conjuntas durante el entrenamiento, lo que mantiene el aprendizaje estable y habilita la coordinación. En tiempo de ejecución cada satélite se apoya solo en su política y observaciones locales, así que no necesita un enlace vivo hacia un controlador terrestre ni hacia todos los demás satélites en un entorno disputado.

¿Qué ganancias de rendimiento reportan los sistemas anti-jamming con CTDE?

Nguyen et al. (arXiv 2512.08341, enviado el 9 de diciembre de 2025 para IEEE ICC 2026) combinaron un crítico centralizado con actores descentralizados en redes colaborativas de relés con drones bajo jamming. Reportaron alrededor de 50% más de throughput total del sistema y una tasa de colisión cercana a cero, con una estrategia anti-jamming emergente desarrollada sin programación explícita.

¿Por qué las redes de satélites LEO son vulnerables al jamming y a la interferencia co-canal?

Los satélites LEO orbitan a unos cientos de kilómetros, así que cada enlace queda al alcance de interferencia terrestre y las trayectorias orbitales son muy predecibles. Decenas o cientos de satélites comparten haces y frecuencias superpuestas, por lo que la interferencia co-canal se suma al jamming deliberado, y un enlace inter-satélite dañado puede escalar a una caída regional del servicio.