LLM anti-jamming en comunicaciones inalámbricas: RL, DRL y beamforming para enlaces resistentes

Los modelos de lenguaje grande (LLM) y el aprendizaje por refuerzo se combinan para mantener vivos los enlaces inalámbricos bajo interferencia deliberada. Repasamos MAPPO, beamforming analógico-digital en 5G mmWave, RIS y los datos medidos de latencia, energía y confiabilidad.
¿Qué es el anti-jamming con LLM en comunicaciones inalámbricas?
El anti-jamming con LLM en comunicaciones inalámbricas consiste en mantener vivo un enlace útil cuando alguien intenta bloquearlo a propósito. Para lograrlo se apoya en dos piezas: los modelos de lenguaje grande, que razonan sobre el entorno, y el aprendizaje por refuerzo (RL), que decide en tiempo real cómo mover la potencia, el canal o el haz. En mi experiencia revisando despliegues de laboratorio, lo que realmente marca la diferencia no es una sola técnica, sino la orquestación: el LLM interpreta el contexto operativo y el agente RL ejecuta la acción física.
El punto clave aquí es que los jammers de hoy ya no son estáticos: cambian de estrategia sobre la marcha, te empujan hacia ciertos modos de comunicación y hasta pueden montar un ataque de denegación de servicio. Y ojo, porque el espectro ensanchado por sí solo no te salva: si la mayoría de los canales está bloqueada, la SINR no va a subir por arte de magia. Por eso los esquemas que se usan actualmente apuestan por combinar varias cosas a la vez —mitigación de interferencia, movilidad del usuario y una especie de reconocimiento implícito del ataque—, en lugar de depender de identificar con precisión la forma de onda del jammer.
En la literatura y en las pruebas de laboratorio te vas a topar seguido con estos términos: anti-jamming, mitigación de jamming, resistente a interferencia, supresión de interferencia, RL, DRL (aprendizaje por refuerzo profundo), MAPPO, CTDE, MIMO-OFDM, mmWave, beamforming, RIS, SINR, QPSK, USRP y banco de pruebas OTA. No es nada del otro mundo, pero conviene tenerlos bien ubicados, porque así se te facilita leer especificaciones técnicas y comparar resultados entre papers y reportes técnicos.
¿Cómo funciona el anti-jamming basado en RL para inferencia de LLM en el mar?
Hay un caso que está bien documentado y sirve para aterrizar todo esto: el esquema marítimo basado en RL para inferencia de LLM que publicó H. Liu en 2026. La idea es que el equipo de usuario (UE) ajuste sobre la marcha la potencia de enlace ascendente, el canal y la transmisión de datos, de manera que la inferencia del modelo no se venga abajo cuando aparece la interferencia. Para probarlo, montaron UEs con Jetson Orin, cámara y sensores BME280, que se encargan de mandar datos de temperatura de 200 KB.
Las pruebas con 4 UEs en el puerto arrojan 40.5% menos latencia y 46.4% menos consumo de energía del UE; hay una tercera ganancia, pero en la fuente aparece cortada. Para quien diseña redes, lo importante es que el agente RL no anda adivinando: mide, decide y vuelve a medir, y así va ajustando el enlace ascendente para sostener la tarea de inferencia, no solo para exprimir el throughput.
Esto es clave, sobre todo en escenarios marítimos o de emergencia, donde la comunicación inalámbrica termina siendo el único canal de mando y control. Y cuando el enlace se cae, no solo se pierden datos: se pierde la capacidad de decidir. Por eso el RL no se entrena nada más para exprimir la tasa binaria bruta, sino para mantener vivo el servicio de inferencia; o sea, la continuidad pesa más que el pico de throughput.
¿Qué es el algoritmo de decisión anti-jamming MAPPO?
El algoritmo inteligente de decisión anti-jamming para comunicaciones inalámbricas se apoya en Multi-Agent Proximal Policy Optimization (MAPPO). ¿Y eso qué quiere decir? Que combina el entrenamiento centralizado con la ejecución descentralizada, o sea, el famoso CTDE: mientras se entrena, los agentes comparten información entre sí; ya en operación, cada usuario toma sus propias decisiones por su cuenta. De esta forma se saca provecho del aprendizaje colectivo, pero sin necesidad de tener un coordinador central en el campo.
En la práctica, MAPPO no cambia todo de golpe, sino que va ajustando la comunicación poco a poco para aguantar el embate de un jammer inteligente y muy dinámico. ¿La ventaja frente a las reglas fijas? Que el agente aprende políticas capaces de reaccionar cuando el jammer cambia de estrategia, en lugar de quedarse atorado con lo que ya tenía programado. Claro que no todo es miel sobre hojuelas: el entrenamiento sale caro y exige simular con bastante fidelidad tanto el canal como al atacante. Y ahí está el detalle, porque si el modelo del jammer está sesgado, la política que tanto costó aprender termina fallando en el mundo real.
Este enfoque no es el único dentro del DRL. También existe, por ejemplo, el esquema hotbooting deep Q-network, que combina redes convolucionales profundas con técnicas de macro-acciones (arXiv 1712.06793v1, 19 de diciembre de 2017). ¿Su objetivo? Mejorar la SINR y la utilidad frente al jamming cooperativo. ¿Cómo lo logra? Haciendo que el dispositivo móvil se salga de la frecuencia o del área donde la interferencia es más fuerte.
¿Cómo suprime el jamming el beamforming analógico-digital conjunto en 5G mmWave?
En un receptor 5G mmWave, el beamforming analógico se apoya en optimización bayesiana con aprendizaje en línea: así el haz se puede reorientar sobre la marcha y la interferencia se atenúa sin necesidad de conocer de antemano la forma de onda del jammer. Luego entra la parte digital, donde la detección con Minimum Mean Square Error modificado (M-MMSE) se encarga de mitigar lo que queda de interferencia residual. Todo esto se probó en un prototipo de banco de pruebas over-the-air (OTA) a 28 GHz, y los resultados mostraron una alta confiabilidad de decodificación incluso bajo jamming dirigido.
La idea detrás de este diseño es repartir el trabajo: la parte analógica responde al instante y la digital se encarga de procesar con mayor inteligencia. Ahí está, básicamente, el equilibrio entre reaccionar rápido y detectar con precisión. En milimétricas el asunto se complica, porque la señal es propensa a la interferencia, a los bloqueos y al jamming; por eso el haz tiene que reconfigurarse de manera continua y no basta con dejarlo ajustado una sola vez durante la instalación.
Para quien compara opciones, conviene mirar el sistema MIMO-OFDM anti-jamming en tiempo real del MSU INSS Lab, que integra transmisor, receptor y un jammer de banda ancha de alta potencia, y usa equipos USRP de National Instruments. Su arquitectura de capa física mitiga jamming fuerte sin conocimiento previo de la forma de onda del atacante, lo que lo vuelve una referencia útil de robustez.
¿Qué alternativas existen: RIS, precodificación y dimensionalidad N+1?
Las estrategias con superficies inteligentes reconfigurables (RIS) aparecen en la encuesta de E. Baccour (2025) sobre anti-jamming en redes de próxima generación, que cubre amenazas y tácticas de mitigación. La idea es controlar el entorno de propagación para que la señal útil llegue reforzada y la interferencia se atenúe, algo atractivo cuando no se puede cambiar la ubicación del transmisor o del receptor.
Otra línea es la precodificación a nivel de símbolo. H. Zhao (2025) cita a Li et al., quienes propusieron manipular las señales de interferencia mediante precodificación de símbolo para formar comunicación de interferencia. En paralelo, el concepto de anti-jamming endógeno por dimensionalidad N+1 (F. Yao, 2023) busca inmunidad innata contra diversos ataques sin reconocimiento preciso del jamming, relevante en guerra y emergencias donde el inalámbrico es el único medio de mando.
También hay trabajos sobre ocultamiento y anti-jamming inteligente con un marco DRL paralelizado contra jamming reactivo (Y. Li, 2025), y sobre anti-jamming bajo jamming no estacionario mediante meta-aprendizaje federado (3 de septiembre de 2026), donde el DRL profundo se aplica ampliamente al problema. La teoría de juegos y el RL para anti-jamming (L. Jia, 2024) refuerzan que las redes inalámbricas son vulnerables y que mitigar es esencial para comunicar de forma confiable.
¿Qué datos de rendimiento hay en latencia, energía y decodificación?
Los números medidos son el mejor antídoto contra el marketing. En el caso marítimo con 4 UEs, la latencia bajó 40.5% y el consumo del UE 46.4%. En 5G mmWave, el banco OTA a 28 GHz mostró alta confiabilidad de decodificación bajo jamming dirigido. Y en el sistema OFDM de H. Zeng, cada símbolo tiene 64 subportadoras, de las cuales 52 se usan para carga útil con modulación QPSK. Esa combinación de métricas permite comparar esquemas con criterios comunes.
Para juzgar si un esquema sirve en tu red, conviene separar métricas de enlace, de energía y de cómputo. La tabla siguiente resume los puntos de referencia más citados y su aporte principal, con el año de publicación cuando la fuente lo indica.
| Esquema | Métrica clave | Aporte principal |
|---|---|---|
| RL marítimo para inferencia LLM (H. Liu, 2026) | 40.5% menos latencia; 46.4% menos energía del UE | Optimiza potencia, canal y datos con 4 UEs y Jetson Orin |
| MAPPO (F. Zhang, 2025) | CTDE con decisiones independientes | Decisiones multiagente contra jamming inteligente |
| Beamforming conjunto 5G mmWave | OTA a 28 GHz | Bayesiano en línea más detección M-MMSE |
| OFDM de H. Zeng | 64 subportadoras, 52 de carga, QPSK | Base de referencia para carga útil |
| Dimensionalidad N+1 (F. Yao, 2023) | Inmunidad innata | Sin reconocimiento preciso del jamming |
También hay referencias de tasa alcanzable bajo jamming en UAV 5G (J. Viana, 2025, IEEE Wireless Communications Letters, 14(12), 4042-4046) y trabajos de enrutamiento de UAV asistido por LLM contra ataques de jamming (17 de julio de 2026). Además, en diciembre de 2025 se reportó un sistema de IA que protege redes inalámbricas detectando y respondiendo al jamming en tiempo real, con posible papel crítico en servicios de emergencia y salud en Canadá.
¿Cuáles son los riesgos y limitaciones que debes considerar?
El primer riesgo es que el jammer también aprende. Si cambia de política de forma dinámica, induce modos de comunicación específicos o lanza denegación de servicio, una política RL entrenada con un modelo estático se degrada. El segundo es que el espectro ensanchado no basta: si la mayoría de los canales está bloqueada, la SINR no sube por repartir energía en más ancho de banda.
El tercero es físico: mmWave es sensible a interferencia, bloqueo y jamming, así que el beamforming necesita reajustarse de forma continua. El cuarto es económico: existe un compromiso entre eficiencia de comunicación y costo de seguridad, y entre adaptación analógica rápida y procesamiento digital inteligente. Ningún esquema gana en todas las dimensiones a la vez.
Mi recomendación práctica es definir primero la métrica que no puedes sacrificar (latencia, energía, tasa o continuidad) y luego elegir la combinación de RL, beamforming y RIS que la proteja. Si el enlace es el único medio de mando y control, la continuidad pesa más que el pico de throughput. Este artículo es técnico y no constituye asesoría de inversión.
¿Cómo evaluar y desplegar una solución anti-jamming paso a paso?
Un despliegue sensato empieza por caracterizar la amenaza: qué tipo de jamming enfrentas, en qué bandas y con qué potencia. Después se elige la capa física (beamforming, MIMO-OFDM, RIS) y la capa de decisión (MAPPO, DRL, hotbooting DQN). Solo entonces se define el banco de pruebas, idealmente con equipos USRP y mediciones OTA, porque los resultados en simulación no siempre se trasladan al campo.
El siguiente paso es entrenar con CTDE cuando haya múltiples usuarios, y validar con jammers que cambien de estrategia. Finalmente se monitorea latencia, energía, SINR y tasa de decodificación en operación real, y se reentrena cuando el entorno cambie. La meta no es eliminar el jamming, sino mantener la función crítica viva mientras el atacante insiste.
Preguntas frecuentes sobre anti-jamming inalámbrico con LLM
¿Cómo funciona el anti-jamming con LLM en comunicaciones inalámbricas?
Un esquema marítimo basado en aprendizaje por refuerzo permite que el equipo de usuario optimice potencia de enlace ascendente, canal y transmisión de datos para la inferencia del LLM. Se implementa en UEs con Jetson Orin, cámara y sensores BME280 que envían datos de temperatura de 200 KB, logrando 40.5% menos latencia y 46.4% menos consumo de energía del UE.
¿Qué es el algoritmo de decisión anti-jamming MAPPO?
El algoritmo inteligente de decisión anti-jamming se basa en Multi-Agent Proximal Policy Optimization (MAPPO). Combina entrenamiento centralizado con ejecución descentralizada (CTDE), permitiendo que cada usuario decida de forma independiente mientras aprovecha el entrenamiento compartido, y optimiza gradualmente la comunicación frente a jamming inteligente de alta dinámica.
¿Cómo suprime el jamming el beamforming analógico-digital conjunto en 5G mmWave?
Un receptor 5G mmWave usa optimización bayesiana con aprendizaje en línea para el beamforming analógico, adaptando la dirección del haz y suprimiendo interferencia, más detección digital con Minimum Mean Square Error modificado (M-MMSE) para la interferencia residual. Un banco de pruebas over-the-air a 28 GHz validó alta confiabilidad de decodificación bajo jamming dirigido.
¿Qué es el enfoque de anti-jamming endógeno por dimensionalidad N+1?
El concepto de anti-jamming endógeno por dimensionalidad N+1 busca dar al sistema inmunidad innata contra diversos ataques de jamming sin reconocimiento preciso del atacante. Se describe como relevante en situaciones de guerra y emergencia donde la comunicación inalámbrica es el medio principal o único de mando y control.