Aprendizado por Reforço Profundo Multiagente Distribuído para Antijamming em Redes LEO, UAV e Radar

Satélites LEO, drones e radares cognitivos enfrentam interferência deliberada e co-canal; o aprendizado por reforço multiagente distribuído aprende políticas de acesso ao espectro sem plano de frequência manual. Veja mecanismos, algoritmos e ganhos relatados.
Por que redes de satélites LEO são tão vulneráveis a jamming e interferência co-canal?
Os satélites LEO giram a apenas algumas centenas de quilômetros de altitude — o que, na prática, deixa quase todo enlace ao alcance de interferências vindas do solo. Some-se a isso o fato de que suas trajetórias orbitais são altamente previsíveis: um adversário consegue posicionar transmissores de jamming no momento e no lugar exatos, sem precisar de grande sofisticação. É essa combinação de baixa altitude com previsibilidade que transforma cada feixe em um alvo relativamente fácil de atacar.
Tem ainda a questão da densidade. Em constelações grandes, dezenas ou até centenas de satélites compartilham feixes e faixas de frequência sobrepostas, e aí a interferência co-canal vem se somar ao jamming deliberado. Funciona mais ou menos como uma rodovia congestionada: além dos bloqueios propositais, o simples volume de veículos já cria engarrafamento por conta própria. Na prática, isso significa que um único enlace inter-satélite comprometido pode disparar uma falha regional em cascata, porque o roteamento depende de vizinhos que também estão sob ataque. Quando um nó cai, a carga migra para os adjacentes, que tendem a sobrecarregar e falhar logo em seguida. E tem uma restrição de projeto que muita gente ignora: em ambientes contestados, não dá para assumir que existe um canal de controle limpo para coordenar as decisões, já que esse canal também pode estar sob jamming. É justamente por isso que arquiteturas nas quais cada nó decide com base apenas em observações locais se tornam tão atraentes.
É esse cenário de vulnerabilidade que motivou Li et al. (IEEE, 2026) a criar o DMDRLA, um método distribuído de DRL multiagente voltado especificamente para megaconstelações LEO. A ideia central é não concentrar toda a inteligência em um único ponto — afinal, se esse ponto fica congestionado ou é comprometido, a defesa inteira vai junto. Em vez disso, o aprendizado fica espalhado entre os nós da constelação, e cada um toma decisões com base no que enxerga localmente: potência recebida, níveis de interferência, estado das filas e posição orbital. Agora, as simulações não vendem milagre. Elas colocam na balança o custo de treinamento de um lado e a otimização de desempenho do outro, e o recado é claro: cooperar entre agentes melhora sim o resultado antijamming, mas isso tem preço — mais tempo de treino e menor eficiência amostral. É aquele trade-off clássico de sistemas distribuídos: quanto mais nós colaboram, mais robusta fica a resposta ao jammer, só que também fica mais caro ensinar esse comportamento coletivo antes que ele funcione de verdade no mundo real.
Como o aprendizado por reforço multiagente viabiliza o acesso antijamming ao espectro?
Cada satélite ou rádio opera como um agente autônomo, tomando decisões com base apenas no que consegue medir localmente: potência recebida, níveis de interferência, estado da fila de transmissão e sua própria posição orbital ou geográfica. E isso não é por acaso. Em cenários reais de jamming, os canais de comunicação entre os nós podem estar bloqueados ou degradados exatamente pelo atacante, então depender de informação global simplesmente não funciona. A saída para esse impasse está na arquitetura de treinamento centralizado com execução descentralizada, o CTDE. Na fase de treinamento, um crítico centralizado acompanha o resultado conjunto das ações de todos os agentes e vai ajustando as políticas de cada um. Já em operação, cada agente decide por conta própria, sem precisar trocar mensagens com os outros. Com o tempo, ao longo de muitos episódios, esse processo faz com que os agentes aprendam políticas de acesso ao espectro e de formação de feixe capazes de driblar jamming e interferência co-canal — tudo sem nenhum plano de frequência desenhado à mão. A coordenação, nesse caso, emerge do aprendizado, não de regras fixas.
| Observação local usada pelo agente | Decisão aprendida |
|---|---|
| Potência recebida | Acesso ao espectro |
| Níveis de interferência | Formação de feixe |
| Estado da fila | Momento de transmissão |
| Posição | Seleção de canal |
A lógica por trás dessa abordagem é que a inteligência antijamming não surge de um conjunto fixo de regras, mas da interação entre os nós da rede. Em vez de determinar de antemão qual frequência, feixe ou janela de transmissão cada agente deve utilizar, o sistema fornece recompensas com base no desempenho coletivo — taxa de transmissão, colisões evitadas, interferência reduzida — e deixa que os agentes descubram por conta própria, via tentativa e erro, padrões de coordenação que funcionam. Esse modelo de aprendizado se mostra especialmente útil quando o ambiente muda depressa, como acontece sob jamming dinâmico ou interferência co-canal imprevisível: a política aprendida se adapta a novas condições sem precisar de reengenharia manual nem de reconfiguração centralizada. Na prática, cada satélite, rádio cognitivo ou relé UAV enxerga apenas informações locais — potência recebida, nível de interferência, estado da fila, posição — e toma decisões de forma autônoma, enquanto o aprendizado coletivo faz emergir estratégias que nenhum agente conseguiria sozinho. É exatamente essa mistura de autonomia local com coordenação implícita que torna o MARL tão atraente para cenários de espectro disputado, onde regras fixas ficam obsoletas rápido demais.
A literatura cobre várias vertentes desse princípio. Elleuch et al. (2021), por exemplo, investigaram o RL multiagente distribuído em cenários nos quais os usuários aprendem de forma cooperativa. Nas simulações, o método elevou as taxas de transmissão, eliminou a interferência mútua entre os nós e ainda apresentou a convergência mais rápida quando comparado aos demais cenários testados. Já Aref et al. atacam a questão por outro ângulo: usam rádios cognitivos autônomos de banda larga (WACRs) em um ambiente multiagente, com o objetivo de encontrar políticas ótimas tanto de antijamming quanto de evitação de interferência.
Qual é o papel do treinamento centralizado com execução descentralizada?
O CTDE — treinamento centralizado com execução descentralizada — resolve um dilema clássico do aprendizado por reforço multiagente. Durante o treinamento, um crítico centralizado enxerga o estado conjunto e as recompensas de todos os agentes, o que dá ao sistema uma visão global valiosa: sem ela, cada satélite tentaria aprender isoladamente, e o aprendizado ficaria instável, sujeito a oscilações e a decisões contraditórias entre nós vizinhos. Com o crítico central, é possível atribuir crédito corretamente e coordenar políticas que, de outro modo, competiriam entre si. A virada está na execução: em tempo real, cada satélite consulta apenas a própria política e observações locais — potência recebida, nível de interferência, estado das filas, posição. Nenhum enlace vivo de volta a um controlador em solo, nem comunicação com todos os outros satélites, é necessário em ambiente contestado. Isso importa porque, num cenário de jamming, justamente os enlaces de retorno seriam os primeiros a cair; se a execução dependesse deles, a coordenação desmoronaria exatamente quando mais se precisa dela. É essa separação entre "aprender olhando o todo" e "agir olhando o local" que torna o CTDE atraente para redes LEO, rádios cognitivos e enxames de UAV, e que aparece em trabalhos como o de Cao et al. (MDPI Electronics, 2025), que usam VDN para melhorar a eficiência de treino e reduzir o overhead de comunicação.
Tem uma vulnerabilidade no CTDE que muita gente deixa passar: em arquiteturas puramente distribuídas, os canais de coordenação em tempo real viram alvo fácil de jamming. Pensa comigo — se cada agente tivesse que trocar mensagem com os outros a cada decisão de espectro, o adversário ganharia de graça um ponto único de falha para explorar. A sacada do CTDE é justamente essa: empurrar o esforço de coordenação para a fase de treino. Nesse momento, o crítico centralizado enxerga o resultado conjunto das ações de todos os agentes e vai ajustando os valores individuais — é um processo de atribuição de crédito que não precisa rodar em campo. Terminado o treino, cada satélite, rádio cognitivo ou UAV toca sua política usando só observações locais: potência recebida, nível de interferência, estado das filas, esse tipo de coisa. E por que isso importa tanto? Porque em redes LEO de grande escala, os enlaces de coordenação tendem a degradar exatamente nos piores momentos de interferência co-canal. O que sobra é uma política robusta, que não fica refém de uma infraestrutura que o adversário consegue derrubar. Não é à toa que o CTDE se tornou presença quase obrigatória nas arquiteturas antijamming mais recentes, incluindo aquelas que combinam decomposição de valor com aprendizado cooperativo.
O estudo de Cao et al., publicado na MDPI Electronics 14(16):3307 em 2025, mostra bem como o treinamento centralizado com execução descentralizada (CTDE) resolve um problema prático do antijamming em redes de satélites LEO. Os autores usam uma rede de decomposição de valor (VDN) no acesso antijamming ao espectro — e, na prática, o que a VDN faz é quebrar a função de valor conjunta em valores por agente. Isso permite atribuir crédito a cada nó mesmo quando dezenas ou centenas de satélites tomam decisões ao mesmo tempo. Resultado: o treino fica mais eficiente e o overhead de comunicação diminui, já que os agentes não precisam trocar informações de estado entre si a cada decisão. É algo crítico quando os próprios enlaces de coordenação podem estar sob ataque. Vale destacar que o ganho relatado não se resume ao desempenho antijamming — ele também aparece no custo do aprendizado, com menos tempo de treino e menos amostras desperdiçadas. É exatamente esse tipo de economia que torna a abordagem viável em constelações massivas, onde o volume de agentes inviabiliza métodos puramente centralizados.
Quais algoritmos sustentam o antijamming distribuído: VDN, QMix e MP-DQN?
A decomposição de valor é o que permite atribuir crédito em redes com dezenas ou até centenas de nós. Pensa assim: cada satélite, rádio cognitivo ou UAV funciona como um agente que só tem acesso às suas observações locais — potência recebida, nível de interferência, estado das filas, posição —, mas o resultado que realmente interessa (taxa de transmissão, colisões, throughput agregado) é coletivo. A VDN ataca justamente esse descasamento ao quebrar a função de valor-ação conjunta em valores por agente, dando a cada nó uma forma de estimar o quanto ele contribui para o desfecho do grupo. Sem essa fatoração, o sinal de recompensa agregado chegaria tão diluído e ruidoso que seria inviável orientar políticas individuais em escala, ainda mais quando dezenas de agentes disputam o mesmo espectro. Em redes LEO, é esse detalhe que define se a coordenação sai do papel ou se o treinamento simplesmente não converge.
Outros algoritmos atacam o mesmo problema com estratégias diferentes. Cai et al. (2025) aplicam o QMix, algoritmo de RL multiagente, à tomada de decisão cooperativa de jamming. Wang et al. (2025) projetam um algoritmo de RL multiagente que integra replay de experiência priorizado, regularização por entropia e centralização de recompensa, combinando estabilidade de treino com exploração mais eficiente. Zhang et al. (2021) estudam acesso multi-usuário a canais antijamming com canais parcialmente sobrepostos (POC).
A escolha do algoritmo depende do trade-off entre coordenação e custo. A tabela abaixo resume, de forma qualitativa, o foco de cada linha de trabalho citada, sem inventar números que os artigos não reportam de forma comparável.
Que ganhos de desempenho e trade-offs as simulações relatam?
Nguyen et al. (arXiv 2512.08341, submetido em 9 de dezembro de 2025, para a IEEE ICC 2026) usaram CTDE em redes colaborativas de relés UAV sob jamming. Os resultados mostram cerca de 50% mais throughput total do sistema e taxa de colisão próxima de zero, com os agentes desenvolvendo uma estratégia antijamming emergente, sem programação explícita. É um dos poucos casos com números agregados claros na literatura recente.
No radar, Feng Xie et al. (Journal of Radars, 12(6):1290-1304, 2023) propõem DRL no domínio complexo para antijamming em radar ágil em frequência. O tempo médio de decisão caiu para 405,3 ms, contra dois algoritmos clássicos de RL usados como comparação. O número importa porque radar ágil exige decisão em milissegundos, e o domínio complexo preserva informação de fase que abordagens reais descartam.
Janiar et al. (2023) adicionam aprendizado por transferência para que um agente DRL aprenda rápido em redes sem fio dinâmicas sob ataques de jamming. O trade-off recorrente é claro: coordenação melhora o resultado antijamming, mas custa tempo de treinamento e eficiência amostral. O CTDE evita depender de enlaces que podem estar sob ataque, o que é decisivo em operação real.
Como aplicações de relés UAV e radar antijamming se diferenciam?
Em comunicações UAV, o desafio é topológico e móvel: os relés precisam se reposicionar e escolher canais enquanto a rede muda de forma. Yang et al., em survey publicado no arXiv (2508.11687, 11 de agosto de 2025), formalizam agentes inteligentes antijamming para comunicações UAV com um ciclo fechado de Percepção-Decisão-Ação, combinando teoria dos jogos e RL. O foco está em como o agente percebe o ambiente, decide e age sob interferência dinâmica.
No radar, o problema é diferente: a decisão precisa ser tomada em escala de milissegundos, com restrições de forma de onda e agilidade em frequência. Por isso o trabalho de 2023 sobre DRL no domínio complexo enfatiza latência de decisão, e não throughput de rede. A recompensa também muda: em vez de taxa de transmissão, o radar otimiza detecção e rejeição de interferência.
Em rádios cognitivos, o foco recai sobre políticas de evitação de interferência em banda larga. Aref et al. tratam WACRs em ambiente multiagente buscando políticas ótimas de antijamming e evitação de interferência, enquanto Zhang et al. (2021) olham para acesso multi-usuário com canais parcialmente sobrepostos. O que une os três domínios é a mesma base: observações locais, recompensa agregada e políticas que emergem do treino, não de regras fixas.
Quais são os principais trade-offs ao adotar MARL antijamming em produção?
O primeiro trade-off é custo de treinamento versus desempenho. Li et al. (IEEE, 2026) explicitam essa balança no DMDRLA para megaconstelações LEO: mais coordenação tende a significar mais episódios de treino e maior consumo computacional. Em constelações com centenas de nós, o custo do crítico centralizado cresce, e a decomposição de valor vira necessidade prática, não luxo arquitetural.
O segundo é comunicação versus autonomia. O CTDE reduz a dependência de enlaces em tempo real, mas exige que o treinamento tenha acesso a um estado conjunto confiável. Em campo, isso significa que a fase de treino precisa ocorrer em ambiente controlado ou simulado, e a política resultante precisa generalizar para condições não vistas. Transfer learning, como em Janiar et al. (2023), é uma das respostas a esse problema.
O terceiro é escalabilidade da atribuição de crédito. VDN e QMix resolvem partes do problema, mas cada um tem limites quando o número de agentes cresce e as recompensas ficam mais esparsas. A escolha entre eles, e entre variantes como MP-DQN, depende do domínio: UAV prioriza coordenação móvel, radar prioriza latência, e satélite LEO prioriza escala e robustez a falhas em cascata.
O que esperar da convergência entre RL, teoria dos jogos e redes LEO?
A tendência visível na literatura é a combinação de RL com teoria dos jogos para modelar adversários racionais. O survey de Yang et al. (arXiv 2508.11687, 2025) formaliza o ciclo Percepção-Decisão-Ação e trata o jamming como interação estratégica, não como ruído aleatório. Isso muda o desenho da recompensa e a forma como o agente aprende a antecipar ataques.
Em paralelo, a decomposição de valor amadurece como padrão para escalar o crédito em redes grandes. VDN, QMix e variantes aparecem repetidamente em aplicações de satélite, UAV, rádio cognitivo e radar, o que sugere uma base metodológica comum se consolidando. O CTDE, por sua vez, se firma como a ponte entre coordenação rica no treino e autonomia total na execução.
Para quem opera infraestrutura crítica, a leitura prática é que o antijamming deixa de ser um problema de plano de frequência estático e passa a ser um problema de política aprendida. A pergunta deixa de ser qual frequência usar e passa a ser como treinar agentes que descubram isso sozinhos, de forma rápida, barata e resiliente a enlaces comprometidos.
Perguntas frequentes sobre MARL antijamming
As perguntas abaixo reúnem as dúvidas mais comuns sobre aprendizado por reforço multiagente aplicado a antijamming em redes LEO, UAV e radar, com respostas diretas baseadas na literatura citada ao longo do artigo.
Como o RL multiagente viabiliza o acesso antijamming ao espectro?
Cada satélite ou rádio atua como agente usando apenas observações locais, como potência recebida, níveis de interferência, estado da fila e posição. Durante o treinamento, um crítico centralizado avalia o resultado conjunto; ao longo de muitos episódios, os agentes aprendem políticas de acesso ao espectro e de feixe que evitam jamming e interferência co-canal sem plano de frequência manual. É assim que a coordenação emerge de recompensas agregadas.
O que é treinamento centralizado com execução descentralizada no antijamming?
O CTDE permite que um crítico centralizado veja o estado conjunto e as recompensas durante o treinamento, mantendo o aprendizado estável e viabilizando coordenação. Em execução, cada satélite usa apenas sua própria política e observações locais, sem precisar de enlace vivo com um controlador em solo ou com todos os outros satélites. Isso é essencial quando os canais de coordenação também estão sob jamming.
Quais ganhos de desempenho sistemas antijamming com CTDE relatam?
Nguyen et al. (arXiv 2512.08341, submetido em 9 de dezembro de 2025, para a IEEE ICC 2026) combinaram crítico centralizado com atores descentralizados em redes colaborativas de relés UAV sob jamming. Os resultados apontam cerca de 50% mais throughput total do sistema e taxa de colisão próxima de zero, com estratégia antijamming emergente desenvolvida sem programação explícita, segundo os autores.
Por que redes de satélites LEO são vulneráveis a jamming e interferência co-canal?
Satélites LEO orbitam a poucas centenas de quilômetros, então todo enlace fica ao alcance de interferência baseada em solo, e as trajetórias orbitais são altamente previsíveis. Dezenas ou centenas de satélites compartilham feixes e frequências sobrepostos, fazendo a interferência co-canal somar-se ao jamming deliberado. Um enlace inter-satélite comprometido pode cascatear e causar uma falha regional.
Perguntas frequentes sobre MARL antijamming
O que é treinamento centralizado com execução descentralizada no antijamming?
O CTDE permite que um crítico centralizado veja o estado conjunto e as recompensas durante o treinamento, mantendo o aprendizado estável e viabilizando coordenação. Em execução, cada satélite usa apenas sua própria política e observações locais, sem precisar de enlace vivo com um controlador em solo ou com todos os outros satélites, o que é essencial quando os canais de coordenação também estão sob jamming.
Quais ganhos de desempenho sistemas antijamming com CTDE relatam?
Nguyen et al. (arXiv 2512.08341, submetido em 9 de dezembro de 2025, para a IEEE ICC 2026) combinaram crítico centralizado com atores descentralizados em redes colaborativas de relés UAV sob jamming. Os resultados apontam cerca de 50% mais throughput total do sistema e taxa de colisão próxima de zero, com estratégia antijamming emergente desenvolvida sem programação explícita.