Как многоагентное обучение с подкреплением (MARL) позволяет спутникам, дронам и когнитивным радио самостоятельно находить стратегии доступа к спектру в условиях помех. Разбираем CTDE, VDN, QMix, MP-DQN и реальные цифры симуляций.

Почему спутниковые сети LEO так уязвимы к помехам и внутриканальным интерференциям?

Спутники на низкой околоземной орбите (LEO) летают всего в нескольких сотнях километров над Землёй. Из-за этого каждая линия связи физически находится в зоне досягаемости наземных источников помех, а орбитальные траектории заранее предсказуемы — это делает созвездия удобной мишенью для целенаправленного глушения.

К этому добавляется внутриканальная интерференция: десятки и сотни аппаратов делят перекрывающиеся лучи и частоты, поэтому преднамеренные помехи накладываются на взаимные помехи соседних узлов. Одна выведенная из строя межспутниковая линия способна каскадно привести к отказу целого региона, а ручное частотное планирование просто не успевает за такой динамикой.

Именно поэтому исследователи рассматривают не централизованное управление, а распределённые агенты, каждый из которых принимает решения по локальным наблюдениям — уровню принятой мощности, помех, состоянию очереди и позиции. Такой подход разбирают Li et al. (IEEE, 2026) в работе DMDRLA для мега-созвездий LEO, где симуляции сопоставляют стоимость обучения с итоговой производительностью.

Как многоагентное обучение с подкреплением обеспечивает доступ к спектру в условиях помех?

Каждый спутник или радиостанция выступает отдельным агентом, который использует только локальные наблюдения: принятую мощность, уровень интерференции, состояние очереди и собственное положение. Во время обучения централизованный критик оценивает совместный результат, а за множество эпизодов агенты вырабатывают политики доступа к спектру и управления лучами, избегая помех без вручную составленного частотного плана.

Такой механизм лежит в основе anti-jamming spectrum access — задачи, где устройства самостоятельно ищут свободные частотно-временные окна. Elleuch et al. (2021) показали, что при кооперативном обучении пользователей растут скорости передачи, устраняется взаимная интерференция и достигается наивысшая скорость сходимости среди рассмотренных схем.

Дополняет картину подход Aref et al. для широкополосных автономных когнитивных радио (WACR) в многоагентной среде: агенты ищут оптимальные политики защиты от помех и обхода интерференции. Zhang et al. (2021) отдельно исследовали доступ к каналам при частично перекрывающихся каналах (POC), что важно для плотных сетей.

Какую роль играет централизованное обучение с децентрализованным исполнением?

Схема CTDE (centralized training with decentralized execution) позволяет централизованному критику видеть совместное состояние и награды на этапе обучения — это стабилизирует обучение и даёт координацию. В момент исполнения каждый спутник опирается только на собственную политику и локальные наблюдения, поэтому живая линия связи с наземным центром или со всеми остальными аппаратами не требуется.

Это принципиально важно в условиях противодействия: канал управления сам может быть заглушён, и любая архитектура, зависящая от постоянного обмена данными, окажется хрупкой. CTDE снимает эту зависимость, перенося сложность координации в фазу обучения, а не в фазу работы.

Цао и соавторы (MDPI Electronics 14(16):3307, 2025) применили сеть декомпозиции ценности (VDN) к задаче доступа к спектру в спутниковых сетях LEO — и сделали это именно через парадигму централизованного обучения с распределённым исполнением (CTDE). На практике это означает следующее: во время тренировки единый центральный критик видит совместные действия и наблюдения всех агентов-спутников и потому способен корректно оценивать их вклад в общий результат, а на этапе эксплуатации каждый аппарат действует автономно, опираясь лишь на собственные локальные наблюдения — уровень принимаемой мощности, помеховую обстановку, состояние очередей, позицию. За счёт такого разделения авторам удалось одновременно повысить эффективность тренировки и сократить коммуникационные издержки: спутникам больше не нужно непрерывно обмениваться служебной информацией по каналам, которые сами могут быть подавлены помехами. Показательно, что этот же принцип — централизованно учить, децентрализованно исполнять — лежит в основе и других работ по антипомеховой защите, от ретрансляционных сетей БПЛА до когнитивных радио, что делает результат Цао не изолированным приёмом, а частью общего методического тренда.

Какие алгоритмы обеспечивают распределённую защиту от помех: VDN, QMix и MP-DQN?

Семейство алгоритмов для распределённой защиты от помех строится вокруг декомпозиции совместной функции ценности. VDN разбивает общую ценность на индивидуальные значения агентов, что решает задачу кредитного присвоения вклада каждого узла при десятках и сотнях участников. QMix развивает эту идею для кооперативного принятия решений о глушении, а MP-DQN применяется в задачах с гибридным пространством действий.

Ниже — краткое сопоставление ключевых работ и алгоритмов, о которых идёт речь в исследованиях по теме.

РаботаМетодПрименение
Cao et al., MDPI Electronics, 2025VDN + CTDEДоступ к спектру в сетях LEO
Nguyen et al., arXiv 2512.08341, 2025CTDEРетрансляционные сети БПЛА под помехами
Cai et al., 2025QMixКооперативное принятие решений о глушении
Wang et al., 2025MARL + prioritized experience replayЭнтропийная регуляризация и центрирование награды
Feng Xie et al., Journal of Radars, 2023Комплексно-значимое DRLЧастотно-адаптивный радар

Wang et al. (2025) предложили алгоритм многоагентного RL, объединяющий приоритизированное воспроизведение опыта, энтропийную регуляризацию и центрирование награды — это повышает устойчивость обучения в нестабильной радиообстановке. Janiar et al. (2023) добавили перенос обучения, чтобы DRL-агент быстро адаптировался в динамичных беспроводных сетях при атаках глушения.

Какие выигрыши и компромиссы показывают симуляции?

Nguyen et al. (arXiv 2512.08341, подан 9 декабря 2025 года, для IEEE ICC 2026) применили CTDE в кооперативных ретрансляционных сетях БПЛА под помехами. Результаты показывают примерно на 50% более высокую суммарную пропускную способность системы и почти нулевой уровень коллизий, при этом агенты вырабатывают эмерджентную стратегию защиты от помех без явного программирования.

Схожие выводы дают и другие работы: координация улучшает результаты противодействия помехам, но требует времени на обучение и образцов данных. CTDE позволяет избежать зависимости от каналов связи, которые сами могут быть заглушены, — это ключевой компромисс между устойчивостью и стоимостью.

Стоит учитывать и цену координации: чем больше агентов, тем сложнее декомпозиция ценности и тем выше требования к вычислительным ресурсам на этапе тренировки. Именно поэтому Li et al. (IEEE, 2026) в DMDRLA прямо сопоставляют стоимость обучения с достигаемой производительностью для мега-созвездий LEO.

Чем отличаются применения в ретрансляции БПЛА и радарах?

В сетях БПЛА задача ближе к маршрутизации и ретрансляции: агенты должны поддерживать связность под глушением, и здесь CTDE даёт наибольший выигрыш по пропускной способности и коллизиям. Радарные приложения решают другую задачу — выбор частоты и формы сигнала в реальном времени.

Фэн Се и соавторы (Journal of Radars, 12(6):1290–1304, 2023) предложили метод комплексно-значимого глубокого обучения с подкреплением для частотно-адаптивного радара — то есть для РЛС, которая в реальном времени перестраивает несущую частоту, уходя от помех. Среднее время принятия решения у их агента сократилось до 405,3 мс по сравнению с двумя классическими алгоритмами RL, что для сенсорной задачи означает вполне рабочую скорость реакции. Важно здесь другое: результаты показывают, что DRL-подходы применимы не только в связи, но и в сенсорике. Если в ретрансляции БПЛА агент оптимизирует пропускную способность и коллизии в сети, то в радаре цель иная — сохранить обнаружение и сопровождение цели при воздействии помех, а цена ошибки измеряется уже не потерянными пакетами, а пропущенной отметкой. Отсюда и различия в архитектуре: в радаре решение принимается на одном устройстве с жёсткими требованиями по задержке, тогда как в ретрансляционных сетях БПЛА координация десятков агентов и централизованное обучение с децентрализованным исполнением дают около 50% прироста суммарной пропускной способности системы при почти нулевой частоте коллизий.

Обзор Yang et al. (arXiv 2508.11687, 11 августа 2025) формализует интеллектуальных агентов защиты от помех для связи БПЛА через замкнутый цикл «восприятие — решение — действие», используя теорию игр и обучение с подкреплением. Общая логика едина: локальные наблюдения, обученная политика и адаптация к динамической помеховой обстановке.

Что это значит для практики развёртывания?

Для операторов созвездий LEO и сетей БПЛА главный вывод — распределённые агенты с CTDE позволяют отказаться от жёсткого частотного планирования и централизованного управления в реальном времени. Это снижает уязвимость к глушению управляющих каналов и повышает живучесть сети в целом.

Однако внедрение требует инфраструктуры обучения: централизованный критик, сбор совместных состояний и наград, а также вычислительные мощности для тренировки на десятках и сотнях узлов. Окупаемость зависит от того, насколько динамична помеховая обстановка и насколько критична непрерывность связи.

Текущие публикации 2025–2026 годов показывают, что направление переходит от теоретических схем к измеримым результатам: рост пропускной способности, снижение коллизий и миллисекундные решения в радарах. Именно эти метрики будут определять, какие алгоритмы — VDN, QMix или их комбинации — закрепятся в реальных системах.

Какие ограничения и открытые вопросы остаются?

Первое ограничение — масштабируемость декомпозиции ценности: при сотнях агентов кредитное присвоение становится вычислительно тяжёлым, а симуляции не всегда отражают реальную задержку и потери пакетов. Второе — переносимость политик между разными созвездиями и условиями помех.

Третье — безопасность самого обучения: если злоумышленник может влиять на награды или наблюдения, агент рискует выучить вредную политику. Исследования Janiar et al. (2023) с переносом обучения частично смягчают проблему адаптации, но не решают вопрос adversarial-атак на процесс тренировки.

Наконец, остаётся вопрос стандартизации метрик: разные работы сообщают о пропускной способности, коллизиях и времени сходимости в несопоставимых условиях. Для честного сравнения VDN, QMix и MP-DQN нужны единые бенчмарки, охватывающие LEO, БПЛА, когнитивные радио и радары.

Часто задаваемые вопросы

Как многоагентное обучение с подкреплением обеспечивает доступ к спектру в условиях помех?

Каждый спутник или радиостанция действует как отдельный агент, используя только локальные наблюдения: принятую мощность, уровень помех, состояние очереди и позицию. Во время обучения централизованный критик оценивает совместный результат, и за множество эпизодов агенты осваивают политики доступа к спектру и управления лучами, избегая глушения и внутриканальных помех без вручную составленного частотного плана.

Что такое централизованное обучение с децентрализованным исполнением в защите от помех?

CTDE позволяет централизованному критику видеть совместное состояние и награды на этапе обучения, что стабилизирует обучение и обеспечивает координацию. В момент работы каждый спутник опирается только на собственную политику и локальные наблюдения, поэтому постоянная линия связи с наземным центром или со всеми остальными аппаратами в условиях противодействия не требуется.

Какие выигрыши показывают CTDE-системы защиты от помех?

Nguyen et al. (arXiv 2512.08341, подан 9 декабря 2025 года, для IEEE ICC 2026) объединили централизованного критика с децентрализованными акторами в кооперативных ретрансляционных сетях БПЛА под помехами. Результаты показывают примерно на 50% более высокую суммарную пропускную способность и почти нулевой уровень коллизий, а стратегия защиты от помех возникает эмерджентно, без явного программирования.

Почему спутниковые сети LEO уязвимы к помехам и внутриканальной интерференции?

Спутники LEO летают всего в нескольких сотнях километров над Землёй, поэтому каждая линия связи доступна наземным источникам помех, а орбитальные траектории предсказуемы. Десятки и сотни аппаратов делят перекрывающиеся лучи и частоты, из-за чего внутриканальная интерференция накладывается на преднамеренное глушение, и одна выведенная из строя межспутниковая линия может каскадно вызвать отказ целого региона.