Жизнеспособность орбитальных дата-центров, способных размещать самые мощные и крупные большие языковые модели (LLM), по-прежнему вызывает жаркие споры. Однако огромные развёртывания, требующие тысяч графических процессоров, — не единственный способ, которым LLM могут пригодиться в космосе.
Лаборатория реактивного движения NASA недавно отправила в космос Google Gemma 3, впервые продемонстрировав на орбите работу визуально-языковой модели, анализирующей изображения с собственного сенсора спутника.
Система под названием NAVI-Orbital использовала Gemma 3 для анализа снимков, полученных спутником YAM-9, созданным компанией Loft Orbital. Хуан М. Дельфа, руководитель технической группы NASA, отметил, что хотя целью было именно распознавание изображений, успех проекта открывает принципиально новый способ взаимодействия исследователей с космическими аппаратами.
«Это серьёзный сдвиг, — заявил Дельфа. — Теперь учёный может написать промт, загрузить его на борт, и система учтёт его. Это отличается от прежних парадигм, когда исследователям приходилось писать жёстко структурированные команды, требующие участия операционной команды и сложных процессов».
Google Gemma 3 отправляется в космос без модификаций
В основе NAVI-Orbital лежит агентная программная среда, разработанная Дельфой и его соавторами: Тараном Сириаком Джоном, исследователем ИИ из NASA JPL, и Эндрю У. Херсоном, техническим руководителем Loft Orbital. Она координирует операции с помощью дирижёра на базе LangGraph и развёртывает сжатую 4-битную версию Google Gemma 3 4B — модели с открытыми весами — для создания текстовых описаний изображений.
NAVI-Orbital показала точность 88% при классификации изображений из эталонного набора данных из 7 960 снимков. Примечательно, что Gemma 3 классифицировала их без обучения или тонкой настройки на этом датасете или его категориях — это та же базовая модель, которую можно скачать с Hugging Face и запустить на ноутбуке. Бенчмарк проводился на Земле для валидации системы перед запуском.
Оказавшись на орбите, исследователи NASA провели два теста с живым захватом изображений с камеры спутника YAM-9: один над Тулузой (Франция), второй — над побережьем Аргентины. В дополнение к созданию текстового описания каждого снимка NASA запрашивала у Gemma 3 ответы на заранее подготовленные вопросы, например, содержат ли изображения коммерческие или жилые зоны, либо природные объекты.
Анализ изображений также выполнялся на борту YAM-9, который оснащён вычислительным кластером из нескольких радиационно-стойких процессоров (FPGA, CPU и GPU) для одновременного обслуживания полезной нагрузки нескольких заказчиков. Спутник питается от солнечных панелей, обеспечивающих бортовые системы мощностью от 150 до 500 Вт в зависимости от положения.
Для эксперимента с живым захватом Gemma 3 работала на Nvidia Jetson Orin AGX — небольшом вычислительном модуле, часто используемом в робототехнике и задачах ИИ. 4-битная модель с 4 миллиардами параметров требует всего 8 ГБ памяти, что позволяет запускать её на маломощных устройствах вроде Orin AGX. «Это демонстрирует, насколько она легковесна. Её можно запустить на крошечном-крошечном компьютере», — сказал Дельфа.

Получение более полезных данных при ограниченной пропускной способности
Пол Лассере, генеральный менеджер Loft Orbital, заявил, что LLM с возможностями компьютерного зрения могут обеспечить «смену парадигмы» для орбитальных операций.
Вопреки тому, что показывают в шпионских фильмах, большинство спутников не могут передавать на Землю быстрые и высококачественные изображения и видео. Пропускная способность часто ограничена, и в большинстве случаев спутники могут отправлять данные на наземные станции лишь в определённые интервалы, зависящие от орбиты.
Лассере считает, что ИИ-модели могут обойти эту проблему с помощью «семантического сжатия». Вместо передачи больших объёмов необработанных изображений спутник может отправлять текстовое резюме важной информации.
«Неважно, насколько медленный канал связи, потому что вы передаёте десятки килобайт вместо десятков или сотен мегабайт, — сказал Лассере. — Это позволяет использовать спутник тактически, что раньше было возможно только в голливудских фильмах».
Дельфа развил эту мысль на примере обнаружения лесных пожаров. Спутники уже умеют фиксировать возгорания, но ограничения пропускной способности и обработки данных могут задерживать результаты до 90 минут. Спутник, способный анализировать снимок в космосе и отправлять текстовое предупреждение, мог бы устранить эту задержку.
От анализа изображений к управлению космическими аппаратами
Быстрое получение информации — лишь половина того, на что указывает NAVI-Orbital. Вторая половина связана с тем «серьёзным сдвигом», о котором говорил Дельфа. NAVI-Orbital служит доказательством концепции альтернативного способа взаимодействия с космическими аппаратами.
Это не означает, что Google Gemma 3 уже управляет полётом. NAVI-Orbital намеренно изолирована от полётного программного обеспечения. Она считывает изображения и создаёт описания. Система способна принимать решения о том, как анализировать снимки, но не имеет доступа за эти пределы.
Тем не менее, интерфейс нов. Перенастройка системы на поиск другого типа целей — например, лесных пожаров — сводится к редактированию текстового промта. Это не требует переписывания и повторной валидации бортового ПО, а также обучения и развёртывания новой ИИ-модели (как часто требовалось для прежних моделей классификации изображений).
Долгосрочное видение выходит за рамки беспилотных спутников и обработки изображений. Дельфа рассказал, что NAVI родилась из размышлений о том, как ИИ мог бы стать помощником для астронавтов. «Мы подумали, что у астронавтов в скафандре много ограничений по подвижности, и придумали идею: NAVI как компаньон для астронавта, позволяющий взаимодействовать на естественном языке […] это концепция, которую мы определённо хотим продвигать».
Потребуется ещё много исследований, чтобы довести технологию до такого уровня, но демонстрация NAVI-Orbital показала, что два элемента — развёртывание большой языковой модели в космосе и управление ею с помощью промтов — возможны.