Большие языковые модели (LLM), питающие генеративные чат-боты типа ChatGPT, Claude и Gemini, мастерски имитируют человеческую речь и создают изображения. Но они спотыкаются там, где казалось бы должны блистать — при анализе структурированных данных. Исправить это обещает новый класс генеративного ИИ.
Хотя ваш любимый чат-бот способен решать неразрешимые математические задачи, анализировать запутанные юридические документы, сочинять запоминающиеся поп-хиты или верстать стильные презентации PowerPoint, столкнувшись с таблицей чуть больше минимальной — он теряется.
Для большинства компаний и организаций самые ценные данные хранятся именно в электронных таблицах. Будь то журналы транзакций банка, метрики веб-сайта маркетингового агентства, показатели жизнедеятельности участников клинических испытаний или гигантские объёмы информации о столкновениях протонов с Большого адронного коллайдера — структурированные данные правят миром, а LLM с ними не справляются.
AI-стартап Fundamental разрабатывает принципиально новый тип базовой ИИ-модели — большую табличную модель (Large Tabular Model, LTM). Компания вышла из тени 5 февраля 2026 года с финансированием $275 млн и моделью NEXUS, созданной специально для работы с табличными данными. Сегодня её внедряют такие гиганты как Amazon Web Services, а другие компании спешат строить собственные LTM.
Почему LLM буксуют на электронных таблицах
По мнению Бориса ван Брёгеля (Boris van Breugel), старшего исследователя ИИ из Амстердама, отчасти причина недостаточного внимания к структурированным данным кроется в человеческой предвзятости: «Людям нравятся картинки, видео и ответы ChatGPT», — говорит он. — «А табличные данные плетутся позади просто потому что разглядывать цифры неинтересно».
Кроме того разные наборы табличных данных трудно сопоставимы друг с другом объясняет ван Брёгель соавтор пророческого позиционного документа 2024 года по этой теме Если естественный язык обладает схожей семантикой повсюду именно поэтому LLM отлично обучаются на гигантских текстовых корпусах научить одну табличную модель работать совершенно разными переменными гораздо сложнее
Есть ещё одна фундаментальная проблема язык своей природе последователен музыка изображения видео Изменение порядка слов может полностью разрушить смысл предложения вот структурированные данные электронных таблиц последовательными являются менять местами столбцы тасовать строки без малейшего ущерба заложенных фактов
Эта независимость линейного порядка абсолютно чужда самой сути LLM предсказанию следующего элемента последовательности «Даже минимальное изменение входных данных заставляет LLM выдавать другой результат» поясняет Джереми Френкель (Jeremy Fraenkel) CEO Fundamental Для языковых моделей нормально часто даже желательно когда нужно определить мошенническая транзакция перед вами хотите гарантированно одинаковый ответ независимо чего
Как создавался LTM от Fundamental
Существующие решения работы с табличными данными ограничены алгоритмами машинного обучения наподобие XGBoost которым уже более пятнадцати лет используются организациями всему миру Эти алгоритмы градиентно бустированные деревья решений приходится месяцами тренировать оптимизировать силами дата саентистов каждую конкретную задачу
В отличие них NEXUS другие появляющиеся LTM являются фундаментальными моделями аккумулируют знания время предварительного обучения разнообразных базах данных затем применяются широкому спектру прогностических задач практически без ручного конструирования признаков построения специализированных моделей
Если LLM преимущественно моделируют последовательности токенов то LTM работают непосредственно структурой таблиц одновременно усваивая числовое значение каждой ячейки смысл связи другими элементами Представьте запись бананы складской ведомости продуктового магазина LTM воспринимает только количество скажем также понимает эта цифра обозначает текущий запас бананов категория фрукты также улавливает статистические закономерности связывающие запись всем столбцом целиком Такое контекстное понимание обеспечивает гораздо более точное рассуждение прогнозирование поверх структурированных данных
По словам Френкеля одной главных трудностей разработке NEXUS стал сбор подходящих обучающих данных отличие естественного языка которого много структурно однороден найти качественные разнообразные наборы табличных данных значительно сложнее Большая часть конфиденциальна либо является частной собственностью между биологическими данными скажем финансовыми почти ничего общего Поэтому Fundamental пришлось инвестировать значительные ресурсы создание огромного тренировочного корпуса
«Мы предобучили NEXUS миллиардах таблиц используя комбинацию собственных наборов полученных через партнёрства лицензирование высококачественных публичных датасетов также техник аугментации расширяющих разнообразие нашего обучающего корпуса» рассказывает Френкель подчёркивая этом NEXUS никогда обучалась клиентских данных Более того платформа построена принципу конфиденциальных вычислений есть Fundamental физически имеет доступа пользовательским данным говоря обучении них
Эта особенность скорее всего сыграла ключевую роль когда июне Amazon Web Services (AWS) интегрировал NEXUS прямо Amazon SageMaker де факто операционную систему безопасного машинного обучения Теперь модель работает непосредственно рядом часто чувствительными данными клиентов кардинально отличается подхода LLM данные приходится импортировать модели
«С Amazon нас партнёрство первого уровня есть модель воспринимается родное решение AWS» говорит Френкель «Со временем планируем расширять подобные отношения пользователи могли обращаться своим данным где выполнялись прогнозы»
Будущее анализа данных
Хотя Fundamental захватила лидерство крайней мере корпоративных применениях одинока Параллельно фундаментальными LTM работают другие игроки марте компания Feedzai специализирующаяся предотвращении финансового мошенничества платёжная система Mastercard независимо друг друга запустили собственные закрытые технологии ориентированные финансы конце июня Google представил конкурента TabFM полностью обученного сотнях миллионов синтетических наборов данных
Не отстаёт академическое сообщество Только последний год исследователи предложили целый ряд LTM таких FlexTab TabICL iLTM Все стремятся повторить успех LLM уже домене табличных данных
Направление движения очевидно всем участникам «Я сильно удивлюсь через несколько лет большая часть обработки анализа данных будет выполняться автоматическими системами будь LLM LTM комбинация» прогнозирует Брёгель «Большинство людей особенно любят заниматься анализом данных системы смогут делать гораздо качественнее»
Френкель согласен «Мне видится отношения между LLM LTM напоминают работу человеческого мозга левое полушарие отвечает рассуждения понимание языка резюмирование текстов правое сильна числах статистике паттернах говорит настоящая мощь появляется объединяете оба»