Само название «большая языковая модель» приучило нас к мысли, что искусственный интеллект и рассуждает при помощи языка. Мы задаём вопрос словами, получаем текстовый ответ, а у reasoning-моделей иногда видим ещё и длинную цепочку промежуточных рассуждений. Но язык может быть удобным способом общения ИИ с человеком — и вовсе не обязательно лучшим способом выполнять каждый внутренний вычислительный шаг.

Это решила проверить группа исследователей, разработавшая экспериментальную систему BDH-CQ. Вместо того чтобы последовательно генерировать слова или токены во время решения задачи, она выполняет промежуточные вычисления во внутреннем многомерном пространстве и переводит результат в понятную форму только на выходе. Авторы описали систему в работе на arXiv, опубликованной 10 августа.

Зачем ИИ вообще «проговаривает» решение

Современные модели часто используют так называемую chain-of-thought — цепочку промежуточных шагов. Такой подход может повышать качество решения сложных задач, но у него есть цена: каждый новый токен необходимо вычислить, сгенерировать, а затем использовать при дальнейшем рассуждении. Чем длиннее такая цепочка, тем больше требуется времени и вычислительных ресурсов.

BDH-CQ устроена иначе. Получая примеры решения, система постепенно обновляет рекуррентную память фиксированного размера. Ей не приходится снова и снова просматривать весь накопившийся контекст. Когда появляется новая задача, модель многократно преобразует её представление во внутреннем скрытом пространстве — без промежуточного перевода происходящего в слова. Только после завершения вычислений результат декодируется в ответ.

Один из авторов работы Зузанна Стамировска объяснила Science News, что промежуточные этапы здесь вообще не преобразуются в язык. Именно поэтому исследование затрагивает более общий вопрос: действительно ли языку обязательно быть рабочей средой для машинного рассуждения или он нужен прежде всего для передачи результата человеку.

Маленькая модель решила почти треть задач

Исследователи испытали версию BDH-CQ с 150 млн параметров на ARC-AGI-1 — наборе задач, предназначенном для проверки способности системы находить абстрактные закономерности. В таких тестах модель получает несколько примеров с цветными сетками, должна самостоятельно понять правило преобразования, а затем применить его к новой картинке.

При двух попытках BDH-CQ правильно решила 29,5% из 400 задач публичного набора ARC-AGI-1. На выполнение одной задачи требовалось в среднем около 0,85 секунды работы ускорителя Nvidia H200, а расчётная стоимость авторов составила примерно 0,0007 доллара за задачу.

Лучше всего система справлялась с некоторыми относительно простыми пространственными преобразованиями — например, продолжением фигур до границы или определением заполненных и незаполненных областей. Гораздо сложнее ей давались копирование, упорядочивание объектов и некоторые составные правила. Это показывает, что речь пока не идёт об универсальном способе решения любых интеллектуальных задач.

Откуда взялись «в 11 раз»

По расчётам авторов, после учёта актуальной стоимости использования GPT-5.6 Luna BDH-CQ выполняла задачи ARC-AGI-1 примерно в 11 раз дешевле. При этом напрямую сравнивать эти цифры нужно осторожно: стоимость BDH-CQ исследователи рассчитали по времени работы собственного оборудования, тогда как показатели других моделей могут основываться на ценах API или иных методиках. На это обращает внимание и Science News.

Есть и ещё более важное различие. BDH-CQ — небольшая специализированная система, обученная именно на ARC-подобных задачах, тогда как универсальные модели должны одновременно уметь писать тексты, программировать, работать со знаниями и решать множество других задач. Поэтому исследование пока не доказывает, что подобная архитектура в целом лучше современных языковых моделей. Работа также ещё не прошла рецензирование.

Тем не менее эксперимент показывает интересную возможность: ИИ не обязательно должен превращать каждый шаг вычислений в слова, чтобы решать задачу. Язык может остаться интерфейсом между машиной и человеком, тогда как значительная часть «рассуждений» будет происходить в другой, более компактной форме.

Если такой подход удастся масштабировать на математику, программирование и другие задачи, для которых сегодня модели генерируют огромные цепочки промежуточных токенов, это может оказаться не просто архитектурной любопытностью, а способом заметно снизить стоимость работы рассуждающих ИИ. Сами авторы называют расширение метода на языковые и математические задачи одним из следующих направлений работы.