Новый ИИ с уникальным подходом к рассуждениям дешевле OpenAI
Компания Pathway представила модель искусственного интеллекта BDH-CQ, разработанную с применением нового метода обработки информации. Разработчики утверждают, что система способна решать задачи, требующие невербального рассуждения, при значительно меньших затратах на вычисления. Архитектура модели отличается от традиционных трансформерных систем. Об этом пишет портал Science XXI.
Технические характеристики BDH-CQ были опубликованы в научной статье 10 августа на сервере препринтов arXiv. Эта модель является продолжением разработки Dragon Hatchling, созданной в 2025 году для имитации связей и укрепления нейронов в процессе обучения. Согласно исследованию, BDH-CQ была протестирована на тесте ARC-AGI-1, который оценивает способность ИИ выявлять правила в визуальных задачах.
На тесте ARC-AGI-1 система продемонстрировала результат почти 30%, успешно решив около 3 из 10 заданий не более чем за 2 попытки. Хотя ряд других моделей показал более высокие результаты, авторы утверждают, что BDH-CQ требует значительно меньших ресурсов. Например, модель GPT 5.6 Luna (Low) немного превзошла BDH-CQ по точности, но ее относительные затраты на токены оказались примерно в 11 раз выше.
BDH-CQ была обучена на 150 млн параметров, в то время как современные крупные модели могут использовать десятки и сотни миллиардов параметров. Меньший объем параметров позволяет быстрее обучать систему и снижать ее эксплуатационные расходы. Авторы считают, что при увеличении масштаба модель сможет значительно расширить свои способности в области рассуждений.
Обычные трансформерные модели обрабатывают текстовые запросы, последовательно предсказывая следующие слова и учитывая весь предыдущий контекст. Однако с усложнением и удлинением запроса потребность в вычислительных ресурсах резко возрастает. В Pathway заявили, что их подход заменяет длинные текстовые цепочки числовыми структурами, отражающими связи между элементами задачи.
Для поиска ответов BDH-CQ использует внутренний механизм скрытого рассуждения, который выполняет повторяющиеся циклы обработки данных. Увеличение числа таких циклов должно предоставить модели больше времени для решения задач без пропорционального роста потребления памяти. Компания планирует расширить архитектуру до 600 млрд параметров, протестировать ее на ARC-AGI-2 и ARC-AGI-3, а также создать на ее основе большую языковую модель для чат-ботов и применения в кибербезопасности и промышленности.


