bg
Цифровые продукты и платформы
15:31, 09 сентября 2026
views
8

Российские математики научили нейросети «общаться» между собой

Российский стартап Mostik предложил новую методику работы, которая позволяет уйти от постоянного наращивания вычислительных мощностей.

В мире существует большое количество всевозможных нейросетей. Каждая из них решает свой комплекс задач. Но можно ли сделать так, чтобы большие языковые модели могли взаимодействовать между собой, предлагая более комплексные ответы? Этой проблемой решила заняться команда российских ИТ-специалистов.

Длинные переписки больше не нужны

Коллектив российского стартапа Mostik нашел способ взаимодействия ИИ-моделей между собой без необходимости прямого обмена текстовыми сообщениями. Вместо длинной переписки нейросети «общаются» через математические значения во внутренних представлениях. Такой подход выгодно отличается от классических принципов взаимодействия. Обычно модели работают последовательно: одна модель генерирует ответ, а другая получает его. Это требует времени и значительного объема вычислительных ресурсов.

Методика, разработанная командой Mostik, позволяет передавать информацию между моделями на более глубоком уровне, помогая небольшой нейросети использовать возможности значительно более крупной.

Первые практические успехи

Для того, чтобы продемонстрировать работоспособность своей идеи, члены российского стартапа создали мост между двумя китайскими моделями с открытыми параметрами: самой крупной версией GLM-5.2, у которой 753 миллиарда параметров, и версией Qwen-3.5 на 4 миллиарда параметров, которая может работать на мобильных устройствах. Получившийся гибрид оказался в 20 раз дешевле большой модели, а качество его ответов оказалось где-то посередине между показателями исходных нейросетей. Стартап использовал такой подход при создании модели, которая стремительно вышла вперед в исключительно трудном конкурсе моделей ИИ ARC-AGI 3.

«В машинном обучении хорошо известно, что сочетания моделей дают лучший результат, чем у индивидуальных моделей», – пояснила генеральный директор Mostik Александра Малышева.

Не стоит ждать «электронного сверхразума»

Концепция, выдвинутая членами российского стартапа, может значительно повысить ценность открытых моделей, а также позволит им результативнее конкурировать с закрытыми интеллектуальными платформами, которые предлагают передовые лаборатории типа Anthropic и OpenAI.

Малышева уверена, что будущее ИИ-отрасли – именно во взаимодействии между разными моделями. Она сомневается в том, что когда-то может появиться некий «электронный сверхразум», который будет закрывать абсолютно все задачи.

Главный научный сотрудник стартапа Станислав Смирнов пояснил, что найти точки соприкосновения между двумя ИИ-моделями исключительно трудно. Для этого просто нет подходящего математического языка. Однако в будущем именно разработки Mostik смогут в значительной степени закрыть этот пробел.

Поиск баланса между качеством и стоимостью

Важно, что изыскания стартапа отражают общий тренд развития нейросетей в последние годы. Разработчики стараются повысить качество их работы, избегая бесконечного наращивания вычислительных мощностей. Еще в 2024 году «Сбер» опубликовал веса младшей модели GigaChat на основе архитектуры Mixture of Experts. При 20 млрд общих параметров платформа использует около 3,3 млрд активных параметров за один проход. Это один из ярких примеров того, как компания постаралась снизить вычислительную стоимость за счет задействования только тех ресурсов модели, которые необходимы в конкретный момент.

В том же году «Т-Банк» открыл русскоязычные модели на 7 и 32 млрд параметров, построенные на Qwen 2.5 и дополнительно обученные на русском языке. Это стало еще одной попыткой найти некий баланс между качеством работы интеллектуальной инфраструктуры и стоимостью.

Ведущие мировые технологические гиганты также регулярно ищут способы для переноса возможностей крупных языковых моделей в более компактные платформы.

Конечно, работа Mostik пока находится на самой ранней стадии, и специалистам предстоит решить большое количество технических вопросов. Однако если подход масштабируется и заявленные показатели подтвердятся, это может снизить вычислительную стоимость генеративного ИИ и сделать архитектуры из нескольких специализированных моделей конкурентной альтернативой одной огромной LLM. Это особенно важно для России, где стоит задача создать конкурентоспособную ИИ-архитектуру на базе ограниченных вычислительных возможностей.

Если Mostik сумеет объединить передовые модели с конкретными отраслевыми моделями (из области биологии, физики и так далее), то можно будет обучить гораздо больше специализированных моделей. Команда занимается этой работой всего несколько месяцев, но она уже кое-что запустила, хотя мне раньше казалось, что у нее на это уйдут годы
quote
like
heart
fun
wow
sad
angry
Последние новости
Главное
Рекомендуем
previous
next
ОтраслиЗа пределами кремния: как российские ученые «укрощают» спиновые волныУченые Саратовского национального исследовательского государственного университета им. Н. Г. Чернышевского и Института радиотехники и электроники им. В. А. Котельникова РАН исследовали магнонику – подход, при котором для передачи и обработки информации используются не потоки электрического заряда, а спиновые волны. Исследователи экспериментально показали, что в специально подобранной анизотропной магнитной среде пучок спиновых волн способен распространяться практически без расширения. Также подтвержден эффект сверхразрешения: информация об объекте размером меньше длины волны сохранялась на значительно большем расстоянии, чем обычно допускает классический дифракционный предел. Работа опубликована в журнале «Успехи физических наук».