bg
Наука и новые технологии
07:46, 19 сентября 2026
views
2

Российский TimeAdapter меняет генеративное видео и приближает эпоху физического ИИ

Команда Kandinsky из «Сбербанка» разработала TimeAdapter– модуль для генеративных моделей, который помогает точнее управлять скоростью происходящего в видео. С его помощью нейросеть может учитывать не только содержание сцены, но и её динамику, делая движения более естественными.

Современные нейросети научились рисовать потрясающие миры, но часто «плавают» в базовой физике. В сгенерированном ролике движения могут быть неестественными. Команда Kandinsky из «Сбера» решила эту фундаментальную проблему, разработав TimeAdapter. Это компактная надстройка, которая учит искусственный интеллект не просто генерировать пиксели, а чувствовать время и динамику событий.

Как устроен TimeAdapter

Главная инновация заключается в разделении понятий «плавность» и «скорость событий». TimeAdapter весит менее 1% от размера основной нейросети, но берет на себя две критические задачи. Первый блок управляет частотой кадров (fps – frames per second, то есть количеством кадров в секунду), позволяя задавать диапазон от кинематографичных 15 до сверхплавных 60 fps. Второй блок отвечает непосредственно за темп происходящего в кадре.

Для обучения алгоритма исследователи использовали около 40 тысяч роликов с самой разной динамикой, чтобы нейросеть поняла, как течет время в реальном мире. TimeAdapter работает в двух режимах. В первом он подключается к уже готовой модели как «костыль», улучшая плавность. Во втором основная нейросеть дообучается вместе с адаптером, начиная понимать причинно-следственные связи. Результат, представленный на престижной конференции ICML, впечатляет: естественность движений выросла на 29%, визуальное качество – на 8%, а точность следования запросу – на 19%. Код открыт по лицензии MIT, что дает свободу использования, включая коммерческое.

От рекламных роликов к роботам: эра физического ИИ

Очевидно, что от выхода продукта выиграют представители креативных индустрий. Маркетологам и блогерам больше не нужно будет тратить часы на ручной монтаж и десятки попыток, чтобы попасть в бит музыки. Кстати, сам «Сбербанк» уже использует ИИ для создания 60% своей рекламы. Но глобальная цель гораздо масштабнее.

Мы подходим к эре физического ИИ (Physical AI) – систем, которые понимают законы реального мира и могут взаимодействовать с ним. Здесь на сцену выходят World Models (модели мира). Это не просто генераторы видео, а виртуальные симуляторы, где роботы и беспилотники могут тренироваться, сталкиваясь с редкими или опасными ситуациями без риска для реальности. TimeAdapter – важнейший мостик от «красивой картинки» к симуляции физики. Недаром в августе 2026 года «Сбербанк» выделил направление Kandinsky World Model, выпустив специализированные модели для автономного транспорта и робототехники.

От пикселей к симуляции

Чтобы оценить масштаб технологического сдвига, достаточно посмотреть на ретроспективу последних лет. В 2022-2023 годах было эпоха text-to-image и первых видео (Kandinsky 2.0, Runway Gen-2). Главная задача состояла в том, чтобы заставить кадры просто не «рассыпаться» в кашу.2024-2025 годы – время гонки за длиной, качеством и звуком (OpenAI Sora, Google Veo 3). Выросло разрешение, появился синхронный аудиоряд, но сложная физика и логика процессов всё еще оставались слабым местом.

2026 год проходит под знаком физического ИИ. Фокус индустрии сместился с красоты пикселей на достоверность логики. TimeAdapter и Kandinsky WM 1.0 закрепляют этот тренд, переводя видеогенерацию в разряд инструментов для моделирования реальности.

Тихий экспорт и открытый код

Пока TimeAdapter не стал готовым экспортным продуктом, но у него есть мощный козырь – open source (открытый исходный код). В условиях, когда страны Глобального Юга активно запрашивают у России технологии суверенного ИИ, открытая база TimeAdapter может стать точкой входа для российских разработчиков на глобальный рынок.

Это не просто патч (небольшое обновление программного обеспечения, предназначенное для исправления ошибок, устранения уязвимостей или добавления новых функций) для улучшения видео, это заявка на лидерство в создании виртуальных песочниц для обучения машин будущего. Российская наука доказала, что может задавать тренды не только в языковых моделях, но и в самом сложном сегменте генеративного ИИ – там, где код встречается с законами физики.

Раньше скорость происходящего в кадре задавали только слова в промпте, а повлиять на реальную динамику в создаваемом видео было достаточно сложно. С помощью TimeAdapter модель понимает, как процессы разворачиваются во времени, и умеет естественно задавать нужный ритм в любой сцене, а не заучивает готовые шаблоны. Это ключевое условие для обучения физического ИИ и будущих моделей мира: система должна точно понимать длительность и динамику каждого действия. Новый метод позволяет делать из моделей инструменты, которые лучше подчиняются замыслу человека: режиссёра, инженера, разработчика робототехники, любого творческого пользователя
quote
like
heart
fun
wow
sad
angry
Последние новости
Главное
Рекомендуем
previous
next