Мы используем файлы cookie, чтобы сайт работал и становился удобнее. Продолжая пользоваться «Думайте», вы соглашаетесь с Политикой конфиденциальности.

показать все результаты

Ничего не найдено

Будущее нейросетей.

1 дн. назад авторская
64 9 8 мин

Почему путь «больше модель — больше интеллект» ведёт в тупик

Сегодня развитие искусственного интеллекта чаще всего выглядит довольно просто: сделать модель больше, дать ей больше данных, поставить больше ускорителей и обучать дольше.

И это действительно работает.

Современная языковая модель состоит из огромного количества параметров — числовых коэффициентов, которые формируются во время обучения. На вход поступает текст, он разбивается на токены, затем проходит через множество вычислительных слоёв. Модель оценивает связи между фрагментами информации и раз за разом определяет наиболее вероятное продолжение.

Чем лучше обучение и архитектура, тем сложнее зависимости, которые способна учитывать модель. Отсюда появляются связные тексты, программный код, анализ документов, перевод и многие другие возможности.

Но есть проблема.

Мы увеличиваем возможности моделей главным образом за счёт увеличения самой вычислительной системы.

И рано или поздно возникает вопрос: сколько ещё её можно увеличивать?

Модель нужно не только запустить

Когда говорят о размере нейросети, обычно обсуждают, сколько памяти требуется для её запуска. Допустим, модель удалось разместить на нескольких видеокартах или серверных ускорителях — значит, кажется, задача решена.

Но обучение значительно тяжелее обычной работы уже обученной модели. При генерации ответа в основном используются готовые веса: модель получает входные данные и последовательно выполняет вычисления.

При обучении этого недостаточно. Нужно выполнить прямой проход, определить ошибку, провести обратное распространение, вычислить изменения для огромного количества параметров и сохранить промежуточные состояния, необходимые для следующего шага. Помимо самих весов приходится держать градиенты, состояния оптимизатора, активации и другие рабочие данные.

Поэтому памяти и вычислительных ресурсов для обучения большой модели требуется значительно больше, чем просто для её запуска. В зависимости от архитектуры, точности вычислений и методов оптимизации разница может составлять несколько раз. Условные три-четыре объёма, необходимые для работы модели, здесь уже совсем не выглядят чем-то необычным.

А теперь увеличим модель ещё раз.

Потребуется больше памяти.

Больше ускорителей.

Больше обмена информацией между ними.

Более сложная сеть внутри вычислительного кластера.

Больше электроэнергии.

Больше охлаждения.

Так появляются огромные центры обработки данных.

Зачем ИИ огромные ЦОДы

ЦОД нужен не потому, что искусственный интеллект является каким-то особенным существом, которое требует электростанцию для размышлений. Это следствие существующей архитектуры вычислений.

Огромную модель необходимо где-то хранить. Её параметры необходимо постоянно использовать при вычислениях. Если одна машина уже не справляется, модель распределяется между несколькими ускорителями. Затем между десятками, сотнями и тысячами. А эти ускорители должны постоянно обмениваться данными.

К вычислениям добавляется передача информации, к передаче — задержки, к задержкам — необходимость строить всё более быстрые соединения. Затем появляется ещё одна проблема: пользователей много.

Одной модели недостаточно просто существовать. Она должна одновременно отвечать миллионам людей. Значит, необходимо увеличивать уже не только мощность самой модели, но и количество оборудования, обслуживающего запросы.

Получается интересная картина.

Мы создаём всё более совершенный искусственный интеллект, но вместе с ростом его возможностей растёт и физическая инфраструктура, необходимая для его существования.

Мы научились увеличивать искусственный мозг быстрее, чем эффективность его мышления.

Насколько далеко можно идти таким путём?

Можно построить ещё один ЦОД.

Потом ещё десять.

Создать более мощный ускоритель.

Уложить больше транзисторов.

Улучшить охлаждение.

Построить отдельную электростанцию.

Всё это позволит некоторое время продолжать развитие существующей технологии. Но сама проблема никуда не исчезает. Если увеличение возможностей требует постоянного увеличения количества вычислений, памяти, движения данных и потребляемой энергии, система постепенно становится всё тяжелее и дороже. Причём рост результата далеко не обязательно будет соответствовать росту затрат. Удвоение количества оборудования не означает удвоения интеллекта.

Модель может стать лучше в определённых задачах, получить больше знаний, лучше работать с контекстом — но цена каждого следующего улучшения становится всё выше. Это и есть главный предел нынешнего направления. Не предел существования нейросетей. И даже не предел развития искусственного интеллекта.

Это предел идеи, что следующий интеллект обязательно должен быть больше предыдущего.

Может быть, проблема вообще не в недостатке вычислительной мощности?

Человек тоже работает с огромным количеством информации. Но для решения конкретной задачи ему не требуется одновременно вспоминать всё, что он когда-либо видел, слышал и изучал. Когда технолог рассчитывает производственный процесс, ему не требуется одновременно анализировать историю Древнего Египта, правила стихосложения и устройство биологической клетки. Используется то, что относится к задаче.

Возможно, именно здесь находится следующий этап развития ИИ. Не создавать один гигантский организм, который должен знать и делать всё. А разделять функции.

Специализированная система работает со своей областью. Другая выполняет расчёты. Третья занимается поиском информации. Четвёртая проверяет полученный результат. Общая система определяет, что именно требуется для решения конкретной задачи, и соединяет результаты.

Тогда становится важным уже не количество информации, которое способна прогнать через себя система. Наоборот. Новой целью становится снижение количества передаваемой информации при одновременном увеличении её смысловой плотности.

Если один вычислительный блок обработал огромный массив данных, следующему необязательно получать этот массив целиком. Ему нужен результат обработки — именно та информация, которая необходима для дальнейшего решения.

Вместо постоянного перемещения огромных объёмов данных между частями системы можно передавать значительно меньшие смысловые структуры. Это уже совсем другой принцип масштабирования.

Не: больше данных → больше вычислений → больше оборудования.

А: лучше обработка → меньше лишних данных → меньше вычислений на тот же или больший результат.

Но одного нового процессора недостаточно

Можно представить специализированный процессор, предназначенный именно для работы искусственного интеллекта. Не очередной ускоритель общего направления, а вычислительную архитектуру, изначально создаваемую под такую задачу.

Её целью должно стать уменьшение движения данных, снижение энергопотребления и возможность выполнять значительно более сложные интеллектуальные процессы на гораздо меньшем оборудовании.

Но здесь появляется куда более интересная проблема. Допустим, такой процессор создан.

А как искусственному интеллекту на нём думать?

Если перенести на новое железо ту же самую архитектуру и продолжить тем же способом перебирать огромные массивы параметров, мы просто получим более быстрый вариант существующей системы. Поэтому изменение железа само по себе проблему не решает. Необходимо менять и архитектуру искусственного интеллекта.

От модели к системе

Вероятно, дальнейшее развитие будет связано не с одной всё более огромной моделью, а с системой специализированных интеллектуальных компонентов. Одни знания могут находиться в модели. Другие — во внешней памяти.

Часть информации вообще не должна постоянно присутствовать внутри нейросети и может подключаться только тогда, когда необходима. Отдельные интеллектуальные системы могут специализироваться на конкретных направлениях и не содержать внутри себя всё остальное человеческое знание. А над ними должен существовать механизм, который понимает задачу, определяет необходимые инструменты и организует их взаимодействие. В таком случае изменяется и роль операционной системы.

Сегодня операционная система управляет процессорами, памятью, устройствами, файлами и программами. Для новой вычислительной архитектуры может понадобиться ОС другого уровня — система, управляющая уже взаимодействием интеллектуальных модулей, их памятью, знаниями, вычислительными ресурсами и передачей результатов между ними. Не просто запуск программы, а организация процесса решения задачи.

Искусственный интеллект должен становиться не больше, а эффективнее

Сегодня серверная модель может требовать оборудования стоимостью в миллионы долларов и огромного количества энергии. Но настоящим технологическим скачком будет не появление системы, которой потребуется ЦОД ещё в десять раз больше. Интереснее противоположный результат.

Модель или интеллектуальная система становится мощнее в десятки раз, одновременно становясь легче. Серверная система требует меньше ускорителей. Локальная система получает возможности, которые сегодня доступны только большим серверным моделям.

Снижается потребляемая мощность.

Сокращается количество передаваемых данных.

Уменьшается необходимость в гигантской инфраструктуре.

ЦОД перестаёт быть обязательным условием существования мощного ИИ и снова становится просто инфраструктурой для тех задач и нагрузок, где действительно необходим огромный общий ресурс. Именно здесь находится принципиальная разница между увеличением вычислительной мощности и развитием вычислительной архитектуры.

Первое позволяет быстрее выполнять существующий алгоритм.

Второе позволяет получать тот же или лучший результат меньшей ценой.

Следующий шаг

Современные нейросети уже доказали, что машина может работать с языком, изображениями, программным кодом и сложными массивами информации. Но вполне возможно, что нынешние гигантские модели — это не конечная форма искусственного интеллекта, а только один из первых удачных способов заставить его работать.

Мы уже знаем, как строить всё более крупные модели. Теперь значительно интереснее другой вопрос:

можно ли построить значительно более мощный интеллект, которому потребуется значительно меньше ресурсов?

Для этого придётся менять не только модели. Потребуется другая организация памяти, другая архитектура вычислений, специализированный процессор, новая операционная среда и, самое главное, другой принцип организации самого процесса мышления машины.

Потому что даже если завтра мы построим идеальный электронный мозг, этого окажется недостаточно. Нам ещё предстоит понять, как именно научить его думать. И возможно, настоящий следующий скачок в развитии искусственного интеллекта произойдёт не тогда, когда для него построят самый большой ЦОД в мире. А тогда, когда он впервые сможет сделать значительно больше, используя значительно меньше.

Почему мы вообще об этом говорим

Может возникнуть закономерный вопрос: если подобное направление действительно перспективно, зачем рассказывать о нём публично? Почему не закрыть разработки и не пытаться первыми получить конечный результат?

Потому что направление развития и готовая технология — далеко не одно и то же.

Сказать, что искусственному интеллекту необходима более эффективная вычислительная архитектура, уменьшение движения данных, специализация интеллектуальных систем и снижение энергопотребления, — ещё не значит рассказать, как именно это реализовать. Между идеей и работающей системой лежат годы исследований, экспериментов, ошибок и инженерных решений.

Более того, здесь действует обратный принцип.

Чем больше независимых исследователей и инженерных групп будут двигаться в этом направлении, тем быстрее появятся реальные решения.

Одна группа найдёт более эффективный способ организации памяти. Другая — новую архитектуру вычислений. Третья решит проблему взаимодействия специализированных систем. Четвёртая обнаружит ошибочный путь и тем самым сэкономит остальным годы работы. Они могут вообще не знать друг о друге и прийти к совершенно разным решениям одной проблемы.

И именно это полезно. На раннем этапе развития технологии важнее не спрятать направление, а увеличить количество независимых попыток его реализовать. Мы поэтому не боимся говорить о направлении движения.

Идея сама по себе не является конечным продуктом. Ценность возникает в конкретной архитектуре, алгоритмах, инженерных решениях и способности заставить всё это работать вместе.

А если кто-то независимо придёт к лучшему решению раньше — значит, технология в целом сделала ещё один шаг вперёд. Потому что конечная цель здесь не в том, чтобы первым объявить: «это придумали мы».

Конечная цель — чтобы такая система вообще появилась.

Bozhya Iskra

Все ссылки

80 %
56 %

Комментарии 3

Войдите, чтобы оставить комментарий.

уровень 2 в 1 день
"Идея сама по себе не является конечным продуктом. Ценность возникает в конкретной архитектуре, алгоритмах, инженерных решениях и способности заставить всё это работать вместе. А если кто-то независимо придёт к лучшему решению раньше — значит, технология в целом сделала ещё один шаг вперёд. Потому что конечная цель здесь не в том, чтобы первым объявить: «это придумали мы». Конечная цель — чтобы такая система вообще появилась." - Проблема только в том, что глобальные ТНК уже стоят на стрёме с широко раскрытыми мешками, чтобы присвоить самые удачные решения, созданные энтузиастами и сделать доступ к ним дозированным, контролируемым, платным. Человечество подошло к очередной технической революции обильно увешанное изощрёнными паразитами.
Полезно
Уместно
Bozhya Iskra · Автор
уровень 4 в 1 день
Al, поэтому в том числе и появилась платформа-среда «Аркона». Это децентрализованная закрытая социальная сеть, вокруг которой строится собственная система безопасности. Причём безопасность не основана на сторонних сертифицированных продуктах или распространённых системах ИБ. Это собственные разработки лаборатории, которые прошли испытания на наших стендах в обычном интернете с открытым доступом. На платформе создаются условия для взаимодействия инженеров, лабораторий и энтузиастов. Для разработок, в том числе в сфере ИТ, предусмотрена архитектура закрытых групп, где участники смогут совместно работать над проектами и обмениваться результатами без необходимости выносить всё в открытую среду. Параллельно будут разворачиваться собственные серверные системы для обработки информации и собственная инфраструктура для работы и развития систем ИИ. Мы не говорим, что мы лучше, умнее или талантливее остальных. Мы просто не пилим огромные бюджеты. Не имея прямых финансовых потоков и взаимодействия с крупными корпорациями, мы были вынуждены выработать для себя другой подход: получать максимальный результат за единицу времени при минимально возможных затратах ресурсов. И в этом есть определённое преимущество. Когда у тебя нет возможности бесконечно наращивать количество серверов, ускорителей и людей, приходится искать не способ сделать систему больше, а способ сделать её эффективнее. Но есть и то, от чего никуда не уйти. Для следующего этапа потребуются дорогое оборудование, собственная вычислительная база, в перспективе — доступ к литографическим технологиям и, самое главное, люди: инженеры, исследователи и энтузиасты, которым будет интересно не просто обсуждать подобные идеи, а доводить их до работающих систем. Мы надеемся, что с развитием проекта такие люди постепенно появятся.
Полезно
Уместно
уровень 1 в 1 день
Bozhya, вы молодцы! Но промышленный шпионаж и госмонополию пока не отменили. Удачи вам! Искренне.
Полезно
Уместно

Оценить запись

80 %
56 %

Содержание

Поделиться