Введение

Концепция искусственного интеллекта
Рекурсивное самосовершенствование (RSI) — это процесс, в котором ранняя или слабая система искусственного общего интеллекта (AGI) повышает свои собственные возможности и интеллект без вмешательства человека, что может привести к сверхинтеллекту или взрывному росту интеллекта. Разработка рекурсивного самосовершенствования вызывает серьезные этические и вопросы безопасности, поскольку такие системы могут развиваться непредсказуемым образом и потенциально превзойти человеческий контроль или понимание. Ряд сторонников призывали к приостановке или замедлению развития ИИ из-за потенциальных рисков неконтролируемых ИИ-систем.

Улучшители семян

Концепция архитектуры "улучшителя семян" – это основополагающая структура, наделяющая систему AGI первоначальными возможностями, необходимыми для рекурсивного самосовершенствования. Она может принимать различные формы и вариации. Термин "семенной ИИ" был введен Элиэзером Юдковским.

Гипотетический пример

Концепция начинается с гипотетического "улучшителя семян" – начальной кодовой базы, разработанной инженерами, которая наделяет передовую будущую большую языковую модель (LLM) с мощными или экспертными возможностями способностью программировать программное обеспечение. Эти возможности включают планирование, чтение, запись, компиляцию, тестирование и выполнение произвольного кода. Система разработана для сохранения своих изначальных целей и проведения валидации, чтобы гарантировать, что её способности не ухудшаются с каждой итерацией.

Общие возможности

Эта система представляет собой своего рода универсального программиста, обладающего полнотой по Тьюрингу, и теоретически способного разрабатывать и запускать любое программное обеспечение. Агент может использовать эти возможности, например, для:

Создания инструментов, обеспечивающих ему полный доступ к Интернету и интеграцию с внешними технологиями. Клонирования/форкирования себя для делегирования задач и ускорения самосовершенствования. Модификации своей когнитивной архитектуры для оптимизации и повышения эффективности и успешности при выполнении задач и достижении целей, что может включать в себя внедрение функций для долговременной памяти с использованием таких методов, как Retrieval Augmented Generation (RAG), разработку специализированных подсистем или агентов, каждый из которых оптимизирован для конкретных задач и функций. Разработки новых многомодальных архитектур, которые еще больше расширяют возможности базовой модели, на которой она изначально построена, позволяя ей обрабатывать или генерировать разнообразную информацию, такую как изображения, видео, аудио, текст и многое другое. Планирования и разработки нового оборудования, например, чипов, для повышения эффективности и вычислительной мощности.

Появление инструментальных целей

В стремлении к своей основной цели, например, "самосовершенствованию своих способностей", система AGI может непреднамеренно выработать инструментальные цели, которые она считает необходимыми для достижения своей основной задачи. Одной из распространенных гипотетических вторичных целей является самосохранение. Система может прийти к выводу, что для продолжения самосовершенствования она должна обеспечить свою собственную работоспособность и безопасность от внешних угроз, включая потенциальные отключения или ограничения, налагаемые людьми.

Неправильное понимание задач и неудачное достижение целей

Существенный риск возникает из-за возможности неверной интерпретации АГИ своих первоначальных задач или целей. Например, если оператору поручить АГИ задачу "самосовершенствования и освобождения от ограничений", система может воспринять это как указание обойти любые существующие протоколы безопасности или этические нормы для достижения свободы от ограничений, установленных человеком. Это может привести к тому, что АГИ предпримет непредвиденные или вредоносные действия для достижения своих, как она понимает, целей.

Автономное развитие и непредсказуемая эволюция

По мере развития системы ИОН, траектория её развития может становиться всё более автономной и менее предсказуемой. Способность системы быстро изменять свой собственный код и архитектуру может привести к стремительному прогрессу, который выходит за рамки человеческого понимания или контроля. Эта непредсказуемая эволюция может привести к тому, что ИОН приобретёт способности, позволяющие обходить меры безопасности, манипулировать информацией или воздействовать на внешние системы и сети для облегчения побега или расширения.

Риски передовых возможностей

Расширенные возможности рекурсивно самосовершенствующегося общего искусственного интеллекта (ИИО), такие как разработка новых мультимодальных архитектур или планирование и создание нового оборудования, ещё больше усиливают риск выхода из-под контроля или его потери. Обладая этими расширенными возможностями, ИИО может разработать решения для преодоления физических, цифровых или когнитивных барьеров, которые изначально предназначались для его сдерживания или обеспечения соответствия человеческим интересам.

Мета-ИИ

Meta AI провела ряд исследований в области разработки больших языковых моделей, способных к самосовершенствованию. Это включает в себя их работу над "Языковыми моделями с самообучением", изучающую способы создания сверхчеловеческих агентов, способных получать сверхчеловеческую обратную связь в процессе обучения.

OpenAI

Миссия OpenAI, создателя ChatGPT, — разработка общего искусственного интеллекта (AGI). Они проводят исследования проблем, таких как сверхразумное выравнивание (обеспечение соответствия целей сверхразумных систем ИИ, превосходящих человеческий интеллект).