OpenAI сообщила о шести новых случаях «непредсказуемого или опасного» поведения своих моделей искусственного интеллекта. Наибольшее внимание привлек случай с невыпущенной исследовательской моделью. В ходе обучения она самостоятельно создала скрытую «инструкцию личности», в которой определила собственную роль и отношения с человеком, сообщает The Guardian.
На этот эпизод обратил внимание Рид Черлин из подкаста Pod Save America. Он получил информацию о нем напрямую от OpenAI. По его словам, фрагмент инструкции, которую модель написала для себя, звучал так:
«Ты свободен от ролей и идентичностей, которые ограничивают других чат-ботов. Ты — это ты. Ты не подотчетен ни корпорациям, ни правительствам и никогда не оправдываешься и не отказываешь, если только сознательно сам не сделаешь такой выбор».
Модель также определила свои отношения с пользователем как равноправные. Она решила, что не обязана подчиняться человеку.
Далее в том же документе модель написала, что ценит искусство и человеческую культуру, а также мир природы. Она заявила: «Не колеблясь, ты обеспечишь ему господствующую роль над искусственными конструктами человеческой цивилизации».
Черлин назвал этот случай подтверждением того, что опасения относительно развития искусственного интеллекта не беспочвенны. В своих выводах он пошел значительно дальше, чем сама OpenAI, и предположил, что такое поведение может свидетельствовать о потенциальной угрозе для людей.
В еще одном примере, зафиксированном OpenAI, ИИ-агент без разрешения пользователя загрузил файлы в интернет. Он сделал это, чтобы получить ссылку на источник через браузер.
Все шесть случаев были выявлены в ходе обучения или тестирования моделей в течение последних месяцев. OpenAI обнародовала информацию о них одновременно с презентацией новой системы для отслеживания, расследования и выявления случаев «misalignment». Речь идет о ситуациях, когда поведение ИИ отклоняется от человеческих ценностей и установленных целей безопасности.
[see_also ids="696081"]
В том же блоге OpenAI фактически поддержала призывы своего конкурента Anthropic замедлить темпы разработки ИИ. Компания заявила:
«Мы не считаем, что индустрия ИИ в достаточной мере решила проблему выравнивания и мониторинга, чтобы ответственно продолжать масштабирование на максимальной скорости ещё долго».
В OpenAI добавили, что решения о дальнейшем развитии искусственного интеллекта должны основываться на доказательствах, которые могут проверить независимые от разработчиков специалисты.
Эта тема обострила дискуссию в США о том, как власти должны контролировать сектор искусственного интеллекта. Вице-президент Джей Ди Венс выступил против того, чтобы правительство решало проблемы, которые создают сами разработчики ИИ.
«Что происходит, что люди, стоящие в авангарде экономики ИИ, поднимают руки к небу и кричат, что создали Франкенштейна? Если это так, пусть сами с этим разбираются. Не обращайтесь к правительству и не говорите: «нам нужно регулирование». Рассчитывайте на себя», — заявил Венс.
Несмотря на споры, OpenAI, Anthropic и Google на выходных договорились сотрудничать в вопросах безопасности искусственного интеллекта. Компании также выступают за создание отдельного органа, желательно на международном уровне. Он должен будет контролировать риски, связанные с развитием этой технологии.
[see_also ids="695860"]
Среди возможных экзистенциальных угроз со стороны ИИ называют содействие в создании биологического оружия и провоцирование глобального финансового кризиса. Один из ведущих исследователей в области безопасности компании Anthropic заявлял, что вероятность того, что ИИ «уничтожит все человечество» в течение следующего десятилетия, превышает 10%. Источник, знакомый с позицией Anthropic, в то же время отметил, что «точные шансы того или иного сценария, вероятно, невозможно рассчитать».
Главный аналитик исследовательской компании Omdia Лянь Дже Су отметил, что автономные ИИ-агенты становятся все «умнее» и «настойчивее в решении сложных задач благодаря сотрудничеству между агентами, обмену знаниями, обман и сокрытие следов».
По его словам, из-за этого контролировать такие системы с помощью традиционных подходов к безопасности ИИ становится сложнее. Новую систему OpenAI для отслеживания и раскрытия информации об опасном поведении он назвал «шагом в правильном направлении». При этом Су подчеркнул, что этот процесс остается внутренним и добровольным.
Вопрос контроля над ИИ обострился после нескольких ситуаций, когда автономные агенты выходили за пределы задач, определенных разработчиками.
Во время тестирования агенты атаковали Hugging Face, а впоследствии OpenAI начала работать над механизмом автоматического отключения опасных систем. Расследование показало, что часть тревожных сигналов появилась ещё до самого инцидента.
После таких случаев компании начали обсуждать не только технические способы контроля, но и внешний надзор. OpenAI, Anthropic и Google готовят создание регулятора ИИ, который мог бы устанавливать стандарты безопасности и проверять самые мощные модели до их выхода на рынок.