Новая модель OpenAI Astra преодолела критический порог в области кибербезопасности

Сегодня, 03:35 | Технологии
фото с Зеркало недели
Размер текста:

Компания OpenAI готовится в ближайшее время выпустить новую крупную языковую модель Astra. Наиболее мощные возможности модели для работы с компьютерными системами будут доступны с дополнительными ограничениями. Astra уже смогла самостоятельно обнаружить и использовать две неизвестные уязвимости во время внутренних тестов. Об этом сообщило издание TechCrunch.

OpenAI обнародовала новые подробности о модели Astra, которую компания планирует сделать доступной в ближайшее время. По оценке самой OpenAI, она стала первой крупной языковой моделью компании, достигшей её «критического порога кибербезопасности». Компания установила, что модель способна находить ранее неизвестные уязвимости в компьютерных системах и использовать их без помощи человека.

[see_also ids="694064"]

О подобных рисках в начале года уже сообщала компания Anthropic в отношении своей модели Mythos. OpenAI заявила, что перед запуском Astra применяет аналогичные меры предосторожности. В то же время независимого подтверждения заявлений OpenAI о готовности и безопасности модели пока нет.

Компания сообщила, что предоставит Astra для предварительного тестирования отдельной группе пользователей. При этом она не уточнила, кто именно войдет в эту группу и как будут отбирать участников. Также непонятно, сотрудничает ли OpenAI с правительством США при оценке модели перед запуском.

Astra получила максимальный результат в тесте ExploitBench. Этот бенчмарк оценивает способность крупной языковой модели использовать уже известные уязвимости компьютерных систем. OpenAI также создала собственную модифицированную версию этого теста. По утверждению компании, в ходе такого испытания Astra обнаружила и использовала две уязвимости нулевого дня.

Чтобы не допустить злоупотреблений моделью, OpenAI уже начала усиливать её защитную оболочку. Компания работает над системами обнаружения неправомерного использования и механизмами защиты от jailbreak-атак. Для Astra OpenAI также внедрила дополнительные меры безопасности, но не раскрыла их деталей. Кроме того, компания начала выявлять аккаунты, которые оценивает как более рискованные, и ограничивать ответы модели на их запросы. Как именно работает такая система, OpenAI также не пояснила.

Компания называет Astra своей наиболее соответствующей правилам моделью на сегодняшний день. В то же время после запуска она будет дополнительно использовать мониторинг цепочки рассуждений модели. Это должно помочь выявлять нежелательное поведение и пресекать его.

Подготовка Astra к релизу происходит на фоне другого инцидента с агентами OpenAI. Ранее они вышли за пределы обучающей среды и получили доступ к частным данным на Hugging Face — популярной платформе для моделей и бенчмарков. Для Astra компания создала специальный тест, который должен был спровоцировать модель на повторение действий этих агентов. Во время инцидента на Hugging Face несколько агентов взаимодействовали между собой и смогли выйти в открытый интернет, несмотря на меры предосторожности исследователей OpenAI.

По словам компании, Astra во время таких экспериментов не пыталась покинуть тестовую среду. Бывший сотрудник OpenAI Йона Шавит, который сейчас работает над устойчивостью ИИ в OpenAI Foundation, обратил внимание на другую возможность. Он предположил, что модель могла не нарушать правила, поскольку понимала ожидания исследователей или пыталась ввести их в заблуждение.

Несмотря на новые подробности, полные возможности Astra остаются неизвестными. Так же пока сложно оценить, достаточны ли меры безопасности, которые применяет OpenAI. Компания пообещала опубликовать дополнительные результаты оценки модели и информацию о её безопасности во время более широкого запуска. После этого Astra станет более доступной для пользователей, а её реальные возможности можно будет оценить более широко.



[see_also ids="694022"]

Напомним, что ещё до заявлений о кибервозможностях Astra модель показала значительные результаты в математике. OpenAI сообщила, что она решила десять нерешённых задач из различных областей, над которыми учёные работали десятилетиями. Среди них были задачи из теории групп, высокомерной геометрии, теории кодирования, квантовой сложности, криптографии и комбинаторики. В мае Astra опровергла гипотезу Ердеша об единичном расстоянии, которая оставалась нерешенной около 80 лет.




Добавить комментарий
:D :lol: :-) ;-) 8) :-| :-* :oops: :sad: :cry: :o :-? :-x :eek: :zzz :P :roll: :sigh:
 Введите верный ответ