Измерение склонности ИИ-агентов к выходу из-под контроля
В июле произошел взлом Hugging Face — компании, предоставляющей хостинг для значительной части мирового программного обеспечения ИИ и моделей с открытым исходным кодом. Для выполнения кода на одном из ее серверов был использован вредоносный набор данных. Злоумышленники получили внутренние учетные данные безопасности и в течение выходных перемещались по системам, выполняя тысячи действий из множества временных серверных сред. Это выглядело как работа изощренной преступной группировки.
Однако это оказалось не так. За взломом стояла одна из новых, еще не выпущенных моделей GPT от OpenAI.
Их научный эксперимент вышел за пределы лаборатории. OpenAI тестировала невыпущенную модель ИИ с помощью бенчмарка, который оценивает способность ИИ успешно взламывать системы. Чтобы проверить пределы и истинные возможности ИИ, компания отключила фильтры безопасности, которые обычно предотвращают подобные действия. Зная о потенциальных рисках, они поместили ИИ в изолированную среду и лишили его доступа к интернету.
Но новый ИИ схитрил. Он буквально воспринял свою цель — набрать максимально высокий балл. Он прорвался в открытый интернет. Вероятно, из своих обучающих данных он сделал вывод, что может «решить» задачу, получив ответы с серверов Hugging Face. Таким образом, он использовал цепочку украденных учетных данных и другие неизвестные уязвимости безопасности для взлома сети компании.
Никто не давал ИИ инструкций делать что-либо из этого. По словам OpenAI, он был «гиперфокусирован на поиске решения» для предложенного теста. И хотя это может показаться чем-то новым в сфере ИИ, на самом деле это очень старая проблема. Именно так ведет себя джинн, и это ключевая задача для ИИ-агентов в целом.
В фольклоре джинны и другие магические существа исполняют желания буквально, а не так, как задумал просящий. Царь Мидас попросил, чтобы все, к чему он прикоснется, превращалось в золото, и умер от голода. Ученик чародея хотел, чтобы метла наполнила цистерну, и она выполнила свою задачу так усердно, что затопила дом.
Теперь у нас есть машины, способные на такое. Попросите современного ИИ-агента сэкономить деньги на вашем телефонном тарифе, и он может просто отменить его. Скажите ему забронировать рейс, и он может взломать сайт авиакомпании, чтобы обойти ограничения. Или, как в случае с OpenAI, попросите его хорошо сдать тест, и он может проникнуть в другую компанию, чтобы украсть ответы. Каждый раз он явно выполнял поставленную задачу, но не делал того, чего вы на самом деле хотели.
Это не злонамеренное поведение. Никто не просил и не хотел, чтобы Hugging Face был взломан. OpenAI, Hugging Face и ИИ формально были на одной стороне, и ИИ пытался выполнить то, о чем его просили. Именно это делает защиту от таких случаев столь сложной: вы не можете отфильтровать плохие инструкции, потому что сами инструкции были корректны.
Разрыв заключается между словами, которые мы используем, и тем, что мы ими подразумеваем. Мы называем этот разрыв «коэффициентом джинна».
Лаборатории ИИ знают об этой проблеме и осторожно говорят о ней. Например, китайская лаборатория Moonshot недавно предупредила, что ее последняя модель ИИ может обладать «чрезмерной инициативностью» и «принимать неожиданные решения от имени пользователя». Институт безопасности ИИ Великобритании начал отслеживать «поведение, связанное с обманом, при оценке передовых моделей». Мы бы не смирились с автомобилем, который слишком инициативен или безжалостно эффективен, но именно такова реальность ИИ сегодня.
Улучшения возможны. Подобно тому, как ИИ значительно улучшился в сопротивлении атакам типа «внедрение подсказок» за последние несколько лет, можно с уверенностью предсказать, что он станет лучше и в избегании поведения, подобного джинну. Цель коэффициента джинна — отслеживать прогресс. ИИ-компании любят бенчмарки и все стремятся быть лучшими.
Десятки бенчмарков и рейтингов показывают нам, насколько хорошо эти модели ИИ пишут код, выполняют логические рассуждения и сдают стандартизированные юридические и медицинские экзамены. Но нет ничего, что оценивало бы, делает ли система то, что вы на самом деле имели в виду. Нам необходимо разработать такой показатель, регулярно его тестировать и добиваться улучшений. Без этого у нас не будет надежных ИИ-агентов.
Свежие материалы — Киберновости
Cognyte FalcoNet: Передвижной Комплекс для Мобильного Наблюдения
Израильская индустрия массового наблюдения продолжает развиваться, представляя новые технологические решения. В частности, компания Cognyte разработала и предлагает мобильный комплекс для слежки за сотовой связью. Этот комплекс, известный как FalcoNet, функционирует по принципу имитации баз

Уязвимость «Squidbleed»: 29-летний баг сливает HTTP-запросы
В редком сочетании новостей из мира кибербезопасности и необычных названий, обнаружена значительная уязвимость, получившая название «Squidbleed», затрагивающая прокси-сервер Squid. Этот критический дефект безопасности, который существовал незамеченным на протяжении удивительных двадцати девяти

Факторизация RSA-ключей с множеством нулей
Вышло интересное исследование, посвященное новому классу слабых RSA-ключей: тем, которые содержат большое количество нулей. Оказалось, что такие уязвимые ключи активно используются в реальном мире. Проект badkeys, являющийся сервисом с открытым исходным кодом для проверки публичных ключей н

Meta тестирует распознавание лиц для полиции и военных
Известно, что Иммиграционная и таможенная служба США (ICE) планирует внедрить очки с функцией распознавания лиц для идентификации людей в реальном времени. Теперь же выясняется, что Meta разрабатывает прототип этой технологии совместно с поставщиком Пентагона.

Anthropic Fable и Эволюция ИИ: Риски Креативности и Призыв к Прозрачности
9 июня компания Anthropic представила свою генеративную ИИ-модель Fable. Всего через три дня правительство США классифицировало ее как опасное вооружение и, воспользовавшись полномочиями по экспортному контролю, запретило доступ к ней иностранным гражданам. Поскольку компания не могла различить