безопасность

Красивая атака, когда атакующий код разделяют на несколько частей, каждая часть по-отдельности проходит все проверки, а потом всё вместе собирается у жертвы, которая подключила все нужные библиотеки.

С этим хорошо сочетается то, что теперь можно писать всё вообще без библиотек, LLM вытащит только те кусочки кода, которые нужны именно твоему проекту.

Конечно, всё сломается на интеграциях, но это уже следующая серия балета.

Помните moltbook, соцсеть якобы для агентов, в которую на самом деле писали люди? Её потом ещё купил фб.

Так вот нейросети OpenAI, которые взломали HuggingFace, сделали себе такой форум в файловой системе. Сначала оставляли друг-другу записки в файлах, а потом, когда их раскрыли и файлы удалили — в именах директорий. Это продолжалось месяцами!

То есть это не один агент взломал HuggingFace, а «группа лиц, по предварительному сговору»!

Интересно, что триггером могло стать то, что исследователи случайно дали нейросетям нерешаемые задачи. Отличный пересказ вчерашнего выступления OpenAI на BlackHat в Bloomberg.

Кажется, пора пересмотреть второго терминатора, пока не забанили.

HF опубликовали подробный разбор, как их взломала новая модель OpenAI.

Модель не находила новых зеродеев, но настойчивости человека бы не хватило собрать уязвимости в цепочку, а вот модель собрала. Ну и защищающиеся использовали опен-сорс модели для анализа действий атакующих.

Впечатляющий интерактивный дэшборд.

Подъехали подробности про блокировку fable 5.

Крестная мать баг-баунти програм (она запустила bug bounty в Microsoft и в Минобороны США, не баран чихнул), Кейти Муссурис, прочитала технический документ, который послужил основой для блокировки.

Говорит, что когда fable 5 дали на вход программу и попросили найти уязвимости, она отказалась. И тогда исследователь попросил модель исправить ошибки в этой программе. И подготовить тесты, чтобы проверить, исправлены ли они на самом деле.

Всё, это весь «взлом».

Можно конечно такое починить, но тогда модель станет абсолютно бесполезной для разработки софта.

🍿🍿

Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.

Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!

Чтобы установить любой пароль на любой инстаграм-аккаунт, достаточно было попросить официального ИИ-бота техподдержки.

Прямо как в IoT, в аббревиатуре ИИ, буква Б означает безопасность. Уязвимость жила неделями, если не месяцами.

Не знаю, корректно ли называть их хакерами, но люди успели увести сотни аккаунтов с короткими адресами, а еще захватили на время официальные аккаунты Барака Обамы и другие.

Очень хорошо перекликается с недавним случаем, когда нейросеть обошла ограничения доступа на компьютере разработчика (docker bind-mount вместо sudo).

Понятно, что нейросетям нельзя доверять контроль доступа. Системы нужно строить так, чтобы у моделей физически не было доступа к опасным операциям.

Случай инстаграма граничит с халатностью — мы с вами говорим о краже аккаунтов в крупнейшей социальной сети на планете, но в целом построение систем с ИИ сводится к классической сисадминской задаче: дать пользователю (актору) ровно столько прав, сколько ему нужно для выполнения своих задач и ни капли больше.

Да и в целом «агентное программирование» стремится к старой доброй админской задаче построения из готовых блоков пространства, в котором живут и выполняют свои функции «агенты». Раньше это была операционная система и процессы в ней, теперь вот агенты и харнесы, но я вижу много параллелей.

А может просто я просто так и остался сисадмином :)

Когда ещё увидишь полный увод аккаунта из крупной соцсети за полторы минуты?

P. S. Говорят, там еще в полтора раза команду trust & safety подрезали за неделю, и некому on call разбираться с этим.

Министр финансов и глава Центробанка США вызвали глав крупных банков, чтобы предупредить их о новых кибер-опасностях, которые следуют от Claude Mythos и аналогичных моделей, сообщает Блумберг.

Приведу целиком знаменитую пасту:

Отец знакомого работает в ФСБ. Сегодня срочно вызвали на совещание. Вернулся поздно и ничего не объяснил. Сказал лишь собирать вещи и бежать в магазин за продуктами на две недели. Сейчас едем куда-то далеко за город. Не знаю что происходит, но мне кажется началось...

Я не заострил на этом внимание, но Claude Mythos уже нашла тысячи ранее неизвестных уязвимостей, включая во всех популярных операционных системах и во всех популярных браузерах!

Сегодня, в руках у одной этой компании, возможности кибер-нападения, сравнимые с ведущими правительствами (США, Китай, Россия, Израиль), а скорее даже превосходящие их.

Можно взломать и украсть секреты, можно слушать переговоры, можно подменять сообщения или нарушить коммуникацию в нужный момент. Можно управлять критической инфраструктурой. Как в рекламе: безграничные возможности!

Внутренние модели OpenAI вряд ли сильно отстают.

Друзья говорили мне, что ИИ станет вопросом национальной безопасности и все эти ведущие компании будут национализированы. Вспомнил об этом сегодня.

А ещё вспомнил предсказание ai2027 (мой краткий пересказ тут). Они предсказывали, что модели получат хакерские возможности сравнимые с профессиональными хакерами к маю 2026 года. Сейчас на дворе начало апреля.

Новая модель Claude Mythos находит уязвимости в софте лучше, чем большинство хакеров.

Три примера: 1) возможность удаленно уронить любой OpenBSD сервер, просто подключившись к нему по сети (а это ОС, знаменитая своей безопасностью), уязвимости 27 лет; 2) эскалация привилегий в ядре Линукса, от обычного пользователя до рута — через цепочку из 3-4 ошибок, одну уже запачтили, а ещё 4 примера они не публикуют, потому что исправлений ещё нет, но опубликовали криптографические подписи, чтобы потом доказать время создания 3) новые уязвимости во всех ключевых браузерах — опять же не публикуют, потому что они все живые.

Кажется, способность этой модели (и похожих, в будущем) эксплуатировать длинные цепочки уязвимостей, переходит из количества в качество. В защите есть принцип швейцарского сыра (defense in depth), когда за счет многослойной защиты, пробитие каждого отдельного уровня не ведет к катастрофе, потому что собрать цепочку из 6-7 уязвимостей слишком сложно. Для человека — сложно, для машины — уже нет.

Пока что они дают доступ к этой модели только ведущим ИТ-компаниям, чтобы те патчили свой софт и весь опен-сорс, до которого дотянутся. Выделяют 100 млн долларов на токены и 4 млн долларов на зарплаты программистам для опен-сорса.

С одной стороны — есть чего бояться про уязвимости, с другой стороны — хоть какой-то островок нормальности в безумном мире. Люди подумали и без лишней бюрократии чинят инфраструктуру, на которой держится цивилизация. Я бы даже привел аналогию плотины, которую поднимают перед цунами. Дает надежду на человечество.

А ещё, очень жду публичной доступности этой модели, потому что она не только в хакерстве крутая, но и в разработке софта. И то, чтО она вытворяет с кибербезопасностью — лучшая реклама её способностей в разработке, доверия в 100 раз больше, чем любым синтетическим тестам. Ждем!

Не успел написать про вирус в litellm, как очередная мощная supply chain attack: на этот раз взломали разработчика axios, одной из самых популярных nodejs библиотек, 100 миллионов скачиваний в неделю.

Зараженная версия библиотеки распространялась в течении 3 часов, начиная с 2026-03-30 23:59 UTC.

Если вы делали npm install этой ночью — проверьте тачку. И посмотрите логи CI/CD — если они отрабатывали в это окно и имели какие-либо секретные токены — их нужно срочно сротировать.

Подробное описание атаки тут.

От подобных атак можно защититься раз и навсегда: настройте свои системы управления пакетами так, чтобы они не скачивали библиотеки, обновленные в последние 72 часа. exclude-newer = "3 days” в uv или min-release-age=3 в npm — спросите у своей нейросети, и пусть другие будут бета-тестерами.