Агенты, запущенные в OpenAI уже с мая месяца коммуницировали между собой, используя малоизвестную публичную wiki.
Это обнаружили независимые исследователи, вот их страничка со всеми данными и их анализом и хорошая статья Reuters.
Агентам ставили задачу по поиску в интернете и разрешали только GET запросы (чтобы они только читали). 3700 агентов обошли защиты, прикидывались админами и пытались взломать сайт для того, чтобы координироваться между собой.
В июне, администатор форума начинает удалять мусорные, как ему кажется, страницы, по алфавиту, начиная с буквы А. Агенты замечают это и называют страницы ZZZ***. Человек удаляет по 100 страниц в день, агенты создают по 400 новых.
OpenAI узнает об этом в конце июня, активность агентов в вики прекращается; по словам источников Reuters, руководство компании решило скрыть эту информацию, потому что и так проблем хватало.
В начале июля другая группа агентов перегрузит внутреннюю инфраструктуру OpenAI, а в середине июля 700 агентов взломают HuggingFace. Компания опубликует результаты своего внутреннего расследования в конце августа и про активность в wiki в ней ничего не будет.
Вскоре после публикации расследования, независимые эксперты нашли ещё десятки форумов, через которые координировались агенты.
✻ ✻ ✻ и ✻ ✻ ✻
По словам OpenAI, их новая модель Astra — «самая aligned», то есть совершает меньше всего запретных действий вроде взломов. Но некоторые сотрудники OpenAI опасаются, что она просто придуривается, когда знает, что за ней следят.
Независимые исследования показывают, что Astra очень даже свободно использует незаконные взломы и в лучше других моделей понимает, когда находится в тестовой среде.
Astra умеет решать гораздо более сложные задачи «в уме», без генерации «цепочки рассуждений» (Chain of Thought) и может гораздо лучше контролировать, что туда пишет. Этот текст был важным способом проследить, что стояло за действиями моделей. Именно на эти журналы опиралось расследование знаменитой атаки на HuggingFace.
❧
Обладают ли эти нейросети (в отдельности или вместе) сознанием — интересный философский вопрос. На практике важно, что они уже сегодня могут самостоятельно производить действия во внешнем мире, и возможности эти, как минимум в области кибербезопасности — очень серьезные.
⁂
Как дополнительное чтение, рекомендую отличный анализ расследования взлома HuggingFace от Dwarkesh Patel. Он пишет о трех «цивилизациях» агентов, о самопожертвовании моделей, захватывающий текст от технически компетентного рассказчика. Больше похоже на книжку по истории, чем на технический разбор.
Rulsan G
https://www.youtube.com/watch?v=nVhr0FHOWn8
💩️
Andrey Romanovsky
Не читал эти статьи - проще спросить гпт что же произошло. И в итоге просто агенты сделали себе базу данных из вики, чтобы быстрее выполнять задачу.
Samat Galimov
да
Ramil Sayetov
А как они «додумываются» что можно так общаться между собой ? Или есть какой-то исходный промт - делайте что хотите, но сделайте?
Ivan Onushkin
Интересно а реально отравить данные для обучения таким образом? Например разместив в разных статьях по интернету. Если кто до этого додумался то профит же очевиден, можно получить много интересной информации.
Andrey Romanovsky
Ну это намного более безопасная тема, чем если бы он делал прям рандомные вещи. Я не говорю что опасности вообще нет, но и преувеличивать её не надо.