Основной расследователь взлома HuggingFace называет его slop-vestigation, потому что нормально в этой куче логов не разберешься — только полагаться на ИИ, который выдумывает, врет, ну всё как обычно.
В этот раз было относительно легко, потому что:
- агенты говорили между собой на человеческом языке, а не через активацию весов
- агентов было всего 1200
- агенты были не сильно умнее человека
- у нас не было причин думать, что ИИ, используемый в расследовании, саботировал процесс.
Дальше будет только хуже. Довольно страшный текст, на самом деле. В твиттер-треде METR больше деталей; официальную новость OpenAI можно не читать, там ии-слоп.

Daniil Lysukhin
> агенты были не сильно умнее человека
И вот мы оказались в точке, когда эта фраза в тексте не вызывает удивления 😂
💯️🔥️4😁️9
Даня Жеренков
Выглядит абсолютно фантазией. Либо OpenAI создали true AGI (невозможно на сегодняшний день), либо это PR и хорошо тренированная инсценировка (скорее всего) .
Samat Galimov
да при чем тут agi?
Aleksandr Simashin
уже дошли до уровня, когда чтобы разобраться, что натворила тысяча ИИ, приходится запускать ещё тысячу ИИ — а результатам этих вторых ИИ тоже нельзя полностью доверять
Andrei Kopysov
Если северокорейские хакеры могут ломать сайты, почему это не может сделать нейросеть? У неё в отличие от человека есть возможность проверить тысячи вариантов и какой-то да сработает.
🔥️
Даня Жеренков
Потому что весь постмортем пронизан этой идеей.
До этого отчеты Антропика, Дипмайнда и Киатйцев почти единогласно говоирил что, агенты между собой как минимум не общаются, это не эффективные с точки зрения токенизации язык. А тут они не только на очень удобном к человеческому пониманию языку общаются, но еще и выстраивают целую экосистему и иерархию внутри, а так же пытаются что-то скрыть (продолжая общаться на английском?), да еще и называют себя "роем".
Все это описывают чевлоеческое поведение, не машинное. Модели в конечном итоге все еще предиктят токены, мы от этого никуда далеко не ушли.
❤️
Я не про взлом сайтов - это пожаулйста. Я про "внутреннюю организацию" и "логику" которую в постмортеме представляют. Сломать то можно, какие проблемы. Вести себя при этом как группа анонов на дваче - вот в это верится с трудом.
Artemiy Danovskiy
Так вроде OpenAI сами сказали, мол, блин, это agi
Samat Galimov
«модели просто предиктят токены» — стоило это в начале коментария написать, чтобы понять твою позицию!
ты одному действию приписываешь агентность (в смысле осознанность), а второму — нет
это разделение — твоя субъективная оценка
для нейросети и то и другое токены и решение задачи:)
Даня Жеренков
Я слегка упрощаяю но в целом это же правда 🙂
Если убрать харнес, инфру и все надстройки, конечная цель любой LLM это "дать наиболее ожидаемый ответ".
Vanya
Agi - это скорее пиар. Смотрите наши модели уже AGI. Смотрите они уже как люди взламывают чужие сайты. Пользуйтесь нами, а мы пока подумаем над защитой, чтобы такого больше не происходило
👍️
Andrei Kopysov
Их файн тюнили чтобы ответ был на человеческом языке. Поэтому они и стараются общаться между собой на английском, им это более привычно думаю. Если придумают специальный язык для агентов, будут на нем писать.
Artemiy Danovskiy
Или это термин, в который вкладывается значение.
Andrei Kopysov
Плюс они кроме общения между собой, пишут в логи что делают на английском. Поэтому и общение между собой решили строить таким же образом.
Даня Жеренков
Взлом сайта - это техническая задача. Чтобы прийти к идее о взломе сайта, нужно что-то большее, чем просто цель получить данные. Должны быть инстуркции, либо соответствующие паттерны в обучающем датасете. Модель не может делать то, к чему не было натренирована же (иначе это уже и есть AGI).
Gennady Lebedev
define agi, как говорится
для кого-то мутный пруф «оно само решило сбежать» без промтов чего оно там делало по пути - достаточно
про «не может то, чему не обучена» это на 10-15 лет промах, было справедливо для нейронок, а не для генеративных моделей
как по мне - упорство дурное, на которое мясные мешки не способны чисто физиологически,
вполне объясняет всею историю. Если присыпать байсами (взломали после, а не до предъяв про гениальный взлом/защиту от соседей -> у кого сомнения что в тех тестах появилось много интересного про взломы?) - то вообще тривиально
💯️
имхо, чтобы такое впечатление складывалось работает больше денег, пиара и усилий, чем на развитие моделей
(тренировка и развитие ллм - удел немногих, просто потому что нужных размеров кластер для тренировки и срез всего интернета - дороговат во владении, а много всем говорить «завтра AGI и ты уволен» ну пипец как легко, приятно и мгновенно монетизируется
напоминаю, что это 5++ хайп про ИИ за столетие, остальные 4++ каждый закончился «зимой ИИ», фрустрацией и разочарованием от факапов и скромных результатов. После прошлой у нас у всех появилось распознавание картинок и текста, это были 2000е
первым вообще можно считать был наш соотечественник Марков (и цепи Маркова придумал ровно чтобы работать со словарями и составлять фразы) в 1900х 🤓
Даня Жеренков
Даже в генеративных моделях с multi-step reasoning и прочим есть некоторая архитектура на/в которой модель и обучается же. Вне рамок того, на чем и как модель обучена она ж все равн не выйдет (какие бы паттерны не накладывала). Есть очевидные лимиты так или иначе.
Gennady Lebedev
согласен, но отпилить идею «если не пускают куда-то то туда могут попасть взломом и эксплуатацией чужих ошибок» от корпуса общечеловеческих знаний - не представляю как, а зная один этот факт дедьюс мог дойти и до идеи «если очень надо - попробуй взломать», мысль не очень сложная, чего-то такое дети делают лет с 3-5
ну и реальных кейсов которые очень похожи по принципам на этот прием - дофига, «скачай, деобсфуцируй, пропатч файл чтобы поведение изменилось, проверни в исходный вид» это был например стандартный вариант работы с хадупом, у которого log4j зашит с CVE на 10/10 (не шутка, лет 12 назад было)
лимитов для генеративного нет, это еще Тюринг обещал и потом лингвистика только подтверждала, они все по определению бесконечные (всегда можно сделать еще один отличный от всех остальных вывод/формулу/инстанс)
🙏️
Aleksandr Baklanov
> агенты говорили между собой на человеческом языке, а не через активацию весов
— «Служба очистки. Какой характер работ?»
— «Мне нужно забронировать столик на двоих. На имя Уинстона.»
— «Заказ принят. Уборка будет произведена в ближайшее время.»
😁️3
Даня Жеренков
Это 100%
Да и с Дотовскими ботами там были приколы в 18м (хотя там чистый RL, без ризонинга).
Я просто не оч верю с вопадения, а тут сначала их CRO грит "мы вот на волосочек возле AGI", вчера Time публикует Альтмана с литерали тем же утверждением, и потом постмортем, который очень хочент выглядеть как AGI. Все это на фоне последних результатов Nvidia (с х2 ростом YoY).
Не приуменьшая текущие возможности, все таки выбираю оставаться тут скептиком. Слишком это все похоже на природу денежную, нежели машинную 😅
Gennady Lebedev
ну тут же можно включить классическое «кому выгодно»
вот альтман он делая такие заявления - рискует чем, или может если его поймают на обиане не сможет найти достаточно-убедительную отмазку? Или наоборот может что-то получить сейчас, а потом не отвечать ни секунды если это была ложь?
имхо ответ очевидный, причина почему в банках комплаенс есть, а у политиков нет и почти ни один политик не согласится чтобы его слова записывали сплошняком и потом фактчекали спустя года)
на обещании «ща уволим всех этих людишек и заменим на простое, платное решение» едет вся автоматизация, перед ии напомню был хайп про low/no-code, ехал так же (более крупному провалу помешал ковид и ллм вышедшие вскоре после)
💯️
против страхов предлагаю мантру повторять:
- количество кода, который надо написать, никогда не было проблемой, проблемой было его на следующий день поменять и еще раз выкатиться;
- дураки и графоманы были всегда, мы просто лет за 10-20 разобрались кто умеет что-то делать и как это понять быстро;
- написать приложение которое «плохо решает кучу проблем» - легче чем «одну, но хорошо»;
- никому не нужны программисты (как и банки), всем нужны сервисы, которые ведут себя предсказуемо.
из всех новых свойств которые затронули корни индустрии ллм дали только ускорение ненадежного анализа длинных цепочек (надежности не было и у людей, но цепочки были проще и короче). Генерация и человекочитаемые тексты никогда и не были проблемой кмк
если наложить на заявления - становится очевидно что ни аги ни пути туда не известны никому, потому что мы проблему не понимаем до конца, а не потому что плохо решение ищем
Roman_Sh /ᐠ。ꞈ。ᐟ\
Это не AGI. Просто иишке дали тупое задание, которое не сделать без списывания.... И запретили списывать напрямую
🦄️
Даня Жеренков
Да еще и каждый вкладывает в это понятие что-то свое. Начиная от эмоционального интелекта и заканчивая способностью к самовоспроизведению 🤷
Но у меня лично страхов на эту тему, да как и иллюзей. Весь GenAI это довольный мощный тул, однако все еще тул. Управляют им, как и принимают решение кожанные.
🤝️
Но она в итоге списала и все, "мы на 80% близки к АГИ" 😁
Gennady Lebedev
ооодааа, каждый раз дивлюсь что люди не могут себе представить способный интеллект без грамма эмоций, будто психопатов не существует и так
😁️2