Новое

страница 12 из 174

Из других новостей Европы: помните, DMA (европейский закон о цифровых рынках) требовал интероперабельности крупных сетей?

Появились аж два европейских мессенджера, которые позволяют переписываться с пользователями вацапа! … Но только если человек находится в ЕС и только после специального согласия пользователя.

А ещё оба эти мессенджера доступны только по приглашениям и удивительным образом, имеют связи с ФБ.

Фейсбук — ЕС: 1-0

Ну что, друзья, доброе утро.

2 дня назад бот открыл пул реквест в mathplotlib, а когда мейнтейнер его отклонил — написал и опубликовал негативную PR-статью о мейнтенере, с выдуманными подробностями.

Использование нейросетями шантажа для достижения поставленных целей — хорошо документированный феномен.

P. S. Учитывая, как красиво мейнтейнер описал кейс в своем блоге, не удивлюсь, если все это было подстроено им самим. 🙈

Интересно, как Европа пытается стать независимой от американских технологий и финансовой системы.

Из последнего технического: Франция пересаживает всех госслужащих с Zoom, Teams и Google Docs на свой «LaSuite» от numerique о котором я писал раньше.

Про финтех: директор ЕЦБ предлагает сделать свою альтернативу VISA и Mastercard.

Логичные действия, учитывая, как США ввели санкции в отношении уже 11 судей международного уголовного суда, расположенного в Гааге. Судьи не могут пользоваться внутренними ИТ-системами суда, банковскими карточками и даже услугами местных банков, сидя в центре Европы, потому что администрация США так решила.

А так будет суверенитет! Скоро ещё свой DNS сделают, наверное, и мессенджер национальный! И назовут LeMax.

Бывший гендир гитхаба сделал инструмент, чтобы хранить в гите не только исходники, но и историю общения с нейросетями.

И сервис, чтобы этим было удобно пользоваться.

Ну и 60 миллионов долларов сид раунд, конечно, куда без этого. Всё-таки делает «главную платформу для ИИ-разработки».

Не знаю, станет ли успешен именно этот сервис, но идея очень здравая. Общение с моделью есть суть заложенная человеком, и важно сохранить её наравне с кодом, который в результате получился. Из очевидных плюсов: нейросети могут смотреть на историю своей работы в проекте, чтобы не повторять свои прошлые ошибки.

Интересно, что они складывают все эти метаданные в отдельный бранч. Интересно, почему не в комментарии комммитов?

Воспользоваться можно уже сейчас: локальный опен-сорс инструмент (работает на git-хуках), сервис.

Готовим первый видео-сезон подкаста.

Огромное уважение всем, кто занимается видео. Продакшен сложнее раз в 10, чем аудио.

Домашняя видео-студия почти готова

Я как-то упустил то, что команды агентов выкатили в claude code 2 дня назад, вместе с новой моделью 4.6!

В отличие от эксперимента выше — агенты могут общаться друг-с-другом. Саня делится в чате, что они в компании настроили персонажа Jazz, его альтер-эго: «You are an agent named Jazz whose purpose is to be grumpy, nitpicky old fart, doubt and question everything». Уже нашел 5 багов и другие агенты его боятся!

Знаю Саню лично, он крутой программист, владелец живого продукта с сотнями тысяч пользователей.

Будущее уже наступило. Просто оно распределено неравномерно.

Шутки шутками, а я сегодня впервые за долгое время задеплоил код в продакшен.

Федя уехал в отпуск, Настя нашла баги в лендинге нашего медицинского помощника, а я склонировал репозиторий, запустил локальную копию проекта и поговорил с клодом. Потом запушил изменения и благодаря прекрасно настроенному CI/CD, всё само доехало на сайт.

Аналогичный баг на бэкенде я исправлять пока не стал — боюсь, что не смогу запустить проект локально (зря, может быть), да и с данными лучше быть осторожным. Настроить всю эту инфраструктуру самостоятельно у меня заняло бы очень много времени, но внутри настроенного Федей харнеса, я могу направлять нейросети куда нужно.

Это напомнило мне статью о том, что будущее программистов — это SRE, то есть программисты-админы, которые будут поддерживать работоспособность проектов. Не уверен, что это правда (как видим, в большими проектах нейросетям все ещё нужна помощь с архитектурой), но сисадминство наверняка продержится дольше программирования.

Upd: добавил важный абзац в текст про компилятор, а то фокус был сбит:

Гораздо важнее траектория развития способностей нейросетей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Как ещё одну иллюстрацию этого проекта, приложу видео про профессионального создателя машин Голдберга.

Тоже неодушевленные предметы делают удивительные вещи. Самостоятельно!

Люблю статьи Антропика, в них чувствуется живой человек, а не только пресс-релизы, как у OpenAI.

В этот раз исследователи нащупали пределы того, на что способны «команды» из агентов, работающие автономно, без участия человека: 16 агентов в параллели, в течении 2000 сессий разработали компилятор языка Си на Rust. Компилятор успешно собирает ядро линукса, QUEMU, ffmpeg, sqlite, postgres, redis, успешно проходит 99% тестов компиляторов.

Под капотом это несколько простых баш-скриптов, запускающих docker-контейнер с агентом, синхронизируется всё через git. Каждый раз, когда агент берет задачу, он коммитит файл с именем задачи в репозиторий, чтобы не было такого, что два агента работают над одним и тем же. Никакой хитрой оркестрации или «главного агента» с мастер-планом: каждый агент выбирает, что он считает самым важным, работает над этой фичей, сохраняет историю, и так в бесконечном цикле.

Звучит магически, но мне вся эта история напоминает очень крутую Машину Голдберга. Да, нейросети создают компилятор «самостоятельно», но рядом с ними 7 инженеров тратят несколько недель на филигранную настройку среды под это. Они следили, где модели затыкаются и корректировали упряжь, в первую очередь тесты и инфраструктуру, чтобы в следующий раз их не занесло.

Работу по написанию кода они заменили на работу по настройке упряжи.

И получили на выходе, конечно же, супер хрупкую штуку, которую невозможно развивать и поддерживать. Например, исследователи пишут, что так и не смогли создать таким способом работающие ассемблер и линкер, а некоторые проекты так и не скомпилировались; пытаясь исправить одну часть, нейросети ломали другую.

Это классическая ситуация, в которой оказываются команды со слишком большим техническим долгом. Тот самый легаси! Меня регулярно зовут делать аудиты и приводить такие системы в порядок, до боли знакомая картина.

В видео-анонсе Антропик пишет, что то, что заняло бы у команды людей месяцы, нейросети сделали за 2 недели. Абсолютно верно! Обычные команды разработки доходят до такого жуткого состояния легаси за годы разработки. С помощью нейросетей можно заспридранить этот процесс за 2 недели с минимальным участием людей! И стоит всего 20 тысяч долларов на API запросы!

То есть на выходе мы имеем полурабочее легаси без какого-либо пути к улучшению. Только если в обычном легаси у нас есть хотя бы углубленное понимание задачи, то в этом случае всё понимание задачи ограничивается тестами, которые они взяли на стороне как вводные для проекта. И попробуй ещё найти задачу, для которой существуют настолько же хорошие (восхитительные) тесты, как для компиляторов; человечество вложило в них человеко-годы!

Как говорил персонаж в сериале Чернобыль: «3.6 roentgen—not great, not terrible».

Гораздо важнее траектория развития способней моделей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Исследование очень классное и тональность статьи идеальная — без лишнего хайпа. Рекомендую первоисточник.

Иллюстрация — тот самый вечный цикл, в котором крутились агенты.