01
пост №2026

Официальное заявление Anthropic по поводу военных:

1. Мы против того, чтобы следить за американцами, за остальным миром двумя руками за (и уже следим)

2. Мы против того, чтобы сейчас делать полностью автономных дронов убийц, потому что модели пока ещё не достаточно хорошие. Предлагали Пентагону поработать над этим, но они отказались :(

Хорошее заявление, всё проясняет.

02
пост №2078

Неожиданное развитие событий с fable 5: правительство США наложило экспортные ограничения (то, что обычно делают на оружие) — потребовали от Антропика отключить доступ к этой модели для всех иностранцев, включая сотрудников компании - не американцев.

Сделать быстро это Антропик не может, так что выключают доступ для всех.

Правительство утверждает, что обнаружило «джейлбрейк», который позволяет разблокировать возможности модели для кибер-атак. Антропик говорит, что речь о стандартном приеме «исправь ошибку в этом коде», который ровно так же работает и в ChatGPT 5.5. Обещают больше подробностей в течение 24 часов.

Хочется пошутить, что это такая PR-стратегия антропика перед IPO для поддержания хайпа, и что у них в очередной раз не хватает видеокарт, или что это наоборот, козни Сэма Альтмана против конкурента (тоже перед IPO), и что хайп про сверх-возможности в области в кибербезопасности имеет и обратные последствия, но вообще все это исключительно странно, даже для этой администрации. Похоже, кто-то в правительстве всерьез озабочен mythos/fable, ну или просто очередная дурь. 50:50.

🍿

03
пост №2031

Гендир Shopify (а это, на минутку, главная платформа для интернет-магазинов в мире, 7500 сотрудников, капитализация 160 миллиардов долларов), взял autoresearch Карпатого и своими руками запустил его на liquid — систему шаблонизации магазинов на Shopify.

Система провела 120 автоматизированных экспериментов в попытке ускорить загрузку страниц. В результате получился PR (пул-реквест, омоним пиара) на 93 коммита.

Нейросеть ускорила загрузку страниц в два раза. Тоби признает, что там есть overfitting, когда страница оптимизирована под конкретный тест, но есть и куча хороших идей, о которых они раньше не думали. И это не вайбкодинг, а полностью автоматизированная разработка софта под конкретную метрику, причем на кодовой базе, которую 20 лет писали руками очень хорошие программисты. Всё в open source, можете посмотреть сами.

В общем, если у тебя есть конкретное число и механический способ что-то поменять в системе и измерить изменение этого числа — то нейросеть может его оптимизировать. Ребята заопенсорсили всю свою обвязку, pi-autoresearch. Описываешь ей свою задачу, метрику, как запустить код и дальше всё работает самостоятельно.

Интересно, что в очередной раз речь идет о проекте, щедро покрытом тестами (у liquid 974 юнит теста). Вот мы с Федей всю жизнь кричим о важности тестов, и внезапно это оказалось даже полезнее для нейросетей, чем для людей.

Тоби, конечно, не стандартный CEO крупной компании и раньше что-то прогал, но в ноябре, с появлением крутых нейросетей, количество его коммитов выросло в разы.

Мы тоже активно экспериментируем с этими подходами, если есть похожие задачки — обращайтесь!

04
пост №2032

Прикольно, как меняются технические аудиты.

Сейчас мы делаем технический аудит и план технического развития бизнесу, которому почти 30 лет. Десятки репозиториев на разных языках, большАя часть логики в сотнях хранимых процедур и триггеров в монолитной MSSQL базе.

За 4 недели архитектор смог разобраться на уровне, который раньше занял бы полгода минимум.

При этом, если раньше мы готовили PDF файлы и схемы, которые читали люди, то теперь мы собираем папку с анализом исходников, папку с анализом базы (один файл на хранимку или таблицу), и так далее. Все зависимости, вся логика проекта — в текстовых описаниях. Ну и файл с описанием, что мы делаем и для чего, конечно. Все это в гите, с контролем версий.

А дальше подключаем этот репозиторий к Claude code и задаем вопросы по проекту: «как устроена логика ценообразования», «на что повлияет изменение параметра Х», реестр рисков и так далее. Ответы проверяют живые инженеры — так мы оцениваем качество нашей базы знаний.

Если раньше мы оставляли пусть хорошо и с любовью написанные, но документы и делились пониманием в разговорах, то теперь мы как будто оставляем своего цифрового двойника, который будет продолжать отвечать на вопросы заказчика даже после окончания аудита.

Эту базу знаний будут использовать не только для этого рефакторинга, но и для онбординга новых специалистов.

Через 4 недели работы, мой архитектор взял 2 недельный отпуск. Мы дадим свои рекомендации и закончим аудит уже после его возвращения.

Скорость работы увеличилась в разы, но нам, людям, все ещё нужно время, чтобы новые знания уложились в голове. Нужно время, чтобы понимание проросло в нас. Слово «проросло» точно отражает то, что этот процесс нельзя ускорить усиленной работой. Можно только создать условия и не мешать. Раньше это происходило естественно, теперь нужно специально делать перерывы.

Раньше я гордился тем, какие четкие, ясные, красивые диаграммы сервисов мы рисуем. Теперь их заменили полностью автоматизированные mermaid схемы. Генеральную схему всего бизнеса таким образом мы пока не нарисовали, она получатся совершенно неудобоваримая. Это ограничение технологий или отражение внутренней сложности бизнеса? Пока что ее нет и у нас в голове, так что это открытый вопрос.

Делюсь тремя файлами: Claude_md — общие правила игры для модели, а ещё файлы с целями и принципами этого аудита.

05
пост №2080

Подъехали подробности про блокировку fable 5.

Крестная мать баг-баунти програм (она запустила bug bounty в Microsoft и в Минобороны США, не баран чихнул), Кейти Муссурис, прочитала технический документ, который послужил основой для блокировки.

Говорит, что когда fable 5 дали на вход программу и попросили найти уязвимости, она отказалась. И тогда исследователь попросил модель исправить ошибки в этой программе. И подготовить тесты, чтобы проверить, исправлены ли они на самом деле.

Всё, это весь «взлом».

Можно конечно такое починить, но тогда модель станет абсолютно бесполезной для разработки софта.

🍿🍿

06
пост №2019

В технической команде твиттера 30 инженеров, 2 дизайнера и 2,5 продакта. Ну и еще 30 инженеров в xAI работают над рекомендательной системой.

На момент покупки Маском, в твиттере работало 7500 сотрудников, после первой волны увольнений оставалось 550 инженеров.

В телеграме десятки инженеров.

В фейсбуке десятки тысяч.

Вдохновляет!

07
пост №2024

«Интересная» ситуация между американскими военными и Anthropic.

Они подписали контракт на поставку ИИ для нужд армии. Теперь военные требуют, чтобы им можно было не следовать стандартным правилам пользования сервисом (Usage Policy).

Anthropic согласен подвинуться, но хочет внести в договор пункты о том, что их искусственный интеллект нельзя использовать для массовой слежки за американцами и для автономных роботов убийц.

Министерство войны США (они недавно официально переименовались) в ответ грозится не только разорвать контракт, но еще и воспользоваться законом о военном производстве, который позволяет правительству заставлять коммерческие структуры выполнять заказы критичные для оборонки.

А ещё министр пугает эту американскую компанию тем, что её внесут в чёрный список правительства США (объявят supply chain risk, так обычно делали с китайскими компаниями), так что с ними не сможет работать ни один бизнес, который исполняет контракты для государства.

Вы наверняка слышали, что программисты теперь встанут перед таким же выбором, перед каким стояли физики при создании ядерной бомбы. Обычно об этом рассуждают философы, которые ничем не рискуют. А тут ведущая компания в области ИИ может не только потерять большой контракт, но вообще перестать существовать в привычном нам виде. И всё это практически в прямом эфире.

Дальнейшее чтение: позиция EFF (всё предсказуемо), бодрый разбор Astral Codex Ten, который я кратко пересказал выше, и подробный текст от Цви Моушовица.

08
пост №2090

Официальные ссылки на телеграм-каналы и пользователей t.me перестали работать, потому что администратор зоны .me (Черногория, Montenegro) запаузил домен t.me (статус serverHold, его ставит именно администратор зоны).

Анонимный аккаунт в твиттере утверждает, что он написал в техподдержку компании-оператора зоны .me, в американскую компанию Identity Digital и те ответили, что дело в OFAC-комплаенсе.

То есть скорее всего, владелец домена t.me попал под американские санкции (список SDN) или выяснилось, что доменом владеет такое лицо, и теперь американские компании не могут оказывать ему услуги.

Надеюсь, следующим шагом эпол и гугл не заблокируют приложения в апсторах.

Upd: ниже объяснение

Коллеги подсказывают в комментарих, что OFAC ввел санкции против VPN-сервиса, и его официальным адресом указали ссылку на их телеграм-канал.

Интересно, сколько времени займет уладить это недоразумение?

09
пост №2039

Не успел написать про вирус в litellm, как очередная мощная supply chain attack: на этот раз взломали разработчика axios, одной из самых популярных nodejs библиотек, 100 миллионов скачиваний в неделю.

Зараженная версия библиотеки распространялась в течении 3 часов, начиная с 2026-03-30 23:59 UTC.

Если вы делали npm install этой ночью — проверьте тачку. И посмотрите логи CI/CD — если они отрабатывали в это окно и имели какие-либо секретные токены — их нужно срочно сротировать.

Подробное описание атаки тут.

От подобных атак можно защититься раз и навсегда: настройте свои системы управления пакетами так, чтобы они не скачивали библиотеки, обновленные в последние 72 часа. exclude-newer = "3 days” в uv или min-release-age=3 в npm — спросите у своей нейросети, и пусть другие будут бета-тестерами.

10
пост №2058

Замечательный скилл (инструкция для LLM) для экономии токенов, Caveman. Нейросеть начинает отвечать как пещерный человек. Мне это напоминает стиль общения нелюдимых инженеров из восточной европы.

Учитывая, что программирование мы заменяем на бесконечным общением с нейросетью, экономия текста сильно экономит время и нагрузку на мозг. Рекомендую!

Пример пересказа этого поста в самом его сжатом стиле ultra:

Caveman скилл — LLM говорит как пещерный. Токены экономь. Стиль = угрюмый инженер восточной европы. Чат с нейронкой бесконечный, меньше текст = меньше мозг устал. Бери.

В английском эффект ярче!