Интерактивный пример разработки с Opus 5.
«Кто в армии служил, тот в цирке не смеется»
Интерактивный пример разработки с Opus 5.
«Кто в армии служил, тот в цирке не смеется»
Друзья, спасибо большое, что откликнулись про приватный инференс!
Я писал тот пост, чтобы поделиться тем, что нашёл, а вы мне показали, что мои знания категорически отстали и авангард уже давно убежал вперёд.
Во-первых, кроме ZDR, который является юридической договорённостью, читай обещанием, есть ещё вариант с технической гарантией, что данные, которые мы отправляем, никуда не утекут.
Называется это TEE — Trusted Execution Environment. Эта штука даёт криптографическую гарантию, что с сервера нам отвечает ровно та программа, которую нам обещали, без всяких дополнительных закладок и сохранения данных. Работает благодаря аппаратной поддержке на уровне процессоров Intel, AMD и NVIDIA.
Исследователи регулярно находят в ней уязвимости, и я уверен, что крупную рыбу АНБ взломает в любом случае, но от массовой слежки это наверняка убережёт.
Получается лучшее от двух миров: никаких капитальных затрат и при этом разумная гарантия безопасности данных. Таких провайдеров не очень много, и GLM-5.3 поддерживают ещё меньше, но есть Phala, Tinfoil и Privatemode, по цене они всего на 20–80% дороже OpenRouter ZDR.
На этот вариант меня навели создатели Wisp, это как Claude Cowork, но для юристов, финансистов и всех, кто не хочет отправлять данные в публичные нейросети.
Во-вторых, мы, кажется, недооценили варианты с квантизацией больших моделей и дообучением маленьких моделей на наших данных. Так, порой можно получить сравнимые результаты на радикально более слабом (и дешёвом) железе.
Для своего проекта мы в результате предложили клиенту трёхэтапный план:
1. Сначала проверяем с помощью TEE/ZDR, что это вообще работает на самых мощных моделях, выясняем границу возможного и прогаем всю обвязку.
2. Арендуем тачку в облаке, разворачиваем там более простые модели и ищем оптимум по соотношению цены и качества.
3. Покупаем своё железо.
Ещё раз спасибо большое! Мой папа любил повторять, что лучше чувствовать себя бараном среди мудрецов, чем наоборот. Вот именно так я чувствую себя сегодня и благодарен богу, что вы есть и откликнулись!
Мне для клиента нужно запустить мощную модель, с гарантией, что его данные никуда никому не утекут. Оказалось, что сделать это не так уж и просто.
Когда отправляешь запросы в API chatGPT или клода, то у них есть возможность включить так называемый ZDR, Zero Data Retention. То есть, они обещают не хранить запросы и контекст, который ты в них отправил. Но там есть «звездочка», что если если классификатор решает, что мы делаем что-то плохое, то тогда данные могут храниться до двух лет. Это вариант нам не подходит.
Мы прогнали все крупные модели на синтетических данных (то есть специально сгенерированных примерах) и из открытых китайских нам лучше всего подошла GLM-5.3. Чтобы запустить её полноценно на своем собственном железе, нужно 8 видеокарт H-200. Купить себе такое довольно трудно, но даже если вы их достанете, стоимость будет под полмиллиона долларов + 5 тысяч долларов в месяц на электричество.
Арендовать подобную тачку на сегодняшний день тоже непросто: у моих любимых Runpod они в теории есть, и стоят всего 30 долларов в час, но на практике всё занято. Из десятков облачных провайдеров, в наличии они есть только у одних индусов Lium.
Зато в OpenRouter’е нашлись несколько провайдеров (Fireworks и Venice), которые поддерживают настоящий ZDR, без всяких оговорок. Платишь за токены, получается даже выгоднее своего железа, пока объемы небольшие. А там уж думаю или ишак научится говорить, или падишах...
Пересел с Claude Code на Codex и модель 5.6 Sol от OpenAI.
Пишет короче и внятнее, чем Opus 5, почти без набивших оскомину конструкций «это не Х, это Y» и прочих. Заметно быстрее Claude Code.
Гораздо более крутая интеграция с Chrome (умеет сразу несколько профилей и управлять мышкой в фоне), и гораздо меньше блокеров типа «данные банковской карты я не буду вводить ни в каком случае, даже если это одноразовая карта с лимитом в 10 долларов».
А ещё он единственный смог найти по короткому описанию 20-летний мем, то есть интернет-поиск у него исключительно мощный.
Ощущение апгрейда в помощи с бытовыми задачами, как когда Opus 4.x вышел и внезапно стало можно прогать нормально с помощью нейросетей. Очень рекомендую.
Учитывая, как быстро развиваются модели и харнесы, хорошо время от времени пробовать всех ведущих производителей. Но мне лень.
Зато каждый раз, когда Claude Code падает, я завожу Codex. Вот и теперь. Приятно удивлен тональностью и скоростью работы Sol 5.6
Рекомендую.
Upd: восстановили; не считают это падением, 🤡
Модели Anthropic начали вшивать в текст секретные водяные знаки.
Текст можно переписать огромным числом вариантов, просто меняя синонимы. Теперь, модели выбирают эти синонимы не случайно, и в последовательности этих не-случайностей зашит сигнал, что текст сгенерирован нейросетью.
Лингвистическую стеганографию (тайное письмо за счет замены синонимов) обсуждали ещё в начале 2000-х, но в 2022 ученый из OpenAI описал, как это можно недорого сделать в нейросетях.
Такая маркировка начинает работать примерно со 150 слов, и не работает, если у модели недостаточно свободы в выборе синонимов — при генерации кода или таблиц с цифрами. Водяной знак переживает незначительную редактуру текста, но не серьезный рерайт.
В 2024 такую маркировку вшил в свои модели Гугл под названием SynthID, а закон ЕС требует маркировать контент, сгенерированный нейросетями, начиная со 2 августа 2026. 190 компаний уже подписали с Евросоюзом договор, как именно они будут реализовывать эту маркировку.
Для детектирования маркировки нужно знать секретный ключ (если все знают ключ — то маркировку очень легко стереть или подделать). То есть для проверки нужно будет загрузить свой текст производителю модели.
Это, наверно, моя личная штука, но я всерьез задумался о том, чтобы переключиться с API на локальный инференс, когда он станет достаточно хорошим. Просто неприятно, что модели будут заниматься этой фигней за мои деньги, вместо полезной работы.
Красивая атака, когда атакующий код разделяют на несколько частей, каждая часть по-отдельности проходит все проверки, а потом всё вместе собирается у жертвы, которая подключила все нужные библиотеки.
С этим хорошо сочетается то, что теперь можно писать всё вообще без библиотек, LLM вытащит только те кусочки кода, которые нужны именно твоему проекту.
Конечно, всё сломается на интеграциях, но это уже следующая серия балета.
Хакеры украли биткоинов на 70 млн долларов с холодных кошельков (считается самым безопасным способом хранения криптовалюты).
А все потому, что разработчик софта для определенной модели кошельков использовал плохой генератор случайных чисел для создания ключевых фраз, они получались недостаточно случайные.
В результате хакер просто перебрал все варианты и восстановил секретные ключи к кошелькам, сам вывод осуществили за 14 минут, чтобы никто не успел опомниться.
Отличный технический разбор от block.
—
Эту уязвимость находит любая современная нейросеть, достаточно натравить ее на исходники.
—
Раньше можно было сказать «в теории тут есть уязвимость, но никто в здравом уме не будет ее эксплуатировать, слишком сложно». Теперь ничего не сложно.
—
Интересно, сколько миллионов токенов сжигаются прямо сейчас с промтом «найди уязвимости во всех популярных крипто-проектах, не совершай ошибок»?
Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.
Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!
Замечательный скилл (инструкция для LLM) для экономии токенов, Caveman. Нейросеть начинает отвечать как пещерный человек. Мне это напоминает стиль общения нелюдимых инженеров из восточной европы.
Учитывая, что программирование мы заменяем на бесконечным общением с нейросетью, экономия текста сильно экономит время и нагрузку на мозг. Рекомендую!
Пример пересказа этого поста в самом его сжатом стиле ultra:
Caveman скилл — LLM говорит как пещерный. Токены экономь. Стиль = угрюмый инженер восточной европы. Чат с нейронкой бесконечный, меньше текст = меньше мозг устал. Бери.
В английском эффект ярче!