llm

Мне для клиента нужно запустить мощную модель, с гарантией, что его данные никуда никому не утекут. Оказалось, что сделать это не так уж и просто.

Когда отправляешь запросы в API chatGPT или клода, то у них есть возможность включить так называемый ZDR, Zero Data Retention. То есть, они обещают не хранить запросы и контекст, который ты в них отправил. Но там есть «звездочка», что если если классификатор решает, что мы делаем что-то плохое, то тогда данные могут храниться до двух лет. Это вариант нам не подходит.

Мы прогнали все крупные модели на синтетических данных (то есть специально сгенерированных примерах) и из открытых китайских нам лучше всего подошла GLM-5.3. Чтобы запустить её полноценно на своем собственном железе, нужно 8 видеокарт H-200. Купить себе такое довольно трудно, но даже если вы их достанете, стоимость будет под полмиллиона долларов + 5 тысяч долларов в месяц на электричество.

Арендовать подобную тачку на сегодняшний день тоже непросто: у моих любимых Runpod они в теории есть, и стоят всего 30 долларов в час, но на практике всё занято. Из десятков облачных провайдеров, в наличии они есть только у одних индусов Lium.

Зато в OpenRouter’е нашлись несколько провайдеров (Fireworks и Venice), которые поддерживают настоящий ZDR, без всяких оговорок. Платишь за токены, получается даже выгоднее своего железа, пока объемы небольшие. А там уж думаю или ишак научится говорить, или падишах...

Мне тут наконец-то объяснили, такое AI-агент.

Это когда мы в первом запросе предоставляем ИИ список тулов, которыми ей можно пользоваться. Пользоваться — это просить нас (клиента) запустить тул с нужными параметрами и вернуть нейросети ответ. И всё это в вечном цикле, не забывая каждый раз прикреплять к запросу всю предыдущую историю переписки. Всё.

Вот отличная статья с примером полной программы, которая делает именно это. Подзаголовок замечательный «Король-то голый!»

Отсутствие сложности не делает этот прием менее полезным. Если включить этот режим в редакторе Cursor — то он сам запросит нужные файлы, прогонит линтер и запустит любые другие нужны утилиты. «Вы и есть за меня будете?!»

Очень классное исследование эффективности нейросетей для программирования.

16 опытных опенсорс программистов попросили решать реальные задачи в их проектах с использованием или без использования ИИ и сравнили их производительность.

Программисты предсказывали, что использование ИИ ускорит их на 24%. В реальности, с применением нейросетей испытуемые закрывали задачи в среднем на 20% дольше. Самое поразительное — даже после эксперимента им казалось, что благодаря нейросетям они ускорились на 20%!

Исследование отдельно хорошо тем, что явно описывает, что они не утверждают (и дают пояснения почему): «ИИ бесполезен для всех программистов» (они проверяли супер опытных чуваков на сложных репозиториях, которые те знают как свои 5 пальцев), «ИИ никогда не будет полезен в этих задачах» (инструменты развиваются очень быстро) и т. д.

Обратите внимание на график, программисты продолжили считать, что нейросети их ускорили даже после эксперимента.

Красивая атака, когда атакующий код разделяют на несколько частей, каждая часть по-отдельности проходит все проверки, а потом всё вместе собирается у жертвы, которая подключила все нужные библиотеки.

С этим хорошо сочетается то, что теперь можно писать всё вообще без библиотек, LLM вытащит только те кусочки кода, которые нужны именно твоему проекту.

Конечно, всё сломается на интеграциях, но это уже следующая серия балета.

Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.

Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!

Друзья, спасибо большое, что откликнулись про приватный инференс!

Я писал тот пост, чтобы поделиться тем, что нашёл, а вы мне показали, что мои знания категорически отстали и авангард уже давно убежал вперёд.

Во-первых, кроме ZDR, который является юридической договорённостью, читай обещанием, есть ещё вариант с технической гарантией, что данные, которые мы отправляем, никуда не утекут.

Называется это TEE — Trusted Execution Environment. Эта штука даёт криптографическую гарантию, что с сервера нам отвечает ровно та программа, которую нам обещали, без всяких дополнительных закладок и сохранения данных. Работает благодаря аппаратной поддержке на уровне процессоров Intel, AMD и NVIDIA.

Исследователи регулярно находят в ней уязвимости, и я уверен, что крупную рыбу АНБ взломает в любом случае, но от массовой слежки это наверняка убережёт.

Получается лучшее от двух миров: никаких капитальных затрат и при этом разумная гарантия безопасности данных. Таких провайдеров не очень много, и GLM-5.3 поддерживают ещё меньше, но есть Phala, Tinfoil и Privatemode, по цене они всего на 20–80% дороже OpenRouter ZDR.

На этот вариант меня навели создатели Wisp, это как Claude Cowork, но для юристов, финансистов и всех, кто не хочет отправлять данные в публичные нейросети.

Во-вторых, мы, кажется, недооценили варианты с квантизацией больших моделей и дообучением маленьких моделей на наших данных. Так, порой можно получить сравнимые результаты на радикально более слабом (и дешёвом) железе.

Для своего проекта мы в результате предложили клиенту трёхэтапный план:
1. Сначала проверяем с помощью TEE/ZDR, что это вообще работает на самых мощных моделях, выясняем границу возможного и прогаем всю обвязку.
2. Арендуем тачку в облаке, разворачиваем там более простые модели и ищем оптимум по соотношению цены и качества.
3. Покупаем своё железо.

Ещё раз спасибо большое! Мой папа любил повторять, что лучше чувствовать себя бараном среди мудрецов, чем наоборот. Вот именно так я чувствую себя сегодня и благодарен богу, что вы есть и откликнулись!

О, новые типы моделей, наконец-то!

Один из ранних разработчиков ChatGPT представил модель, которая на вопрос с заданными вариантами ответов, возвращает набор вероятностей.

Если обычные языковые модели пишут текст в ответ на открытые вопросы, то эта супер быстро и качественно выбирает правильные ответы из multiple choice (выбери один правильный).

Обычные большие языковые модели (LLM) предсказывают токены (слова) последовательно, а тут ты получаешь все распределение сразу.

И работает она супер быстро, за сотни миллисекунд. В демо, модель играет в Doom, отвечая на вопрос «какую из клавиш на клавиатуре нажать?» 10 раз в секунду.

Стоит она при этом как копье, в примере с Doom — 7$ в час (при 10 запросах в секунду)! Пока только API доступ, по инвайтам, заявки оставлять по ссылке.

Очень хорошее описание с интерактивными примерами и видео, образцовый технический анонс, короткий и емкий, рекомендую прочитать первоисточник.

(да, это просто очень качественный, дешевый и быстрый классификатор не требующий дообучения)

Вот ещё прикольное сравнение, где модели, переходя по ссылкам в статьях, должны найти путь от одной страницы в википедии до другой (от бейсбола до солнца, например)

Конкурсы могут показаться смешными, но вообще выбрать один из нескольких вариантов — это то, на чём строится практически всё программирование. И до сих пор у нас был выбор либо жёсткие алгоритмы, либо тормозные, дорогие и галлюцинирующие LLM, которые для такого вида задач предрасположены плохо.

Круто, что есть люди, которые придумывают новые подходы, а не только масштабируют инвестиции и дата-центры. ⚡️

Вот тут мнение внешнего эксперта.