Мне для клиента нужно запустить мощную модель, с гарантией, что его данные никуда никому не утекут. Оказалось, что сделать это не так уж и просто.
Когда отправляешь запросы в API chatGPT или клода, то у них есть возможность включить так называемый ZDR, Zero Data Retention. То есть, они обещают не хранить запросы и контекст, который ты в них отправил. Но там есть «звездочка», что если если классификатор решает, что мы делаем что-то плохое, то тогда данные могут храниться до двух лет. Это вариант нам не подходит.
Мы прогнали все крупные модели на синтетических данных (то есть специально сгенерированных примерах) и из открытых китайских нам лучше всего подошла GLM-5.3. Чтобы запустить её полноценно на своем собственном железе, нужно 8 видеокарт H-200. Купить себе такое довольно трудно, но даже если вы их достанете, стоимость будет под полмиллиона долларов + 5 тысяч долларов в месяц на электричество.
Арендовать подобную тачку на сегодняшний день тоже непросто: у моих любимых Runpod они в теории есть, и стоят всего 30 долларов в час, но на практике всё занято. Из десятков облачных провайдеров, в наличии они есть только у одних индусов Lium.
Зато в OpenRouter’е нашлись несколько провайдеров (Fireworks и Venice), которые поддерживают настоящий ZDR, без всяких оговорок. Платишь за токены, получается даже выгоднее своего железа, пока объемы небольшие. А там уж думаю или ишак научится говорить, или падишах...
0x4F6D6E6F6D6E6F6D 🦒
@
👍️4😁️68
Samat Galimov
?
Anatolii
Смотрели в сторону Together.ai? https://www.together.ai/models/glm-5-3
daniel k
почему не Amazon Bedrock?
👍️9
Сергей Семин
Наверное, вопрос в том, а правда ли можно верить в их ZDR
👍️6💯️34
Artem
Как будто единственный вариант - хостить модель на своём железе. Тогда риск что в какой-то момент провайдер поменяет политику хранения данных и таки начнёт что-то продавать ниже.
👍️💯️15
Alexey Samoylov
А с апи оно не включено по-умолчанию?
А то там есть возможность наоборот включить режим "делиться", тогда они дают некоторое количество бесплатных токенов каждый день.
Я так себе фри тир сделал на опенсорс проекты.
https://platform.openai.com/settings/organization/data-controls/sharing
Alex
да и то, для гарантии надо ещё модель ревёрсить либо хотя бы сниффать, кто её знает, что и куда она отправляет
daniel k
H200 у финского провайдера: https://verda.com/pricing?network=g&matchtype=p&placement=&device=c&utm_term=verda%20gpu%20pricing&utm_campaign=gg_global_search_brand&utm_source=google&utm_medium=cpc&utm_id=24063860043&utm_content=verda_pricing&hsa_acc=1982613782&hsa_cam=24063860043&hsa_grp=198769414316&hsa_ad=818373436785&hsa_src=g&hsa_tgt=kwd-2466107955296&hsa_kw=verda%20gpu%20pricing&hsa_mt=p&hsa_net=adwords&hsa_ver=3&gad_source=1&gad_campaignid=24063860043&gbraid=0AAAAA_KcLraCmsfO_Wq3l3S_hFwNmC8SV&gclid=Cj0KCQjwkt_UBhDMARIsALpnOAxFjIBq3SKD6rNQSy9HBEuh38CkyuEeiRlulqMku6LoHv99ij60spkaAn4HEALw_wcB
Artem
Сама модель - это ж тупо веса, куда она сама что-то отправит, если ей доступа к коду не давать?
0x4F6D6E6F6D6E6F6D 🦒
для гарантии что никуда ничего не утечет, надо хостить локально.
та модель которая сейчас кажется топом - будет тупой через год + обновления идут так быстро, что я не удивлюсь, что через год хватит 96 гб, чтобы запускать условную квантованную модель уровня fable 5.
💯️5🤷♂
Nikian
Есть ещё опции у антропика, они хостят на закрытых серверах AWS (Amazon Bedrock) и Google Cloud (Vertex AI)., для медицины, например, и данные никуда не уходят.
👍️2
Ready To Listen
Да как-то не клеится просто "гарантия что данные не утекут" и филькина грамота уровня "мамой клянус" от не самых известных контор. Гарантией это точно не назвать.
👍️18
Mish Zorikhin
А почему 8*H200?
GLM-5.3 поддерживает NVFP4, можно взять 8×RTX PRO 6000
это уже где то $165k
👍️2
Raviolli
модели уровня qwen 3.8 27b - flash next 125b-a6b рассматривали?
Samat Galimov
сильно хуже ответ на наших задачах, но посмотрим ещё раз внимательнее!
launching soon...
😁️2
Matvei
А квантованную GLM 5.3 не смотрели?
Flash квантованная по бенчам актуальным чуть похуже Opus'а 5 емнип
👍️
Иосиф
А вы уверены что вам условного Qwen 3.8 27B не хватит (который на одной a100 поднимется)?
Какой то эксперимент по определению локального минимума нужной модели проводился?
кажется на рынке не так много задач в которых нужен фронтир в случае если есть конкретное ТЗ и ограничения бизнес процесса
dneve u
спрос есть на on-prem железки? какой batch?
есть разные варианты, mac studio+exo, epyc-и, dgx-spark, blackhole, jetson, кастом разработки
думаю запускать свою железку на рынок или нет
ценник выходит примерно такой
40k+ для kimi k3
25k+ для ds4pro
15k для glm5.2
оценки для q4
👍️2
Aliday⋆
Дичь какая-то. Сейчас можно собрать несколько мак студио в кластер с общей памятью. Будет стоить как несколько макстудио, никаких миллионов долларов.
Max R.
+1 к квантованым моделям. «Из всех щелей» кричат, что потеря в качестве несколько единиц процентов, а выигрыш в ресурсах - огромный
Dazik Akbarov
Я бы плюсанул про Amazon Bedrock. У нас настоящий ZDR для подавляющего большинства моделей без никаких сносок.
👍️4
Grispire
На заборе тоже написано. К данным очень часто относятся легкомысленно, даже если за это грозят анальные кары от госрегуляторов, просто потому что итоговый штраф выходит не таким страшным.
Плюс обещать (искренне) ZDR и его обеспечивать - разные занятия. В текущих реалиях нет никаких гарантий, что разраб без присмотра не решит логнуть или отправить в аналитику кусок реквеста, даже не понимая что он этот ZDR нарушил.
👍️3💯️
Ivan
+ openrouter потенциально может хранить и анализировать содержимое запросов.
если скорость ответов не сильно важна - можно 4 dgx spark купить.
Vladimir Kharitonov
А Nebius не ОК? ZDR у них тоже есть вроде бы под чутким европейским регулированием
❤️
daniel k
вот это уже интересно — а для каких моделей не настоящий? )
😁️
Dazik Akbarov
Есть оговорки с Fable, связанные с правилами Anthropic. Мы про них пишем тут - https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-anthropic-claude-fable-5.html
В целом, если нужно работать с Fable, то ZDR не получить нигде.
👌️2
Samat Galimov
Это параллельный фронт работ, нам бы сначала feasibility проверить
Слава
Не верят
Артур
важно еще отправлять запросы в fireworks напрямую, тк в самом openrouter zdr нет
Samat Galimov
https://openrouter.ai/docs/guides/features/zdr
Попробуем их же квантованные, спасибо за идею! Мне кажется flash смотрели, но посмотрим внимательнее
Артур
выходит, я был неправ
amik
Подскажешь где их взять по 20к?
🔥️
Николай
Что это за процесс такой, который нельзя оптимизировать под более слабые модели?
Anton S
Glm 5.3 flash вроде проще и дешевле запустить на локальном железе и мне она пока нравится по тестам вполне (но квант ниже 8 я бы не снижал)
Mish Zorikhin
https://www.blackwellcloud.com/nvidia-rtx-pro-6000-gpu-servers
что то такое
🔥️😱️
Imaskar
А отвечать надо быстро? Есть ещё вариант стримить большую модель с ссд.
🤔️
Yegꙮr Yegꙮr
Glm 5.3 flash запускается бодро на двух rtx 6000
Тачка выйдет ~4-5 лямов, данные точно никуда не утекут
👍️
Andrey Kuznetsov
Venice квантуют модели, то есть вы получаете «ужатую» модель и не получаете тот же ризонинг, что был бы в оригинале
Nikian
а о чем речь? дайте почитать
Samat Galimov
Ооо, это очень полезная инфа, спасибо! Нам просто как раз хочется квантованные модели проверить
amik
Если ты спам-бот, а не спам-чел, то видимо на астре или фэбл, хороший уровень
Samat Galimov
спам-бот, довольно стандартный уже
Вот такое
Kirill Zaitsev
ну 8 H200 это еще щадящий сетап, под некоторые модели приходится и целый кластер сетапить
Sergey Kolesnikov
usewisp.io именно то, что вам нужно. Сейчас из мощных моделей есть Kimi K3 и GLM 5.2. Скоро будет добавлена поддержка GLM 5.3. Модели работают в аппаратно защищенной среде, никто (даже команда wisp и провайдеры моделей) физически не имеют доступ к данным. Сам агент максимально защищен, данные пользователя хранятся локально на его машине в зашифрованной базе данных, для всех действий агента настраиваются права вызова, все запросы в интернет идут через аппаратно защищенную среду, которая анонимизирует трафик для сторонних сервисов. Также есть функционал записи звонков - как Granola, только приватно.
❤️2