Новое

страница 6 из 174

Очень интересно про ИИ-чипы и стоимость инференса.

Вопрос не теоретический: мы планируем продолжать работу с клиентом, для которого проводили аудит огромной старой кодовой базы, и если в прошлый раз вся работа с нейросетями влезла в 200-долларовую подписку, то теперь, когда github copilot просит денег за каждый токен, такая же работа встанет в 2 тысячи долларов.

Ребята недавно провели эксперимент и выяснили, что личные подписки на клод в 20, 100 и 200 долларов дают сжечь токенов на 400, 2000 и 8000 долларов в месяц соответсвенно. Для тарифов OpenAI, коэффициент ещё выше — 700, 3500 и 14000 долларов в месяц (до 70x!).

Насколько сильно субсидированы эти подписки? Какая маржинальность у продажи токенов крупным потребителям? От этого зависит, сохраним ли мы текущий уровень доступа к ведущим моделям или мы с вами живем короткий «золотой век ИИ». Учитывая, что и Anthropic и OpenAI готовятся к выходу на биржу, верить никому нельзя :(

Тут конечно все вспоминают бум строительства железных дорог, или пузырь доткомов. Большинство компаний, которые строили железные дороги или прокладывали оптоволоконные кабели обанкротились, но рельсами и оптоволокном мы пользуемся до сих пор. Поживем — увидим.

⁕ ⁕

На пятки этим SOTA моделям наступают китайские open-source и open-weight аналоги GLM-5.2, Minimax M3, Kimi K2.6. Последние месяцы они неустанно приближаются по качеству к ведущим производителям, но зазор всё ещё есть. Доступ к ним по API можно купить в разы дешевле, потому что они меньше, более оптимизированы и конкуренция между провайдерами выше.

Интересный аспект: китайским пользователям, так же и как и россиянам, официальный доступ к клоду и chatgpt закрыт, так что есть десятки спекулянтов, которые регистрируют сотни и тысячи аккаунтов, покупают на них подписки и перепродают доступ к ведущим американским моделям.

Ходят слухи, что эти «арбитражники ИИ-подписок» в Китае зарабатывают в два конца. Сохраняют всю переписку пользователей с нейросетями (ведь все запросы проходят через них) и продают эти логи создателям китайских моделей. А те потом используют эти логи для дообучения своих моделей.

Вообще, если ты можешь задавать вопросы мощной модели, обучение которой стоило десятки миллионов долларов, можно за небольшую долю этих денег произвести так называемую «дистилляцию», и обучить маленькую модель быть почти такой же умной, как и большая. Именно в этом сегодня Anthropic обвинил китайского гиганта Алибабу.

⁕ ⁕ ⁕

Третья часть этого поста — про будущее.

Вчера OpenAI представила первый кастомный чип, который, якобы, на 50% оптимальнее для инференса, чем чипы от NVIDIA. Печатает их TSMC, проектирует Broadcom, стандартный комплект.

Энтузиаст недавно прошил microGPT прямо на FPGA. Это такие процессоры, логику работы которых можно поменять за несколько секунд-минут (перепрошить). У них относительная низкая тактовая частота (сотни и даже десятки мегагерц против гигарец современнных процессоров), зато если получится уложить весь алгоритм в «железную логику», то чип начинает выдавать готовый ответ на каждый такт, то есть миллионы раз в секунду. FPGA используют для обработки видео, сигналов, на ракетах и в радарах — в приложениях, где важна скорость и надежность. Есть много экспериментов, когда в них укладывали небольшие модели.

Компания TAALAS пошла дальше всех и разработала чип, который реализует Llama 3.1 8B прямо в кремние. Это приличная open source модель 2 летней давности, пусть и с небольшим контекстом (6 тысяч токенов против привычных сотен тысяч сегодня). Самая крутая ИИ-карта Nvidia B200 дает 353 токена в секунду на пользователя в этой модели, а аппаратная реализация TAALAS — 16 тысяч токенов в секунду. Попробовать самому можно на сайте chat jimmy. А теперь представьте, что это нормальная взрослая модель и используется для разработки софта. Дух захватывает.

P. S. Параллельно развиваются специализированные локальные модели, которые работают на компьютерах и телефонах пользователей (тут впереди всех Apple) и есть отдельное движение за децентрализованный инференс (как у криптовалют), у его апологетов я недавно брал интервью, но это уже совсем отдельная история.

В Германии уже третий час не ходят поезда, упала специальная сотовая сеть GSM-R, которая поддерживает связь между машинистами и диспетчерами и обмен технической информацией между поездами. Чтобы не было столкновений, все поезда встали.

На немецком ЖД-реддите ходят слухи, что причина в кривом обновлении софта.

Я и не знал, что у поездов есть своя сотовая сеть из 90-х. У нас уже 5G, а поезда на 2G.

Вообще, в этом вся суть инфраструктуры: пока всё работает — никто не замечает. Я восхищаюсь инфраструктурой, и чем более базовая — тем круче. Надеюсь, когда-нибудь возьму интервью у инженера, который занимается водопроводом и канализацией.

P. S. Недавно узнал, как работали римские акведуки. Там, оказывается, вода становилась чистая за счет точно рассчитанного наклона трубы; вода течет медленно и вся грязь оседает, но и не слишком медленно, чтобы не застаивалась. 🪄

Помните клиента, который делает стартап в одно лицо и уже напрограммировал два миллиона строк кода?

Наш архитектор Леша придумал, как выделить из его монолита отдельный голосовой сервис и написал ADR , а этот парень за день все реализовал :) завтра будем разбираться, не выплеснул ли он по пути ребенка.

С таким я ещё не сталкивался — мы ставим клиенту задачи, а он их программирует!

Разбираемся в умных часах и кольцах: что они измеряют, для чего полезны и какие выбрать.

Наша гостья Татьяна Гатинская занималась умными устройствами в Novartis, а теперь у нее свой стартап про «умную кепку» для мозга, так что шарит она в этом всем профессионально

https://youtu.be/FMAWims9ypM

Кстати, Кейти была экспертом при подготовке Вассенаарских договоренностей, которые определяют, какой софт считается оружием и как его контролировать.

Я в этой связи вспоминаю, как правительство США пыталось запретить публичное распространение криптографии, которую они не могли взломать.

Правительство классифицировало стойкие алгоритмы как вооружение и запрещало их экспорт.

Например, в середине 90-х, было две разных версии браузера Netscape: одна с нормальным 128-битным шифрованием, доступная только в США и Канаде, а остальной мир должен был довольствоваться 40-битным шифрованием.

Активисты, которые боролись с этим безумием, в числе прочего, распространяли алгоритмы и даже исходники RSA и PGP в виде книги. Потому что книги защищены первой поправкой к конституции США о свободе слова.

Вот активистская футболка тех времен, с алгоритмом RSA и крупным предупреждением «эта футболка классифицируется как вооружение и не может быть экспортирована из США или показана иностранцу».

Подъехали подробности про блокировку fable 5.

Крестная мать баг-баунти програм (она запустила bug bounty в Microsoft и в Минобороны США, не баран чихнул), Кейти Муссурис, прочитала технический документ, который послужил основой для блокировки.

Говорит, что когда fable 5 дали на вход программу и попросили найти уязвимости, она отказалась. И тогда исследователь попросил модель исправить ошибки в этой программе. И подготовить тесты, чтобы проверить, исправлены ли они на самом деле.

Всё, это весь «взлом».

Можно конечно такое починить, но тогда модель станет абсолютно бесполезной для разработки софта.

🍿🍿

Неожиданное развитие событий с fable 5: правительство США наложило экспортные ограничения (то, что обычно делают на оружие) — потребовали от Антропика отключить доступ к этой модели для всех иностранцев, включая сотрудников компании - не американцев.

Сделать быстро это Антропик не может, так что выключают доступ для всех.

Правительство утверждает, что обнаружило «джейлбрейк», который позволяет разблокировать возможности модели для кибер-атак. Антропик говорит, что речь о стандартном приеме «исправь ошибку в этом коде», который ровно так же работает и в ChatGPT 5.5. Обещают больше подробностей в течение 24 часов.

Хочется пошутить, что это такая PR-стратегия антропика перед IPO для поддержания хайпа, и что у них в очередной раз не хватает видеокарт, или что это наоборот, козни Сэма Альтмана против конкурента (тоже перед IPO), и что хайп про сверх-возможности в области в кибербезопасности имеет и обратные последствия, но вообще все это исключительно странно, даже для этой администрации. Похоже, кто-то в правительстве всерьез озабочен mythos/fable, ну или просто очередная дурь. 50:50.

🍿

Apple признала серьезные проблемы с софтом. Анонсировали, что новая версия iOS и macOS посвящены исправлению ошибок и ускорению работы. Обещают, что программы начнут открываться на 30% быстрее даже на старых айфонах! Новый CPU scheduler и много других подкапотных улучшений. Может быть, даже поиск в настройках заработает!

Ну слава богу, а то я уже начал подозревать, что это я старею и схожу с ума, а всем остальным ОК.

У Apple уже есть опыт «релизов исправлений», macOS 10.6 Snow Leopard была «версией без единой новой фичи».

В этот раз они не смогли пойти на такой смелый шаг и впихнули новую ИИ-фичу: операционная система будет проактивно давать весь необходимый контекст о наших жизнях нейросети, встроенной в Сири. Честно говоря, все это нам уже обещали в Apple Intelligence год назад, но видимо в этот раз точно :)

Ах да, в Евросоюзе и в Китае вся эта история с нейросетями работать не будет. И жалобам на антимонопольное законодательство Евросоюза Apple посвятила целую отдельную страницу, а про ограничения в Китае написала буквально в самом конце лендинга, мелкой сноской. Потому что не нужно путать, это другое.

P. S. Ещё обещают доделать и дочинить родительский контроль на айфонах. Как родитель подростка: не верю, но все равно надеюсь!

SpaceX станет сегодня одной из самых дорогих компаний на планете, а у нас как раз вышел эпизод о том, зачем нам космос.

Зачем отправлять в космос так много ракет? Какие планы строят самые крупные игроки космической индустрии? И почему это все касается нас, простых людей на земле?

Поговорили с Георгием Тришкиным, аналитиком ракетных пусков и автором телеграм-канала Техасский вестник, чтобы разобраться, для чего нам космос и какого развития индустрии мы ожидаем в ближайшие годы.