#чипы

5 постов
пост №2085

Очень интересно про ИИ-чипы и стоимость инференса.

Вопрос не теоретический: мы планируем продолжать работу с клиентом, для которого проводили аудит огромной старой кодовой базы, и если в прошлый раз вся работа с нейросетями влезла в 200-долларовую подписку, то теперь, когда github copilot просит денег за каждый токен, такая же работа встанет в 2 тысячи долларов.

Ребята недавно провели эксперимент и выяснили, что личные подписки на клод в 20, 100 и 200 долларов дают сжечь токенов на 400, 2000 и 8000 долларов в месяц соответсвенно. Для тарифов OpenAI, коэффициент ещё выше — 700, 3500 и 14000 долларов в месяц (до 70x!).

Насколько сильно субсидированы эти подписки? Какая маржинальность у продажи токенов крупным потребителям? От этого зависит, сохраним ли мы текущий уровень доступа к ведущим моделям или мы с вами живем короткий «золотой век ИИ». Учитывая, что и Anthropic и OpenAI готовятся к выходу на биржу, верить никому нельзя :(

Тут конечно все вспоминают бум строительства железных дорог, или пузырь доткомов. Большинство компаний, которые строили железные дороги или прокладывали оптоволоконные кабели обанкротились, но рельсами и оптоволокном мы пользуемся до сих пор. Поживем — увидим.

⁕ ⁕

На пятки этим SOTA моделям наступают китайские open-source и open-weight аналоги GLM-5.2, Minimax M3, Kimi K2.6. Последние месяцы они неустанно приближаются по качеству к ведущим производителям, но зазор всё ещё есть. Доступ к ним по API можно купить в разы дешевле, потому что они меньше, более оптимизированы и конкуренция между провайдерами выше.

Интересный аспект: китайским пользователям, так же и как и россиянам, официальный доступ к клоду и chatgpt закрыт, так что есть десятки спекулянтов, которые регистрируют сотни и тысячи аккаунтов, покупают на них подписки и перепродают доступ к ведущим американским моделям.

Ходят слухи, что эти «арбитражники ИИ-подписок» в Китае зарабатывают в два конца. Сохраняют всю переписку пользователей с нейросетями (ведь все запросы проходят через них) и продают эти логи создателям китайских моделей. А те потом используют эти логи для дообучения своих моделей.

Вообще, если ты можешь задавать вопросы мощной модели, обучение которой стоило десятки миллионов долларов, можно за небольшую долю этих денег произвести так называемую «дистилляцию», и обучить маленькую модель быть почти такой же умной, как и большая. Именно в этом сегодня Anthropic обвинил китайского гиганта Алибабу.

⁕ ⁕ ⁕

Третья часть этого поста — про будущее.

Вчера OpenAI представила первый кастомный чип, который, якобы, на 50% оптимальнее для инференса, чем чипы от NVIDIA. Печатает их TSMC, проектирует Broadcom, стандартный комплект.

Энтузиаст недавно прошил microGPT прямо на FPGA. Это такие процессоры, логику работы которых можно поменять за несколько секунд-минут (перепрошить). У них относительная низкая тактовая частота (сотни и даже десятки мегагерц против гигарец современнных процессоров), зато если получится уложить весь алгоритм в «железную логику», то чип начинает выдавать готовый ответ на каждый такт, то есть миллионы раз в секунду. FPGA используют для обработки видео, сигналов, на ракетах и в радарах — в приложениях, где важна скорость и надежность. Есть много экспериментов, когда в них укладывали небольшие модели.

Компания TAALAS пошла дальше всех и разработала чип, который реализует Llama 3.1 8B прямо в кремние. Это приличная open source модель 2 летней давности, пусть и с небольшим контекстом (6 тысяч токенов против привычных сотен тысяч сегодня). Самая крутая ИИ-карта Nvidia B200 дает 353 токена в секунду на пользователя в этой модели, а аппаратная реализация TAALAS — 16 тысяч токенов в секунду. Попробовать самому можно на сайте chat jimmy. А теперь представьте, что это нормальная взрослая модель и используется для разработки софта. Дух захватывает.

P. S. Параллельно развиваются специализированные локальные модели, которые работают на компьютерах и телефонах пользователей (тут впереди всех Apple) и есть отдельное движение за децентрализованный инференс (как у криптовалют), у его апологетов я недавно брал интервью, но это уже совсем отдельная история.

пост №2067

Я люблю садиться в самолет по приставной лесенке, а не «по трубе». Потому что тогда я могу заглянуть прямо в турбину двигателя, рассмотреть лопасти.

Современный реактивный двигатель — настоящее произведение искусства, рукотворное чудо нашей цивилизации. Это как пройти мимо Мона-Лизы.

А потом сижу в кресле и чувствую, как эта махина толкает нас вперед с такой силой, что мы взлетаем.

Так вот, современные чипы внутри наших телефонов и компьютеров — похожее чудо. А уж то, что мы, человечество, умеем производить их за такую цену, что их может себе позволить почти каждый — это вообще уму непостижимо.

Разбираемся, как это устроено с идеальной гостьей — Дианой Гришиной! Диана — ученая, которая много лет работала в ASML — единственной в мире компании, которая делает станки для производства самых современных чипов.

Один из зрителей оставил вот такой комментарий: «В Вашем подкасте мне больше всего нравятся гости. Многое из того, что они рассказывают, я и так знаю. Но смотреть и слушать этих людей с горящими глазами, которые взахлеб рассказывают о том, что им интересно - это огромное удовольствие.»

Ради такого и работаем! Новый эпизод на всех платформах и на ютубе: https://youtu.be/yNAeKVG7rIQ

пост №1957

OpenAI, Anthropic, xAI, Google, Microsoft — все занимаются нейросетями. Но все они зависят от чипов одной компании — NVIDIA.

Как она появилась, благодаря чему стала флагманом и почему никто не может ее догнать? Разбираемся вместе с бывшим ведущим архитектором AI-решений в NVIDIA Денисом Тимониным.

Слушайте и подписывайтесь! Apple, Youtube, Яндекс, Spotify, Castbox, Overcast, веб-версия.

Этим эпизодом мы закрываем 13й сезон подкаста запуск завтра. Мы подготовили небольшой опрос: что понравилось, что не понравилось, чего хочется. Уделите 5 минут, пожалуйста!

Вообще, на днях подкасту исполнилось 6 лет. Даже не верится! Спасибо, что слушаете!

Мы сейчас уйдем на небольшие каникулы, а после нового года вернемся с новым, необычным сезоном!

пост №1805

Apple представила новую начальную модель айфона — 16e. Достойный телефон за 600 долларов.

Но главная новость этого анонса — то, что это первый телефон Apple с их собственным 5G чипом, назвали C1.

До этого все современные айфоны использовали чипы связи от лидера этой индустрии — Qualcomm.

Разработать качественный чип связи 5G — это по сложности примерно как сделать свой процессор или запустить ракету в космос; компании, которые умеют это делать, можно пересчитать по пальцам рук. Для входа на рынок, эпл еще в 2019 году купила бизнес Intel по производств чипов связи (как они это провернули — отдельная история). Пока что, C1 не не поддерживает самые высокоскоростные протоколы связи (mmWave). Посмотрим, когда у Apple получится разработать собственные чипы для флагманских моделей айфонов.

Все это — очередной логический шаг в вертикализации бизнеса, скоро Apple будет производить все ключевые компоненты своих устройств. Гениальный операционный директор Тим Кук продолжает оптимизировать бизнес. Это не только увеличивает и так не хилую маржу (чипы от Qualcomm были одним из дорогих компонентом айфонов), но и позволяет запихнуть еще одну компоненту на единый с процессором чип — так называемый SoC, System on a Chip. Такая интеграция получается быстрее, меньше по размеру и весу и более энергоэффективной.

Интересно, что Qualcomm владеет ключевыми патентами в области связи и почти все производители телефонов платят им отчисления за каждый телефон, даже если они не используют их чипы, но это отдельная история.

У Samsung и Huawei, кстати, уже есть собственные высокоскоростные чипы связи в SoC, так что в этом плане Apple в догоняющей роли. Удивительно, что даже здесь замешана геополитика — после введения американцами санкции против Huawei, они подписали c Samsung новое соглашение о сотрудничестве 🤯

пост №508

«Производство современных компьютерных чипов: неотличимо от магии»

Исключительно хороший доклад и отличное видео на выходные.

Я посмотрел ещё меньше половины и вот что мне запомнилось:

- заводы по производству процессоров гигантские - площадью в несколько футбольных полей;
- в них есть «чистые комнаты», в которых пыли в 10000 раз меньше, чем в операционной (и это не фигура речи);
- сначала они выращивают кремниевую трубку - цилиндр диаметром 30 см и длиной в несколько метров. Вся трубка - единый кристалл, то есть атомная решетка идёт ровно от одного конца до другого!
- дальше её нарезают на блинчики толщиной 200 микрометров (толщина волоса - около 80мкм). Эти блинчики - основа, на которой «рисуют» детальки;
- я пишу рисуют, но размер элементов картины - десятки нанометров (на срезе волоса помещаются тысячи);
- фотолитография (то самое прижигание/выжигание) - это снос башки: сначала делают относительно крупную «маску», через которую светят ультрафиолетом и пропускают картинку через линзу, которая делает луч меньше - таким образом рисунок получается меньше маски (и даже меньше длины волны);
- эти линзы меняют раз в несколько лет из-за износа от бомбардировки фотонами! Представьте, если бы у вас объектив на фотике истерся от света;
- размер картинки такой маленький, что нужно учитывать интерференцию лучей, то есть маска и тень от неё не совпадают. Это значит, что подсчёт маски, дающей необходимую тень - отдельная математическая задача;
- там такие точности, что заметна осцилляция фотонов (!), и используются способы ее компенсации.

Это одно из самых увлекательных выступлений, с максимальной концентрацией лулзов. Приятного просмотра.

https://youtube.com/watch?v=NGFhc8R_uO4