61
пост №2070

Ну что, великий и страшный mythos (миф) от антропика наконец опубликовали, в обрезанном виде, назвали fable (басня).

Доступен по подписке, токены ест как не в себя, но результаты хорошие. Берет полноценные задачи и доводит их до конца самостоятельно за условные 9 часов автономной работы. Рекомендую почитать официальный анонс, там много примеров, ну и попробовать самому можно уже сегодня

Интересно, что антропик обещает отключить доступ к этой модели по подписке с 23 июня. То есть у нас есть 2 недели, чтобы попробовать, какая она классная, а дальше уже принимать решение, готовы ли мы платить тысячи долларов за токены.

Вообще, это интересный аспект всей этой нейросетевой безумии: частные лица покупают подписку за 20/200 долларов в месяц и пользуются условно сколько хотят, а корпоративные тарифные планы учитывают каждый токен по-отдельности по АПИ-тарифам. В сочетании с токен-максингом, когда компании мотивировали программистов жечь побольше токенов в том числе лидербордами (кто сжег побольше), суммы получаются совершенно астрономические, экономически неподъемные даже для крупнейших игроков. Яркий пример — Uber: за четыре месяца сжег ИИ-бюджет на год и теперь ввел лимит в 2000 долларов на токены на разработчика в месяц.

Интересно, не уж то эпоха субсидированных токенов и совсем безлимитного ИИ-программирования заканчивается и для частных лиц?

Оно и понятно, индустрия пытается переключиться из режима «дай ИИ конкретную маленькую подзадачу и сиди смотри, как она ее решает, работая вместе с ней», в режим «модели решают вот эту большую задачу самостоятельно, работая в автоматизированном цикле 24/7, работа инженера — тюнить цикл», и тут нужны хоть какие-то ограничения на то, сколько таких циклов ты запустил одновременно и мотивация на их оптимизацию. Иначе это как бесплатное электричество.

На картинках — два главных графика, какую долю задач модели доводят до конца успешно и сколько токенов при этом тратят.

62
пост №2000

ААА, клод выпустил классную серию рекламных роликов про рекламу, которую недавно анонсировали в чатжпт.

Супербоул, самая дорогая телереклама на планете

Сэм Альтман разразился тирадой на 400 слов. Как говорят на русском, «бомбануло».

На английском есть мем (вторая картинка):

63
пост №2044

Почему нам хочется увидеть в искусственном интеллекте собеседника? Как нейросети контролируют ход диалога? И что из-за них меняется в человеческом общении?

Культуролог и исследовательница цифровой среды Оксана Мороз объясняет, как общение с искусственным интеллектом влияет на нас.

Новый эпизод — на всех платформах

https://youtu.be/0EKj8_ecBTQ

64
пост №2072

Ещё одно ограничение (стр 13), которое мы видим среди нейросетей впервые:

При попытках использовать Fable 5 для обучения других моделей, она не будет отказываться, но будет мешать это делать, скрытно от пользователя.

Ощущение, что мы с вами жили в «раннюю эпоху LLM», которая заканчивается.

65
66
пост №2085

Очень интересно про ИИ-чипы и стоимость инференса.

Вопрос не теоретический: мы планируем продолжать работу с клиентом, для которого проводили аудит огромной старой кодовой базы, и если в прошлый раз вся работа с нейросетями влезла в 200-долларовую подписку, то теперь, когда github copilot просит денег за каждый токен, такая же работа встанет в 2 тысячи долларов.

Ребята недавно провели эксперимент и выяснили, что личные подписки на клод в 20, 100 и 200 долларов дают сжечь токенов на 400, 2000 и 8000 долларов в месяц соответсвенно. Для тарифов OpenAI, коэффициент ещё выше — 700, 3500 и 14000 долларов в месяц (до 70x!).

Насколько сильно субсидированы эти подписки? Какая маржинальность у продажи токенов крупным потребителям? От этого зависит, сохраним ли мы текущий уровень доступа к ведущим моделям или мы с вами живем короткий «золотой век ИИ». Учитывая, что и Anthropic и OpenAI готовятся к выходу на биржу, верить никому нельзя :(

Тут конечно все вспоминают бум строительства железных дорог, или пузырь доткомов. Большинство компаний, которые строили железные дороги или прокладывали оптоволоконные кабели обанкротились, но рельсами и оптоволокном мы пользуемся до сих пор. Поживем — увидим.

⁕ ⁕

На пятки этим SOTA моделям наступают китайские open-source и open-weight аналоги GLM-5.2, Minimax M3, Kimi K2.6. Последние месяцы они неустанно приближаются по качеству к ведущим производителям, но зазор всё ещё есть. Доступ к ним по API можно купить в разы дешевле, потому что они меньше, более оптимизированы и конкуренция между провайдерами выше.

Интересный аспект: китайским пользователям, так же и как и россиянам, официальный доступ к клоду и chatgpt закрыт, так что есть десятки спекулянтов, которые регистрируют сотни и тысячи аккаунтов, покупают на них подписки и перепродают доступ к ведущим американским моделям.

Ходят слухи, что эти «арбитражники ИИ-подписок» в Китае зарабатывают в два конца. Сохраняют всю переписку пользователей с нейросетями (ведь все запросы проходят через них) и продают эти логи создателям китайских моделей. А те потом используют эти логи для дообучения своих моделей.

Вообще, если ты можешь задавать вопросы мощной модели, обучение которой стоило десятки миллионов долларов, можно за небольшую долю этих денег произвести так называемую «дистилляцию», и обучить маленькую модель быть почти такой же умной, как и большая. Именно в этом сегодня Anthropic обвинил китайского гиганта Алибабу.

⁕ ⁕ ⁕

Третья часть этого поста — про будущее.

Вчера OpenAI представила первый кастомный чип, который, якобы, на 50% оптимальнее для инференса, чем чипы от NVIDIA. Печатает их TSMC, проектирует Broadcom, стандартный комплект.

Энтузиаст недавно прошил microGPT прямо на FPGA. Это такие процессоры, логику работы которых можно поменять за несколько секунд-минут (перепрошить). У них относительная низкая тактовая частота (сотни и даже десятки мегагерц против гигарец современнных процессоров), зато если получится уложить весь алгоритм в «железную логику», то чип начинает выдавать готовый ответ на каждый такт, то есть миллионы раз в секунду. FPGA используют для обработки видео, сигналов, на ракетах и в радарах — в приложениях, где важна скорость и надежность. Есть много экспериментов, когда в них укладывали небольшие модели.

Компания TAALAS пошла дальше всех и разработала чип, который реализует Llama 3.1 8B прямо в кремние. Это приличная open source модель 2 летней давности, пусть и с небольшим контекстом (6 тысяч токенов против привычных сотен тысяч сегодня). Самая крутая ИИ-карта Nvidia B200 дает 353 токена в секунду на пользователя в этой модели, а аппаратная реализация TAALAS — 16 тысяч токенов в секунду. Попробовать самому можно на сайте chat jimmy. А теперь представьте, что это нормальная взрослая модель и используется для разработки софта. Дух захватывает.

P. S. Параллельно развиваются специализированные локальные модели, которые работают на компьютерах и телефонах пользователей (тут впереди всех Apple) и есть отдельное движение за децентрализованный инференс (как у криптовалют), у его апологетов я недавно брал интервью, но это уже совсем отдельная история.

67
пост №2083

Помните клиента, который делает стартап в одно лицо и уже напрограммировал два миллиона строк кода?

Наш архитектор Леша придумал, как выделить из его монолита отдельный голосовой сервис и написал ADR , а этот парень за день все реализовал :) завтра будем разбираться, не выплеснул ли он по пути ребенка.

С таким я ещё не сталкивался — мы ставим клиенту задачи, а он их программирует!

68
пост №2095

Сотрудник OpenAI, бывший сотрудник Белого Дома, публично в твиттере: «(новая китайская модель) Kimi K3 — очень крутая, и хорошо бы, чтобы администрация президента США напугала (буквально FUD) госорганы и крупные компании, чтобы они не запускали open source модели самостоятельно. Но не слишком напугало, чтобы гиперскейлеры (OpenAI, Anthropic и ко) могли зарабатывать на хостинге open source моделей. There is a sweet spot (sic)» конец цитаты 🤮

Не перестаю убеждаться, что все всё говорят (и пишут), нужно только слушать.

Глава OpenAI, публично в твиттере, через пару дней: вы не поверите, какой кибервзлом совершила наша последняя модель!

Взлом при этом на самом деле классный, автономные агенты в OpenAI взломали HuggingFace — главную ИИ-платформу для хранения моделей.

Но вишенка не в том, что современные модели могут взломать что угодно, а в том, что защищающиеся в HuggingFace не смогли использовать ведущие американские модели для защиты — они не могут отличить защиту от нападения и отказываются вести такую работу. Так что для этой задачи, эта американская компания использовала китайскую модель GLM-5.2, запущенную локально. 🤡

Тем временем, китайская опенсорс модель Kimi K3, которая так напугала OpenAI, обогнала Fable в соревновании на фронтенд-задачи, и стоит в разы дешевле. Все эти соревнования — туфта, но всё равно показательно. Разрыв между публично доступными американскими SOTA (state of the art, лучшими из лучших) моделями и китайскими моделями все уменьшается. Как бы китайцы так весь американский ИИ-пузырь не взорвали. А что делают корпорации, когда не могут победить инновациями? Конечно — лоббируют, и мы возвращаемся к началу поста.

Интересно, в каком направлении движется Thinking Machines Lab Миры Мурати (помните, она ушла из OpenAI?): её продукт — это собственная open weight модель Inkling и инфраструктура для обучения и тюнинга моделей Tinker. Все серьезные пользователи нейросетей тюнят свои модели (даже мы уже делаем это для клиентов), крутая ниша.

Если бы мне нужно было делать ставку — я бы ставил на локальные модели. Но слава богу, мне ставки делать не нужно, мы пока пользуемся американскими SOTA моделями по личными подпискам и ждем, когда же появится достаточно производительное и недорогое железо, а локальные модели и open-source харнес ещё немного подрастут. 🍿

Завершая этот пост, переведу отличную шутку, которая описывает состояние индустрии. Контекст: у moonshot, компании-создателя Kimi, не хватает мощностей, чтобы удовлетворить ажиотажный спрос на их модель Kimi K3. Они объявляют, что приостанавливают регистрацию новых пользователей, чтобы хватило текущим.

Шутка: «абсолютно непрофессионально. если кими хочет стать ведущей лабораторией, она должна вести себя соответствующе — например, начать отвечать на запросы пользователей более слабыми моделями, ну или хотя бы опубликовать пост про крах цивилизации».

69
пост №1997

Помните MCP? json/http протокол, оптимизированный для нейросетей.

Теперь модно делать skills — «навыки». Это папка с документацией, данными и скриптами в определенном формате, чтобы нейросетям было удобнее ими пользоваться.

Вообще, похоже на просто хорошую документацию. Проще = лучше.

Думаю, что с развитием нейросетей, все эти костыли со стандартами потеряют свою актуальность. Тем не менее, прямо сейчас они упрощают жизнь моделям. Примеры тут.

70
пост №1998

Ядро чатжпт работает на одном Postgres-сервере с 50 read-only репликами. Это к вопросу о масштабируемости и потребности в сложной инфраструктуре.

PostgreSQL — одна из фундаментальных программ, на которых держится половина интернета и компьютерных систем в целом. Это бесплатная база данных, которой пользуются все — от маленьких интернет-магазинов до банков и крупнейшие сервисы на планете. Именно она гарантирует, что наши данные не потеряются и будут доступны в любой момент.

Этот проект сильно повлиял на мою жизнь. Именно по его прекрасной документации я учился базам данных. Это одновременно один из лучших учебников по теме для студентов и в то же время справочный материал для профессионалов.

У postgres открытая, по-настоящему распределенная разработка, в которой участвуют сотни инженеров со всего мира.

Многие ИТ-проекты держатся на власти диктатора (Линукс на Линусе), а Postgres вот уже 30 лет управляется меритократией в консенсусной модели.

Свободная BSD-подобная лицензия, которая (в отличие от религиозной GPL) позволяет открыто делать коммерческие продукты на его основе.

Отличная обратная совместимость и близкое соответствие стандартам, и при этом они умудряются первыми реализовывать фичи, которые только позже появляются в платных БД.

PostgreSQL как программа — это настоящее произведение инженерного искусства, а проект в целом — чудо в плане самоорганизации людей. Горжусь, что у нас как у человечества получилось сделать такую красивую штуку.

Я рад, что Postgres постепенно становится самой популярной базой для начинающих, заменяя MySQL.

Проекты, которые мы делаем с Федей и командой, сильно отличаются от постгреса всем — и размером, и стеком, и задачами. Но это тот уровень инженерного мастерства, которым вдохновляюсь я и на который, я надеюсь, равняется вся моя команда.