openai

О, война платежных стандартов в ИИ!

3 месяца назад OpenAI совместно со Stripe (крупнейший карточный процессинг с фокусом на разработчиков) разработали свой протокол для покупок внутри ChatGPT — Agentic Commerce Protocol (ACP).

И вот вчера Google совместно с Shopify (крупнейшая платформа для создания интернет-магазинов) представили Universal Commerce Protocol (UCP).

Совсем упрощая, это чтобы можно было покупать товары прямо на странице результатов поиска, не переходя на страницу интернет-магазина. Протокол гораздо более открытый, чем ACP.

Хотелось бы поставить эмоджи 🍿, но мне кажется и так понятно, кто выиграет. Это как со государством соревноваться.

OpenAI запускают вкладку «Здоровье» в СhatGPT.

Можно будет загрузить свою медицинскую информацию (анализы, диагнозы и прочие) вручную или подключиться к данным множества клиник через интеграцию с b.well, есть интеграция с Apple Health для импорта показателей с датчиков.

Ну и дальше можно советоваться про здоровье: симптомы, что обсудить с врачем и прочее.

Один из демо-юзкейсов — подбор медицинской страховки в США. Это вообще отдельный бизнес, если что.

Веяние времени: есть специальный раздел с рецептами для тех, кто сидит на GLP-1.

Пока доступно только по приглашениям и только для пользователей вне Евросоюза и Великобритании. Записываться в лист ожидания тут.

Это очень похоже на проект, который делаем мы с Федей и ребятами. Это хорошие новости: openAI тоже думает, что такой сервис нужен.

Федя сейчас экспериментирует с несколькими идеями про b2c (да, с помощью claude code), а я договариваюсь с клиниками и аптеками — нам не сложно интегрироваться с существующими МИС и CRM-ками клиник, чтобы разгрузить колл-центры и давать персонализированные ответы на основе медицинской истории конкретного клиента.

Если вы работаете в сфере здравоохранения или у вас есть знакомые, которым такое интересно — пишите мне в личку @samatg.

Доброе утро! Ну что, финдиректор OpenAI уже публично рассуждает, что правительству США стоит выступить гарантом их инвестиций в железо. Глава NVIDIA поддерживает: «это вопрос национальной безопасности, Китай обгоняет».

OpenAI как НКО, созданное для блага всего человечества
⬇️
Самая прибыльная компания на Земле
⬇️
Дайте денег, это вопрос национальной безопасности

(Вы находитесь здесь)

На днях Альтман отшутился от вопроса инвестора «где вы найдете обещанные 1,3 триллиона (!) долларов на железо?».

Вот и ответ подъехал.

Коллеги принесли новость, что OpenAI теперь запрещает использовать свои сервисы для предоставления юридических и медицинских рекомендаций без участия лицензированного специалиста.

Запрет запретом, но советы он продолжает давать как и раньше; просто добавляет теперь, что он не юрист и не врач. Это видно даже на примерах в Model spec — официальном списке правил для модели. Кажется, пункт в правилах — просто отписка для защиты в суде.

Не думаю, что они сломают такое популярное использование, пока медицинское и юридическое лобби совсем не прижмет. Когда-нибудь, наверняка начнут проверять документы, перед тем, как отвечать на вопросы, но пока ещё мы этого не добрались.

OpenAI, кстати, недавно опубликовали новость о том, как они борются с ИИ-индуцированными психозами, попытками суицида и излишним общением с нейросетями. Там и совет сделать перерыв в общении и «поговорить с живым человеком» и даже отказ нейросети соглашаться с тем, что над домом летают корабли, которые помещают в голову мысли. Молодцы!

OpenAI выкатил браузер, назвали Atlas. Новая вкладка — всегда chatGPT и на любой странице можно вызвать чат в правой части экрана. Идея в том, что ИИ может выполнять часть действий за нас в интернете.

Это не новая идея: несколько месяцев назад появился Comet от Perplexity, Claude для хрома от Anthropic и Google постепенно выкатывает AI-фичи в хром.

Тем не менее, OpenAI — компания на слуху, так что теперь с браузерами со встроенным ИИ, наверное, познакомятся больше людей.

Несколько мыслей, которые приходят в голову:

1. Про безопасность, конечно. Anthropic наглядно показал, как с помощью базового prompt injection можно заставить браузер сделать что угодно. Проще говоря, ИИ плохо различает, где вы ему дали команду, а где эта команда написана на сайте. Примерно как когда «умные» колонки от амазона сделали заказ услышав фразу «алекса, закажи кошачий корм» в рекламе по телевизору.

2. Вся эта движуха с новыми продуктами не очень вяжется с обещаниями AGI (сверхчеловеческого интеллекта) в ближайшее время. Если бы ИИ-компании сами верили в свои обещания — то не было бы смысла расфокусироваться с новыми продуктами. Делаешь сверхинтеллект и всё, ты в дамках.

3. Из хорошего: скорее всего, это попытка «выкопать ров» («moat building»), то есть сделать что-то, что конкуренты (быстро) повторить не смогут. Это хорошо, потому что это признак того, что сами модели скорее всего таким «рвом» не являются. Компании понимают, что любые модели быстро повторят конкуренты (или они даже появятся в опен-сорсе) и пытаются создать другие, неконкурентные преимущества.

4. OpenAI дает 7 дней увеличенных лимитов для тех, кто поставит Atlas браузером по умолчанию. Я достаточно старый, чтобы помнить дни, когда Google платил программистам за то, что они включали браузер хром в инсталляторы своих программ. Да, хром не всегда был самым популярным браузером на планете и вообще, в истории компьютерной индустрии было две войны браузеров. Первая: 1995-2001 годов, когда Microsoft убил платный Netscape Navigator, включив достаточно хороший Internet Explorer внутрь Windows. Вторая: 2007-2017 годов, когда Google уничтожил Internet Explorer и почти всех остальных с помощью быстрого технологического развития и очень агрессивного маркетинга Google Chrome. Интересно, начало ли это новой браузерной войны?

5. Вообще, логическим развитием истории про ИИ, который делает что-то за нас в интернете, будет трансформация веб-сайтов под ИИ. Какой смысл делать дизайн сайта для людей, если никто кроме ИИ его не увидит? Видимо, можно ждать развития идей семантического веба. И окончательную смерть классической баннерной рекламной модели. Вот это по-настоящему интересно.

OpenAI представил новую модель по генерации видео Sora 2. Она сильно лучше, чем Sora 1, научилась аудио, сравнима с ведущими моделями от bytedance и гугла.

Интереснее, что вместе с моделью они запустили приложение Sora (только iOS, только в США), что-то типа тиктока для подростков, но все видео из нейросети; идея в том, что можно представлять себя и друзей в разных ситуациях.

Занимательно, что Альтман запостил в своем личном блоге про кембрийский взрыв творчества и трепет (trepidation). Подозреваю, что промпт был «напиши текст, чтобы умный, будем жарить мозги подросткам через видео».

Прикладываю видео-анонс сего события.

У меня в голове засели два видео.

Первое — анонс того, что Джони Айв будет делать железо в OpenAI.

Айв — ключевой партнёр Стива Джобса в создании айфонов, макбуков и других культовых продуктов Apple. Он ушел из Apple шесть лет назад и основал свою компанию, у которой супер милый сайт и ни единого публичного продукта. Сумма сделки — 6.5 млрд долларов.

Айв начинает работу над физическим продуктом OpenAI, который они представят в следующем году. Судя по анонсу — это будет устройство, которое постоянно слушает наши разговоры и может отвечать на вопросы учитывая контекст беседы.

Этот анонс — 9 минутный художественный фильм, в котором Сэм (Альтман) и Джони (Айв) играют, будто они идут по шумным улицам Сан-Франциско, встречаются в кофейне (привет Сэм! привет Джони!), бариста делает им по чашке кофе (крупный план, ASMR видео) и ... вдруг они начинают говорить друг о друге в третьем лице, то есть как со сцены, но при этом якобы сидят за барной стойкой, называют друг-друга самыми большими гениями, которых видел свет, утверждают, что мы стоим на пороге самого крупного технологического изменения (видимо, речь об ИИ) и что Сан-Франциско — центр технологий и культуры (?!) и т. д.

То, что они говорят всё это без всякой иронии — вызывает недоумение и даже тревогу. Не до смеха, хотя комментарии на ютубе уже настоялись.

Кроме видео, есть ещё официальная новость на сайте OpenAI, оформленная как приглашение на свадьбу. Счастья молодым.

Второе видео — презентация нового пылесоса Дайсон. Тоже 9 минут, но каких! Владелец компании выходит на сцену перед аудиторией из журналистов и показывает такой пылесос, которого никто раньше не видел — двигатель, мусоросборник, всё уместилось внутри ручки диаметром 38 мм! Работает он за счет микро-двигателя, крутящегося со скоростью 140 тысяч оборотов в минуту. А ещё насадки, в которых наконец-то не застревают волосы! И подсветка мусора на полу сразу во все стороны!

Прямо как с Джобсом в лучшие времена — сразу хочется купить, пускай и понимаешь, что дешево не будет.

В чем разница между этими двумя видео? Почему при просмотре первого я чувствую обман, а при просмотре второго — вдохновение?

Интересно, я ли один так чувствую?

Мне кажется, дело в натуральности, в объеме продакшена. Первый ролик отполированный, за этим продакшеном не видно реальных Сэма и Джони. Во втором ролике Дайсон на секунду мешкается, часть текста явно читает прямо с презентации, не идеально, зато он там живой. С ошибками и недостатками, но безусловно живой человек.

Не знаю, зачем так поступили Альтман и Айв, но лично мне страшно показать своё несовершенство. Даже в этом канале я стал пытаться «отполировать» все свои тексты. Не дай бог показать, что у меня не все идеально в бизнесе или подкасте или вообще в жизни (и голове). Кажется, что в процессе я чуть не выплеснул и ребенка. Канал был моим способом делиться своей жизнью и мыслями и раньше я был смелее.

Так выпьем за смелость быть настоящим!

Гораздо интереснее то, что OpenAI представила новую модель chatGPT, OpenAI o1 — она дольше думает (до минуты), зато без подсказок строит длинные и полные рассуждения.

В пресс-релизе система решает математические задачи уровня международной олимпиады и пишет сложный код (специально для программистов есть более быстрая версия o1-mini), а для меня составила неплохую выжимку из стенограммы встречи. Рекомендую.

Интересно, как подробно они рассказывают о тестировании безопасности — новую модель сложнее уговорить стать соучастником преступления.

День ИИ-анонсов.

OpenAI представили модель для генерации видео (максимальная длина — минута). Жутко от реалистичности, конечно, как всегда.

Прикольно, что модель не просто генерирует картинки, но и «понимает, как устроен мир, как взаимодействуют объекты в нем».

Там куча примеров внутри, рекомендую покликать.

Попробовать самому пока нельзя — доступ дали только белым хакерам, которые пытаются сломать модель и использовать её для всякого плохого, чтобы эти дырки залатали. Ну и доверенным художникам, чтобы те рекламировали её применения бесплатно. А ещё можно попросить уволенного и восcтановленного в должности директора OpenAI в твиттере, что хочешь получить и он иногда отвечает видосом.

А гугл день-в-день наконец-то представил нормального конкурента ChatGPT — Gemini 1.5; во всяком случае, так говорят программисты, которые уже успели им попользоваться. У модели гораздо больше память, чем у всех других публичных ИИ. Она может съесть аж до 700 тысяч слов (11 часов аудио) и выполнять задания оперируя всей этой информацией. Доступ тоже хитро ограничен, разработчикам оставить заявку можно тут.

С Новым годом и с Рождеством, дорогие друзья!

Я сделал телеграм-бота, который распознает голосовые сообщения. То есть кидаешь в него голосовуху, а он отвечает текстом.

Бот сам расставляет заглавные буквы, знаки препинания и знает большинство имен и терминов — больше никакого «бендера» вместо «бэкендера». А ещё он супер-быстрый.

Удобно диктовать длинные тексты, записывать мысли. Приятно не морозить пальцы на улице — часто сообщение можно переслать «как есть», без всякой редактуры.

Под капотом Whisper API от OpenAI. Это одна из лучших моделей для перевода в речи в текст, запущенная на топовом железе её создателями.

Пока что есть ограничение на максимальную длину голосового: около 40-80 минут в зависимости от того, как именно оно записано. Ещё ему можно отправлять голосовые заметки из встроенного приложения айфона — это может пригодиться журналистам.

Бот бесплатный, ничего не запоминает и не хранит — аудио даже не скачивается на диск, всё в оперативной памяти. OpenAI утверждает, что хранит аудио, полученное по API в течении 30 дней для комплаенса, а потом удаляет его и не использует для обучения своих моделей.

Исходный код доступен на гитхабе. Если вы программист — буду рад исправлениям ошибок и помощи в развитии.

Пользуйтесь на здоровье! @goodsecretarybot

Upd: бот может отвечать крайне задумчиво, извините пожалуйста! Мы превысили все мыслимые лимиты по API OpenAI, обсуждаю с ними повышение.

Upd2: вновь стал шустрым.