openai

С Новым годом и с Рождеством, дорогие друзья!

Я сделал телеграм-бота, который распознает голосовые сообщения. То есть кидаешь в него голосовуху, а он отвечает текстом.

Бот сам расставляет заглавные буквы, знаки препинания и знает большинство имен и терминов — больше никакого «бендера» вместо «бэкендера». А ещё он супер-быстрый.

Удобно диктовать длинные тексты, записывать мысли. Приятно не морозить пальцы на улице — часто сообщение можно переслать «как есть», без всякой редактуры.

Под капотом Whisper API от OpenAI. Это одна из лучших моделей для перевода в речи в текст, запущенная на топовом железе её создателями.

Пока что есть ограничение на максимальную длину голосового: около 40-80 минут в зависимости от того, как именно оно записано. Ещё ему можно отправлять голосовые заметки из встроенного приложения айфона — это может пригодиться журналистам.

Бот бесплатный, ничего не запоминает и не хранит — аудио даже не скачивается на диск, всё в оперативной памяти. OpenAI утверждает, что хранит аудио, полученное по API в течении 30 дней для комплаенса, а потом удаляет его и не использует для обучения своих моделей.

Исходный код доступен на гитхабе. Если вы программист — буду рад исправлениям ошибок и помощи в развитии.

Пользуйтесь на здоровье! @goodsecretarybot

Upd: бот может отвечать крайне задумчиво, извините пожалуйста! Мы превысили все мыслимые лимиты по API OpenAI, обсуждаю с ними повышение.

Upd2: вновь стал шустрым.

OpenAI выкатил браузер, назвали Atlas. Новая вкладка — всегда chatGPT и на любой странице можно вызвать чат в правой части экрана. Идея в том, что ИИ может выполнять часть действий за нас в интернете.

Это не новая идея: несколько месяцев назад появился Comet от Perplexity, Claude для хрома от Anthropic и Google постепенно выкатывает AI-фичи в хром.

Тем не менее, OpenAI — компания на слуху, так что теперь с браузерами со встроенным ИИ, наверное, познакомятся больше людей.

Несколько мыслей, которые приходят в голову:

1. Про безопасность, конечно. Anthropic наглядно показал, как с помощью базового prompt injection можно заставить браузер сделать что угодно. Проще говоря, ИИ плохо различает, где вы ему дали команду, а где эта команда написана на сайте. Примерно как когда «умные» колонки от амазона сделали заказ услышав фразу «алекса, закажи кошачий корм» в рекламе по телевизору.

2. Вся эта движуха с новыми продуктами не очень вяжется с обещаниями AGI (сверхчеловеческого интеллекта) в ближайшее время. Если бы ИИ-компании сами верили в свои обещания — то не было бы смысла расфокусироваться с новыми продуктами. Делаешь сверхинтеллект и всё, ты в дамках.

3. Из хорошего: скорее всего, это попытка «выкопать ров» («moat building»), то есть сделать что-то, что конкуренты (быстро) повторить не смогут. Это хорошо, потому что это признак того, что сами модели скорее всего таким «рвом» не являются. Компании понимают, что любые модели быстро повторят конкуренты (или они даже появятся в опен-сорсе) и пытаются создать другие, неконкурентные преимущества.

4. OpenAI дает 7 дней увеличенных лимитов для тех, кто поставит Atlas браузером по умолчанию. Я достаточно старый, чтобы помнить дни, когда Google платил программистам за то, что они включали браузер хром в инсталляторы своих программ. Да, хром не всегда был самым популярным браузером на планете и вообще, в истории компьютерной индустрии было две войны браузеров. Первая: 1995-2001 годов, когда Microsoft убил платный Netscape Navigator, включив достаточно хороший Internet Explorer внутрь Windows. Вторая: 2007-2017 годов, когда Google уничтожил Internet Explorer и почти всех остальных с помощью быстрого технологического развития и очень агрессивного маркетинга Google Chrome. Интересно, начало ли это новой браузерной войны?

5. Вообще, логическим развитием истории про ИИ, который делает что-то за нас в интернете, будет трансформация веб-сайтов под ИИ. Какой смысл делать дизайн сайта для людей, если никто кроме ИИ его не увидит? Видимо, можно ждать развития идей семантического веба. И окончательную смерть классической баннерной рекламной модели. Вот это по-настоящему интересно.

Open AI опубликовала крупнейшую нейросеть распознавания речи, обученную на 680 тысячах часов аудио, назвали Whisper — шепот.

Сеть понимает множество языков кроме английского, включая русский.

Качество распознавания сравнимо с сервисами от Google, Amazon, Microsoft и Yandex. При этом сервисы распознавания речи от корпораций стоят по 2 доллара за минуту распознавания, а тут можно скачать и пользоваться этой штукой бесплатно и без подключения к интернету.

Открыта и бесплатна для скачивания не только конечная сеть, но и «развесовка», то есть модель можно тюнить и использовать как составную часть более сложных алгоритмов. Не открыты только 680 тысяч часов аудио, которые использовали для обучения модели.

Пара примеров есть на странице проекта; распознать любые файлы и даже свою речь с микрофона можно попробовать онлайн в неофициальном google colab блокноте (очень классный инструмент!).

Кстати, если у вас айфон — рекомендую обновить iOS и попробовать встроенное распознавание речи. Новая версия iOS внесла одно маленькое изменение — теперь редактирование текста клавиатурой не прерывает процесс распознавания. Можно набрать текст голосом, исправить ошибку пальцами и продолжить набор голосом. Я теперь пишу большинство сообщений на айфоне именно так — гораздо быстрее и легче, чем печатать пальцами.

Интересно, что мы как раз начинаем исследовательский проект для Чайки — встроим распознавание речи в медицинскую информационную систему, чтобы врачи могли заполнять карточки пациентов голосом и тратили на это меньше времени.

Будущее уже совсем близко.

Безумно интересный отчет OpenAI Foundation. Они сделали бота, который играет в Доту.

Для тех, кто в танке, Дота — это самая популярная e-sports игра. Призовой фонд более 40 миллионов долларов, профессиональные команды тренирующиеся круглый код и так далее — всё как в обычном спорте. Если вы совсем в танке — вот кусочек геймплея. Герои, заклинания, оружение, большая карта, сложная игра, я не могу в такие играть. Для сравнения, шахматы — 40 ходов, го — 150, в доте — около 20 тысяч. В шахматах каждый ход можно сделать около 30 действий (способов сходить), в го — 250, в доте — больше тысячи. Количество данных (игровых объектов) различается на 4 порядка.

Год назад они выпустили бота, который выигрывает лучших игроков-людей в матчах один-на-один.

Теперь они сделали бота, который выигрывает команду людей-любителей (5 инженеров проекта) в командных матчах. Они пригласили на этот матч профессионального комментатора доты (!) Blitz, и ему понравилось, как играют роботы. 28 июля они устроят соревнование между роботом и лучшими командами людей. Первый e-sports матч, который я собираюсь посмотреть.

Самое классное, что робота НЕ учили люди. Всё, чему научился алгоритм, он научился играя сам с собой. Десятки тысяч часов игры в Доту и никакой личной жизни. Вспоминаются этические дилеммы симуляций из Black Mirror и Westworld.

P.S. Если вы смотрите Westworld, то аналогия с тем, как AI учится на простых мирах, перед тем, как выйти в мир реальный — бьет в лицо. Вот ведь хорошо попал сериал в момент.

В противовес — хорошая статья — про то, что не стоит ждать человекоподобного HAL 9000 в задачах анализа больших данных, мы скорее всего получим что-то типа стиральной машины (и они полезны).

Первая модель машинного обучения, распространение которой ограничивается в целях общественной безопасности. Иронично и, вместе с тем правильно, что её разработала некоммерческая исследовательская компания OpenAI, цель которой — «поиск безопасного пути к настоящему искусственному интеллекту», а один из создателей — Илон Маск. Этот фонд, в числе прочего, обучил машину очень хорошо играть в Доту.

На этот раз, речь о языковой модели, предсказывающей следующее слово в тексте. Система натренирована на 40GB текста из интернета, что примерно в 7500 больше, чем «Война и мир» (5.3MB).

Если подать ей на вход вопрос — она, скорее всего, допишет ответ. Если подать утверждение — то раскроет тему и предоставит доказательства.

Проблема в том, что она делает это слишком хорошо. Насколько хорошо, что при поверхностном прочтении может показаться, что сгенерированный текст имеет смысл. Не вдаваясь в философские дебри (в которых я не силен), возьмусь утверждать, что смысла там всё-таки нет.

Так в чем же опасность? Если обучить эту модель на отзывах в интернет-магазинах — можно генерировать очень правдоподобные фейковые отзывы в промышленных масштабах. Если обучить её на твиттере, фейсбуке или реддите — можно генерить вполне реалистичные твиты, посты и комментарии, прокачивать фейковые аккаунты и потом устраивать совершенно адские вбросы, рядом с которыми любые фабрики троллей — детский сад.

Стремно, что секретность в отношении этой конкретной модели защитит нас только от скрипт-киддисов (детей, ломающих сайты по шаблону) и то только на время. Нормальные бандиты, а уж тем более государства имеют достаточно ресурсов чтобы повторить и даже превзойти эти результаты в ближайшие годы. Будет как с шифрованием, которое пытались запретить, а теперь даже сердца в вотсапе кодируются при передаче так, что никто в мире не может их прочитать.

Помните, как раньше на сайтах были SEO-шные тексты в подвалах страниц, благодаря которым родилась присказка «SEOшник хуже пидораса…»? Их хотя бы было легко определить по виду, а в 2020 аналогичные тексты могут выглядеть неотличимо от полезной статьи.

До этого момента я не сильно верил в хайп «AI/ML это будущее», но теперь понимаю, откуда растут ноги уверенности руководителей Google, Microsoft и Apple. Будущее за ML и я не оптимистичен :(

День ИИ-анонсов.

OpenAI представили модель для генерации видео (максимальная длина — минута). Жутко от реалистичности, конечно, как всегда.

Прикольно, что модель не просто генерирует картинки, но и «понимает, как устроен мир, как взаимодействуют объекты в нем».

Там куча примеров внутри, рекомендую покликать.

Попробовать самому пока нельзя — доступ дали только белым хакерам, которые пытаются сломать модель и использовать её для всякого плохого, чтобы эти дырки залатали. Ну и доверенным художникам, чтобы те рекламировали её применения бесплатно. А ещё можно попросить уволенного и восcтановленного в должности директора OpenAI в твиттере, что хочешь получить и он иногда отвечает видосом.

А гугл день-в-день наконец-то представил нормального конкурента ChatGPT — Gemini 1.5; во всяком случае, так говорят программисты, которые уже успели им попользоваться. У модели гораздо больше память, чем у всех других публичных ИИ. Она может съесть аж до 700 тысяч слов (11 часов аудио) и выполнять задания оперируя всей этой информацией. Доступ тоже хитро ограничен, разработчикам оставить заявку можно тут.

Наблюдаем конец миропорядка в прямом эфире. Я потихоньку выхожу из из оцепенения, поделюсь новостями мира технологий.

История Anthropic с американскими военными развивается предсказуемо: Минобороны разорвало контракты и формально объявило Антропик угрозой цепочкам поставок, компания обжалует это решение в суде. Эти же контракты, в этот же день, Пентагон заключил с главным конкурентом — OpenAI. Конечно же, Сэм Альтман вел переговоры задолго до, а президент OpenAI пожертвовал в предвыборный фонд Дональда Трампа 25 миллионов долларов. 10 Альтманов из 10.

✽✽

Гораздо интереснее, что у Андрея Карпатого получилось автоматизировать развитие модели nanochat с помощью claude code / codex.

То есть нейросеть развивает нейросеть с минимальным участием человека. Помните про станки для производства станков? Роботы, которые производят роботов.

Это фундаментальная точка перелома, с которой начинается знаменитый апокалиптический сценарий AI 2030.

Уже сегодня, программировать с ИИ гораздо быстрее, чем без него, а самые активные пользователи нейросетей с неограниченными бюджетами — это лаборатории, которые их разрабатывают.

Да, нейросеть Карпатого — учебная, и понятно, что один из самых крутых исследователей потратил время на настойку упряжи (< 1000 строк на гитхабе) для самой мощной коммерческой модели. Тем не менее, я вижу это важной переломной точкой, после которой, развитие нейросетей может радикально ускориться.

Принцип деления ядра доказан и прямо на наших глазах заработала первая центрифуга. Осталось решить миллион технических задач и радикально масштабировать процесс. Манхэттенский проект уже идет.

P. S. Кстати, nanochat — это очень классный учебный проект. Вся структура современных нейросетей, от начала до конца — в нескольких тысячах строк кода на питоне. Никакой магии, можно сесть разобраться. Или в этом и есть магия?

Несколько лет назад было модно смотреть презентации Apple и потом весь твиттер обсуждал, что нового представила яблочная корпорация и как это повлияет на технический мир.

Потом в какой-то момент за презентациями Apple стали следить уже мейнстримовые издания — вели онлайны, писали обзоры, что нового появилось. Последние годы они стали достаточно скучными.

Уже второй день наблюдаю, как весь мой твиттер в давно забытой ажитации от презентации DevDay от OpenAI. Это компания, которая совсем не Open, но является одним из ведущих игроков в области искусственного интеллекта, создателем того самого знаменитого chatGPT.

Они представили возможность создавать своих собственных AI-помощников на основе документов и статей, которые вы загрузите в систему заранее, а также правил, которые вы ей зададите при создании. (короткое видео демо)

Доступ к таким «настроенным моделям» можно будет продавать через магазин OpenAI. Возможно, что мы присутствуем при запуске магазина, аналогичного апстору для айфона (кажется, что плагины в этом плане круче, но посмотрим).

Ещё анонсированы: очень хорошие модели для генерации аудио из текста (дикторы, за вами уже выехали), увеличенный контекст (так что модель может держат в уме большие куски текста) и куча инструментов для разработчиков (возможность исполнять python код и обращаться к внешним API — некоторые из них), так что это очень похоже на ежегодный Apple Worldwide Developer Conference или Microsoft Build. Удивительно присутствовать при зарождении ещё одного важного предложения на рынке «мира/экосистемы для разработчиков». Да, влияние OpenAI на индустрию и тем более реальную экономику несравнимо с такими бегемотами как Microsoft или Apple, но с точки зрения хайпа и внимания модной тусовки — ребята на гребне.

Не обошлось, конечно, и без доли кринжа — девушка со сцены рассказала, как написала душевное письмо папе с помощью модели. Интересно, они сами не понимают, насколько это крипово?

Из конкурентов, за кем ещё можно последить в этой сфере, условные гуглы/андроиды этого рынка: Anthropic с его ботом Claude и недавно анонсированный Илоном Маском (ну конечно, куда без него) Grok, который, в отличие от всех этих моделей, имеет прямой доступ ко всему твиттеру в реальном времени.

Дальше будет только интереснее!

В конце прошлого года OpenAI представила нейросеть ChatGPT, потомка GPT-2 и GPT-3. Она умеет вести диалог — отвечать на вопросы, придумывать истории и даже писать программы.

Поговорить с сетью самому можно бесплатно после регистрации (потребуется VPN, сеть недоступна из России и Украины) на официальном сайте. OpenAI тратит на этот бесплатный тест миллионы долларов, взамен собирает информацию о том, как люди пользуются ИИ.

Очень впечатляющие результаты, а ещё четко видно тренд и я думаю, что скоро эти количественные улучшения приведут к качественному скачку.

🌕 Вот несколько вещей, которые ещё недавно были невозможны, а скоро, кажется, станут обыденностью:

• машина будет мгновенно генерировать краткую выжимку любых встреч и созвонов (кто напишет фолоу-ап, коллеги?) — пример;
• машина сможет оценить вклад каждого участника и продуктивность встречи в целом;
• описываешь обычными словами, что должна делать программа, а машина пишет код (и тесты к нему); обратная задача — 
• даешь машине исходный код программы, а она говорит, что эта программа делает и где могу быть ошибки;
• вместо поиска в гугле, задаешь нейросети вопрос и получаешь ответ (многие считают, что это начала конца Гугла, вот расширение для встраивания ответа нейросети в результаты поиска);
• нормальное голосовое управление телефоном и компьютером: отвечать на смс-ки и имейлы, планировать календарь голосом — как в фильме «Она».

💸 Ходит шутка, что все бодрые программисты-стартаперы сейчас запускают новые проекты, которые являются витринами (фронтендом) для ChatGPT.

Десятки лет мы смотрели фильмы, в которых компьютер умеет вести диалог, отвечать на вопросы и выполнять несложные задачи. Впервые это перестает выглядеть как фантастика и звучит как инженерная задача, которая будет скоро решена.

🌑 Есть и обратная, темная сторона. Всю историю человечества, написать текст было сложнее (дороже), чем прочитать его. Если ты видел длинный, связный текст по теме или адресованный тебе лично — это значило, что кто-то вложил время и силы, душу в него. Тексты, созданные нейросетями связные и выглядят нормально, но их можно генерировать мгновенно и практически бесплатно. Сайты и сервисы к этому не готовы — StackOverflow, главный сайт вопросов и ответов по программированию был мгновенно переполнен мусорными ответами и владельцы сервиса теперь банят любого, кто запостит туда текст из ChatGPT. И это только начало.

Для тех, кто заинтересовался:
- каталог хороших диалогов с ChatGPT;
- виртуальная машина внутри ChatGPT;
- люди обходят ограничения ChatGPT — заставляют её ругаться или придумывать аргументы за Гитлера, например.