openai

Несколько лет назад было модно смотреть презентации Apple и потом весь твиттер обсуждал, что нового представила яблочная корпорация и как это повлияет на технический мир.

Потом в какой-то момент за презентациями Apple стали следить уже мейнстримовые издания — вели онлайны, писали обзоры, что нового появилось. Последние годы они стали достаточно скучными.

Уже второй день наблюдаю, как весь мой твиттер в давно забытой ажитации от презентации DevDay от OpenAI. Это компания, которая совсем не Open, но является одним из ведущих игроков в области искусственного интеллекта, создателем того самого знаменитого chatGPT.

Они представили возможность создавать своих собственных AI-помощников на основе документов и статей, которые вы загрузите в систему заранее, а также правил, которые вы ей зададите при создании. (короткое видео демо)

Доступ к таким «настроенным моделям» можно будет продавать через магазин OpenAI. Возможно, что мы присутствуем при запуске магазина, аналогичного апстору для айфона (кажется, что плагины в этом плане круче, но посмотрим).

Ещё анонсированы: очень хорошие модели для генерации аудио из текста (дикторы, за вами уже выехали), увеличенный контекст (так что модель может держат в уме большие куски текста) и куча инструментов для разработчиков (возможность исполнять python код и обращаться к внешним API — некоторые из них), так что это очень похоже на ежегодный Apple Worldwide Developer Conference или Microsoft Build. Удивительно присутствовать при зарождении ещё одного важного предложения на рынке «мира/экосистемы для разработчиков». Да, влияние OpenAI на индустрию и тем более реальную экономику несравнимо с такими бегемотами как Microsoft или Apple, но с точки зрения хайпа и внимания модной тусовки — ребята на гребне.

Не обошлось, конечно, и без доли кринжа — девушка со сцены рассказала, как написала душевное письмо папе с помощью модели. Интересно, они сами не понимают, насколько это крипово?

Из конкурентов, за кем ещё можно последить в этой сфере, условные гуглы/андроиды этого рынка: Anthropic с его ботом Claude и недавно анонсированный Илоном Маском (ну конечно, куда без него) Grok, который, в отличие от всех этих моделей, имеет прямой доступ ко всему твиттеру в реальном времени.

Дальше будет только интереснее!

В конце прошлого года OpenAI представила нейросеть ChatGPT, потомка GPT-2 и GPT-3. Она умеет вести диалог — отвечать на вопросы, придумывать истории и даже писать программы.

Поговорить с сетью самому можно бесплатно после регистрации (потребуется VPN, сеть недоступна из России и Украины) на официальном сайте. OpenAI тратит на этот бесплатный тест миллионы долларов, взамен собирает информацию о том, как люди пользуются ИИ.

Очень впечатляющие результаты, а ещё четко видно тренд и я думаю, что скоро эти количественные улучшения приведут к качественному скачку.

🌕 Вот несколько вещей, которые ещё недавно были невозможны, а скоро, кажется, станут обыденностью:

• машина будет мгновенно генерировать краткую выжимку любых встреч и созвонов (кто напишет фолоу-ап, коллеги?) — пример;
• машина сможет оценить вклад каждого участника и продуктивность встречи в целом;
• описываешь обычными словами, что должна делать программа, а машина пишет код (и тесты к нему); обратная задача — 
• даешь машине исходный код программы, а она говорит, что эта программа делает и где могу быть ошибки;
• вместо поиска в гугле, задаешь нейросети вопрос и получаешь ответ (многие считают, что это начала конца Гугла, вот расширение для встраивания ответа нейросети в результаты поиска);
• нормальное голосовое управление телефоном и компьютером: отвечать на смс-ки и имейлы, планировать календарь голосом — как в фильме «Она».

💸 Ходит шутка, что все бодрые программисты-стартаперы сейчас запускают новые проекты, которые являются витринами (фронтендом) для ChatGPT.

Десятки лет мы смотрели фильмы, в которых компьютер умеет вести диалог, отвечать на вопросы и выполнять несложные задачи. Впервые это перестает выглядеть как фантастика и звучит как инженерная задача, которая будет скоро решена.

🌑 Есть и обратная, темная сторона. Всю историю человечества, написать текст было сложнее (дороже), чем прочитать его. Если ты видел длинный, связный текст по теме или адресованный тебе лично — это значило, что кто-то вложил время и силы, душу в него. Тексты, созданные нейросетями связные и выглядят нормально, но их можно генерировать мгновенно и практически бесплатно. Сайты и сервисы к этому не готовы — StackOverflow, главный сайт вопросов и ответов по программированию был мгновенно переполнен мусорными ответами и владельцы сервиса теперь банят любого, кто запостит туда текст из ChatGPT. И это только начало.

Для тех, кто заинтересовался:
- каталог хороших диалогов с ChatGPT;
- виртуальная машина внутри ChatGPT;
- люди обходят ограничения ChatGPT — заставляют её ругаться или придумывать аргументы за Гитлера, например.

Open AI опубликовала крупнейшую нейросеть распознавания речи, обученную на 680 тысячах часов аудио, назвали Whisper — шепот.

Сеть понимает множество языков кроме английского, включая русский.

Качество распознавания сравнимо с сервисами от Google, Amazon, Microsoft и Yandex. При этом сервисы распознавания речи от корпораций стоят по 2 доллара за минуту распознавания, а тут можно скачать и пользоваться этой штукой бесплатно и без подключения к интернету.

Открыта и бесплатна для скачивания не только конечная сеть, но и «развесовка», то есть модель можно тюнить и использовать как составную часть более сложных алгоритмов. Не открыты только 680 тысяч часов аудио, которые использовали для обучения модели.

Пара примеров есть на странице проекта; распознать любые файлы и даже свою речь с микрофона можно попробовать онлайн в неофициальном google colab блокноте (очень классный инструмент!).

Кстати, если у вас айфон — рекомендую обновить iOS и попробовать встроенное распознавание речи. Новая версия iOS внесла одно маленькое изменение — теперь редактирование текста клавиатурой не прерывает процесс распознавания. Можно набрать текст голосом, исправить ошибку пальцами и продолжить набор голосом. Я теперь пишу большинство сообщений на айфоне именно так — гораздо быстрее и легче, чем печатать пальцами.

Интересно, что мы как раз начинаем исследовательский проект для Чайки — встроим распознавание речи в медицинскую информационную систему, чтобы врачи могли заполнять карточки пациентов голосом и тратили на это меньше времени.

Будущее уже совсем близко.

Первая модель машинного обучения, распространение которой ограничивается в целях общественной безопасности. Иронично и, вместе с тем правильно, что её разработала некоммерческая исследовательская компания OpenAI, цель которой — «поиск безопасного пути к настоящему искусственному интеллекту», а один из создателей — Илон Маск. Этот фонд, в числе прочего, обучил машину очень хорошо играть в Доту.

На этот раз, речь о языковой модели, предсказывающей следующее слово в тексте. Система натренирована на 40GB текста из интернета, что примерно в 7500 больше, чем «Война и мир» (5.3MB).

Если подать ей на вход вопрос — она, скорее всего, допишет ответ. Если подать утверждение — то раскроет тему и предоставит доказательства.

Проблема в том, что она делает это слишком хорошо. Насколько хорошо, что при поверхностном прочтении может показаться, что сгенерированный текст имеет смысл. Не вдаваясь в философские дебри (в которых я не силен), возьмусь утверждать, что смысла там всё-таки нет.

Так в чем же опасность? Если обучить эту модель на отзывах в интернет-магазинах — можно генерировать очень правдоподобные фейковые отзывы в промышленных масштабах. Если обучить её на твиттере, фейсбуке или реддите — можно генерить вполне реалистичные твиты, посты и комментарии, прокачивать фейковые аккаунты и потом устраивать совершенно адские вбросы, рядом с которыми любые фабрики троллей — детский сад.

Стремно, что секретность в отношении этой конкретной модели защитит нас только от скрипт-киддисов (детей, ломающих сайты по шаблону) и то только на время. Нормальные бандиты, а уж тем более государства имеют достаточно ресурсов чтобы повторить и даже превзойти эти результаты в ближайшие годы. Будет как с шифрованием, которое пытались запретить, а теперь даже сердца в вотсапе кодируются при передаче так, что никто в мире не может их прочитать.

Помните, как раньше на сайтах были SEO-шные тексты в подвалах страниц, благодаря которым родилась присказка «SEOшник хуже пидораса…»? Их хотя бы было легко определить по виду, а в 2020 аналогичные тексты могут выглядеть неотличимо от полезной статьи.

До этого момента я не сильно верил в хайп «AI/ML это будущее», но теперь понимаю, откуда растут ноги уверенности руководителей Google, Microsoft и Apple. Будущее за ML и я не оптимистичен :(

Внутри статьи куча технических деталей, но вот видео-презентация достижения, где Blitz (комментатор-профессионал) рассказывает свои ощущения от просмотра игры.

И да, вы правильно угадали, OpenAI Foundation основал Илон Маск (вместе с Сэмом Альтманом из YCombinator).

https://www.youtube.com/watch?v=eHipy_j29Xw

Безумно интересный отчет OpenAI Foundation. Они сделали бота, который играет в Доту.

Для тех, кто в танке, Дота — это самая популярная e-sports игра. Призовой фонд более 40 миллионов долларов, профессиональные команды тренирующиеся круглый код и так далее — всё как в обычном спорте. Если вы совсем в танке — вот кусочек геймплея. Герои, заклинания, оружение, большая карта, сложная игра, я не могу в такие играть. Для сравнения, шахматы — 40 ходов, го — 150, в доте — около 20 тысяч. В шахматах каждый ход можно сделать около 30 действий (способов сходить), в го — 250, в доте — больше тысячи. Количество данных (игровых объектов) различается на 4 порядка.

Год назад они выпустили бота, который выигрывает лучших игроков-людей в матчах один-на-один.

Теперь они сделали бота, который выигрывает команду людей-любителей (5 инженеров проекта) в командных матчах. Они пригласили на этот матч профессионального комментатора доты (!) Blitz, и ему понравилось, как играют роботы. 28 июля они устроят соревнование между роботом и лучшими командами людей. Первый e-sports матч, который я собираюсь посмотреть.

Самое классное, что робота НЕ учили люди. Всё, чему научился алгоритм, он научился играя сам с собой. Десятки тысяч часов игры в Доту и никакой личной жизни. Вспоминаются этические дилеммы симуляций из Black Mirror и Westworld.

P.S. Если вы смотрите Westworld, то аналогия с тем, как AI учится на простых мирах, перед тем, как выйти в мир реальный — бьет в лицо. Вот ведь хорошо попал сериал в момент.

В противовес — хорошая статья — про то, что не стоит ждать человекоподобного HAL 9000 в задачах анализа больших данных, мы скорее всего получим что-то типа стиральной машины (и они полезны).