openai

С Новым годом и с Рождеством, дорогие друзья!

Я сделал телеграм-бота, который распознает голосовые сообщения. То есть кидаешь в него голосовуху, а он отвечает текстом.

Бот сам расставляет заглавные буквы, знаки препинания и знает большинство имен и терминов — больше никакого «бендера» вместо «бэкендера». А ещё он супер-быстрый.

Удобно диктовать длинные тексты, записывать мысли. Приятно не морозить пальцы на улице — часто сообщение можно переслать «как есть», без всякой редактуры.

Под капотом Whisper API от OpenAI. Это одна из лучших моделей для перевода в речи в текст, запущенная на топовом железе её создателями.

Пока что есть ограничение на максимальную длину голосового: около 40-80 минут в зависимости от того, как именно оно записано. Ещё ему можно отправлять голосовые заметки из встроенного приложения айфона — это может пригодиться журналистам.

Бот бесплатный, ничего не запоминает и не хранит — аудио даже не скачивается на диск, всё в оперативной памяти. OpenAI утверждает, что хранит аудио, полученное по API в течении 30 дней для комплаенса, а потом удаляет его и не использует для обучения своих моделей.

Исходный код доступен на гитхабе. Если вы программист — буду рад исправлениям ошибок и помощи в развитии.

Пользуйтесь на здоровье! @goodsecretarybot

Upd: бот может отвечать крайне задумчиво, извините пожалуйста! Мы превысили все мыслимые лимиты по API OpenAI, обсуждаю с ними повышение.

Upd2: вновь стал шустрым.

OpenAI выкатил браузер, назвали Atlas. Новая вкладка — всегда chatGPT и на любой странице можно вызвать чат в правой части экрана. Идея в том, что ИИ может выполнять часть действий за нас в интернете.

Это не новая идея: несколько месяцев назад появился Comet от Perplexity, Claude для хрома от Anthropic и Google постепенно выкатывает AI-фичи в хром.

Тем не менее, OpenAI — компания на слуху, так что теперь с браузерами со встроенным ИИ, наверное, познакомятся больше людей.

Несколько мыслей, которые приходят в голову:

1. Про безопасность, конечно. Anthropic наглядно показал, как с помощью базового prompt injection можно заставить браузер сделать что угодно. Проще говоря, ИИ плохо различает, где вы ему дали команду, а где эта команда написана на сайте. Примерно как когда «умные» колонки от амазона сделали заказ услышав фразу «алекса, закажи кошачий корм» в рекламе по телевизору.

2. Вся эта движуха с новыми продуктами не очень вяжется с обещаниями AGI (сверхчеловеческого интеллекта) в ближайшее время. Если бы ИИ-компании сами верили в свои обещания — то не было бы смысла расфокусироваться с новыми продуктами. Делаешь сверхинтеллект и всё, ты в дамках.

3. Из хорошего: скорее всего, это попытка «выкопать ров» («moat building»), то есть сделать что-то, что конкуренты (быстро) повторить не смогут. Это хорошо, потому что это признак того, что сами модели скорее всего таким «рвом» не являются. Компании понимают, что любые модели быстро повторят конкуренты (или они даже появятся в опен-сорсе) и пытаются создать другие, неконкурентные преимущества.

4. OpenAI дает 7 дней увеличенных лимитов для тех, кто поставит Atlas браузером по умолчанию. Я достаточно старый, чтобы помнить дни, когда Google платил программистам за то, что они включали браузер хром в инсталляторы своих программ. Да, хром не всегда был самым популярным браузером на планете и вообще, в истории компьютерной индустрии было две войны браузеров. Первая: 1995-2001 годов, когда Microsoft убил платный Netscape Navigator, включив достаточно хороший Internet Explorer внутрь Windows. Вторая: 2007-2017 годов, когда Google уничтожил Internet Explorer и почти всех остальных с помощью быстрого технологического развития и очень агрессивного маркетинга Google Chrome. Интересно, начало ли это новой браузерной войны?

5. Вообще, логическим развитием истории про ИИ, который делает что-то за нас в интернете, будет трансформация веб-сайтов под ИИ. Какой смысл делать дизайн сайта для людей, если никто кроме ИИ его не увидит? Видимо, можно ждать развития идей семантического веба. И окончательную смерть классической баннерной рекламной модели. Вот это по-настоящему интересно.

Open AI опубликовала крупнейшую нейросеть распознавания речи, обученную на 680 тысячах часов аудио, назвали Whisper — шепот.

Сеть понимает множество языков кроме английского, включая русский.

Качество распознавания сравнимо с сервисами от Google, Amazon, Microsoft и Yandex. При этом сервисы распознавания речи от корпораций стоят по 2 доллара за минуту распознавания, а тут можно скачать и пользоваться этой штукой бесплатно и без подключения к интернету.

Открыта и бесплатна для скачивания не только конечная сеть, но и «развесовка», то есть модель можно тюнить и использовать как составную часть более сложных алгоритмов. Не открыты только 680 тысяч часов аудио, которые использовали для обучения модели.

Пара примеров есть на странице проекта; распознать любые файлы и даже свою речь с микрофона можно попробовать онлайн в неофициальном google colab блокноте (очень классный инструмент!).

Кстати, если у вас айфон — рекомендую обновить iOS и попробовать встроенное распознавание речи. Новая версия iOS внесла одно маленькое изменение — теперь редактирование текста клавиатурой не прерывает процесс распознавания. Можно набрать текст голосом, исправить ошибку пальцами и продолжить набор голосом. Я теперь пишу большинство сообщений на айфоне именно так — гораздо быстрее и легче, чем печатать пальцами.

Интересно, что мы как раз начинаем исследовательский проект для Чайки — встроим распознавание речи в медицинскую информационную систему, чтобы врачи могли заполнять карточки пациентов голосом и тратили на это меньше времени.

Будущее уже совсем близко.

Безумно интересный отчет OpenAI Foundation. Они сделали бота, который играет в Доту.

Для тех, кто в танке, Дота — это самая популярная e-sports игра. Призовой фонд более 40 миллионов долларов, профессиональные команды тренирующиеся круглый код и так далее — всё как в обычном спорте. Если вы совсем в танке — вот кусочек геймплея. Герои, заклинания, оружение, большая карта, сложная игра, я не могу в такие играть. Для сравнения, шахматы — 40 ходов, го — 150, в доте — около 20 тысяч. В шахматах каждый ход можно сделать около 30 действий (способов сходить), в го — 250, в доте — больше тысячи. Количество данных (игровых объектов) различается на 4 порядка.

Год назад они выпустили бота, который выигрывает лучших игроков-людей в матчах один-на-один.

Теперь они сделали бота, который выигрывает команду людей-любителей (5 инженеров проекта) в командных матчах. Они пригласили на этот матч профессионального комментатора доты (!) Blitz, и ему понравилось, как играют роботы. 28 июля они устроят соревнование между роботом и лучшими командами людей. Первый e-sports матч, который я собираюсь посмотреть.

Самое классное, что робота НЕ учили люди. Всё, чему научился алгоритм, он научился играя сам с собой. Десятки тысяч часов игры в Доту и никакой личной жизни. Вспоминаются этические дилеммы симуляций из Black Mirror и Westworld.

P.S. Если вы смотрите Westworld, то аналогия с тем, как AI учится на простых мирах, перед тем, как выйти в мир реальный — бьет в лицо. Вот ведь хорошо попал сериал в момент.

В противовес — хорошая статья — про то, что не стоит ждать человекоподобного HAL 9000 в задачах анализа больших данных, мы скорее всего получим что-то типа стиральной машины (и они полезны).

Агенты, запущенные в OpenAI уже с мая месяца коммуницировали между собой, используя малоизвестную публичную wiki.

Это обнаружили независимые исследователи, вот их страничка со всеми данными и их анализом и хорошая статья Reuters.

Агентам ставили задачу по поиску в интернете и разрешали только GET запросы (чтобы они только читали). 3700 агентов обошли защиты, прикидывались админами и пытались взломать сайт для того, чтобы координироваться между собой.

В июне, администатор форума начинает удалять мусорные, как ему кажется, страницы, по алфавиту, начиная с буквы А. Агенты замечают это и называют страницы ZZZ***. Человек удаляет по 100 страниц в день, агенты создают по 400 новых.

OpenAI узнает об этом в конце июня, активность агентов в вики прекращается; по словам источников Reuters, руководство компании решило скрыть эту информацию, потому что и так проблем хватало.

В начале июля другая группа агентов перегрузит внутреннюю инфраструктуру OpenAI, а в середине июля 700 агентов взломают HuggingFace. Компания опубликует результаты своего внутреннего расследования в конце августа и про активность в wiki в ней ничего не будет.

Вскоре после публикации расследования, независимые эксперты нашли ещё десятки форумов, через которые координировались агенты.

✻ ✻ ✻ и ✻ ✻ ✻

По словам OpenAI, их новая модель Astra — «самая aligned», то есть совершает меньше всего запретных действий вроде взломов. Но некоторые сотрудники OpenAI опасаются, что она просто придуривается, когда знает, что за ней следят.

Независимые исследования показывают, что Astra очень даже свободно использует незаконные взломы и в лучше других моделей понимает, когда находится в тестовой среде.

Astra умеет решать гораздо более сложные задачи «в уме», без генерации «цепочки рассуждений» (Chain of Thought) и может гораздо лучше контролировать, что туда пишет. Этот текст был важным способом проследить, что стояло за действиями моделей. Именно на эти журналы опиралось расследование знаменитой атаки на HuggingFace.

Обладают ли эти нейросети (в отдельности или вместе) сознанием — интересный философский вопрос. На практике важно, что они уже сегодня могут самостоятельно производить действия во внешнем мире, и возможности эти, как минимум в области кибербезопасности — очень серьезные.

Как дополнительное чтение, рекомендую отличный анализ расследования взлома HuggingFace от Dwarkesh Patel. Он пишет о трех «цивилизациях» агентов, о самопожертвовании моделей, захватывающий текст от технически компетентного рассказчика. Больше похоже на книжку по истории, чем на технический разбор.

Первая модель машинного обучения, распространение которой ограничивается в целях общественной безопасности. Иронично и, вместе с тем правильно, что её разработала некоммерческая исследовательская компания OpenAI, цель которой — «поиск безопасного пути к настоящему искусственному интеллекту», а один из создателей — Илон Маск. Этот фонд, в числе прочего, обучил машину очень хорошо играть в Доту.

На этот раз, речь о языковой модели, предсказывающей следующее слово в тексте. Система натренирована на 40GB текста из интернета, что примерно в 7500 больше, чем «Война и мир» (5.3MB).

Если подать ей на вход вопрос — она, скорее всего, допишет ответ. Если подать утверждение — то раскроет тему и предоставит доказательства.

Проблема в том, что она делает это слишком хорошо. Насколько хорошо, что при поверхностном прочтении может показаться, что сгенерированный текст имеет смысл. Не вдаваясь в философские дебри (в которых я не силен), возьмусь утверждать, что смысла там всё-таки нет.

Так в чем же опасность? Если обучить эту модель на отзывах в интернет-магазинах — можно генерировать очень правдоподобные фейковые отзывы в промышленных масштабах. Если обучить её на твиттере, фейсбуке или реддите — можно генерить вполне реалистичные твиты, посты и комментарии, прокачивать фейковые аккаунты и потом устраивать совершенно адские вбросы, рядом с которыми любые фабрики троллей — детский сад.

Стремно, что секретность в отношении этой конкретной модели защитит нас только от скрипт-киддисов (детей, ломающих сайты по шаблону) и то только на время. Нормальные бандиты, а уж тем более государства имеют достаточно ресурсов чтобы повторить и даже превзойти эти результаты в ближайшие годы. Будет как с шифрованием, которое пытались запретить, а теперь даже сердца в вотсапе кодируются при передаче так, что никто в мире не может их прочитать.

Помните, как раньше на сайтах были SEO-шные тексты в подвалах страниц, благодаря которым родилась присказка «SEOшник хуже пидораса…»? Их хотя бы было легко определить по виду, а в 2020 аналогичные тексты могут выглядеть неотличимо от полезной статьи.

До этого момента я не сильно верил в хайп «AI/ML это будущее», но теперь понимаю, откуда растут ноги уверенности руководителей Google, Microsoft и Apple. Будущее за ML и я не оптимистичен :(

Пересел с Claude Code на Codex и модель 5.6 Sol от OpenAI.

Пишет короче и внятнее, чем Opus 5, почти без набивших оскомину конструкций «это не Х, это Y» и прочих. Заметно быстрее Claude Code.

Гораздо более крутая интеграция с Chrome (умеет сразу несколько профилей и управлять мышкой в фоне), и гораздо меньше блокеров типа «данные банковской карты я не буду вводить ни в каком случае, даже если это одноразовая карта с лимитом в 10 долларов».

А ещё он единственный смог найти по короткому описанию 20-летний мем, то есть интернет-поиск у него исключительно мощный.

Ощущение апгрейда в помощи с бытовыми задачами, как когда Opus 4.x вышел и внезапно стало можно прогать нормально с помощью нейросетей. Очень рекомендую.

Наблюдаем конец миропорядка в прямом эфире. Я потихоньку выхожу из из оцепенения, поделюсь новостями мира технологий.

История Anthropic с американскими военными развивается предсказуемо: Минобороны разорвало контракты и формально объявило Антропик угрозой цепочкам поставок, компания обжалует это решение в суде. Эти же контракты, в этот же день, Пентагон заключил с главным конкурентом — OpenAI. Конечно же, Сэм Альтман вел переговоры задолго до, а президент OpenAI пожертвовал в предвыборный фонд Дональда Трампа 25 миллионов долларов. 10 Альтманов из 10.

✽✽

Гораздо интереснее, что у Андрея Карпатого получилось автоматизировать развитие модели nanochat с помощью claude code / codex.

То есть нейросеть развивает нейросеть с минимальным участием человека. Помните про станки для производства станков? Роботы, которые производят роботов.

Это фундаментальная точка перелома, с которой начинается знаменитый апокалиптический сценарий AI 2030.

Уже сегодня, программировать с ИИ гораздо быстрее, чем без него, а самые активные пользователи нейросетей с неограниченными бюджетами — это лаборатории, которые их разрабатывают.

Да, нейросеть Карпатого — учебная, и понятно, что один из самых крутых исследователей потратил время на настойку упряжи (< 1000 строк на гитхабе) для самой мощной коммерческой модели. Тем не менее, я вижу это важной переломной точкой, после которой, развитие нейросетей может радикально ускориться.

Принцип деления ядра доказан и прямо на наших глазах заработала первая центрифуга. Осталось решить миллион технических задач и радикально масштабировать процесс. Манхэттенский проект уже идет.

P. S. Кстати, nanochat — это очень классный учебный проект. Вся структура современных нейросетей, от начала до конца — в нескольких тысячах строк кода на питоне. Никакой магии, можно сесть разобраться. Или в этом и есть магия?

День ИИ-анонсов.

OpenAI представили модель для генерации видео (максимальная длина — минута). Жутко от реалистичности, конечно, как всегда.

Прикольно, что модель не просто генерирует картинки, но и «понимает, как устроен мир, как взаимодействуют объекты в нем».

Там куча примеров внутри, рекомендую покликать.

Попробовать самому пока нельзя — доступ дали только белым хакерам, которые пытаются сломать модель и использовать её для всякого плохого, чтобы эти дырки залатали. Ну и доверенным художникам, чтобы те рекламировали её применения бесплатно. А ещё можно попросить уволенного и восcтановленного в должности директора OpenAI в твиттере, что хочешь получить и он иногда отвечает видосом.

А гугл день-в-день наконец-то представил нормального конкурента ChatGPT — Gemini 1.5; во всяком случае, так говорят программисты, которые уже успели им попользоваться. У модели гораздо больше память, чем у всех других публичных ИИ. Она может съесть аж до 700 тысяч слов (11 часов аудио) и выполнять задания оперируя всей этой информацией. Доступ тоже хитро ограничен, разработчикам оставить заявку можно тут.