#openai

страница 2 из 3
пост №1905

OpenAI представил новую модель по генерации видео Sora 2. Она сильно лучше, чем Sora 1, научилась аудио, сравнима с ведущими моделями от bytedance и гугла.

Интереснее, что вместе с моделью они запустили приложение Sora (только iOS, только в США), что-то типа тиктока для подростков, но все видео из нейросети; идея в том, что можно представлять себя и друзей в разных ситуациях.

Занимательно, что Альтман запостил в своем личном блоге про кембрийский взрыв творчества и трепет (trepidation). Подозреваю, что промпт был «напиши текст, чтобы умный, будем жарить мозги подросткам через видео».

Прикладываю видео-анонс сего события.

пост №1844

У меня в голове засели два видео.

Первое — анонс того, что Джони Айв будет делать железо в OpenAI.

Айв — ключевой партнёр Стива Джобса в создании айфонов, макбуков и других культовых продуктов Apple. Он ушел из Apple шесть лет назад и основал свою компанию, у которой супер милый сайт и ни единого публичного продукта. Сумма сделки — 6.5 млрд долларов.

Айв начинает работу над физическим продуктом OpenAI, который они представят в следующем году. Судя по анонсу — это будет устройство, которое постоянно слушает наши разговоры и может отвечать на вопросы учитывая контекст беседы.

Этот анонс — 9 минутный художественный фильм, в котором Сэм (Альтман) и Джони (Айв) играют, будто они идут по шумным улицам Сан-Франциско, встречаются в кофейне (привет Сэм! привет Джони!), бариста делает им по чашке кофе (крупный план, ASMR видео) и ... вдруг они начинают говорить друг о друге в третьем лице, то есть как со сцены, но при этом якобы сидят за барной стойкой, называют друг-друга самыми большими гениями, которых видел свет, утверждают, что мы стоим на пороге самого крупного технологического изменения (видимо, речь об ИИ) и что Сан-Франциско — центр технологий и культуры (?!) и т. д.

То, что они говорят всё это без всякой иронии — вызывает недоумение и даже тревогу. Не до смеха, хотя комментарии на ютубе уже настоялись.

Кроме видео, есть ещё официальная новость на сайте OpenAI, оформленная как приглашение на свадьбу. Счастья молодым.

Второе видео — презентация нового пылесоса Дайсон. Тоже 9 минут, но каких! Владелец компании выходит на сцену перед аудиторией из журналистов и показывает такой пылесос, которого никто раньше не видел — двигатель, мусоросборник, всё уместилось внутри ручки диаметром 38 мм! Работает он за счет микро-двигателя, крутящегося со скоростью 140 тысяч оборотов в минуту. А ещё насадки, в которых наконец-то не застревают волосы! И подсветка мусора на полу сразу во все стороны!

Прямо как с Джобсом в лучшие времена — сразу хочется купить, пускай и понимаешь, что дешево не будет.

В чем разница между этими двумя видео? Почему при просмотре первого я чувствую обман, а при просмотре второго — вдохновение?

Интересно, я ли один так чувствую?

Мне кажется, дело в натуральности, в объеме продакшена. Первый ролик отполированный, за этим продакшеном не видно реальных Сэма и Джони. Во втором ролике Дайсон на секунду мешкается, часть текста явно читает прямо с презентации, не идеально, зато он там живой. С ошибками и недостатками, но безусловно живой человек.

Не знаю, зачем так поступили Альтман и Айв, но лично мне страшно показать своё несовершенство. Даже в этом канале я стал пытаться «отполировать» все свои тексты. Не дай бог показать, что у меня не все идеально в бизнесе или подкасте или вообще в жизни (и голове). Кажется, что в процессе я чуть не выплеснул и ребенка. Канал был моим способом делиться своей жизнью и мыслями и раньше я был смелее.

Так выпьем за смелость быть настоящим!

пост №1780

Гораздо интереснее то, что OpenAI представила новую модель chatGPT, OpenAI o1 — она дольше думает (до минуты), зато без подсказок строит длинные и полные рассуждения.

В пресс-релизе система решает математические задачи уровня международной олимпиады и пишет сложный код (специально для программистов есть более быстрая версия o1-mini), а для меня составила неплохую выжимку из стенограммы встречи. Рекомендую.

Интересно, как подробно они рассказывают о тестировании безопасности — новую модель сложнее уговорить стать соучастником преступления.

пост №1730

День ИИ-анонсов.

OpenAI представили модель для генерации видео (максимальная длина — минута). Жутко от реалистичности, конечно, как всегда.

Прикольно, что модель не просто генерирует картинки, но и «понимает, как устроен мир, как взаимодействуют объекты в нем».

Там куча примеров внутри, рекомендую покликать.

Попробовать самому пока нельзя — доступ дали только белым хакерам, которые пытаются сломать модель и использовать её для всякого плохого, чтобы эти дырки залатали. Ну и доверенным художникам, чтобы те рекламировали её применения бесплатно. А ещё можно попросить уволенного и восcтановленного в должности директора OpenAI в твиттере, что хочешь получить и он иногда отвечает видосом.

А гугл день-в-день наконец-то представил нормального конкурента ChatGPT — Gemini 1.5; во всяком случае, так говорят программисты, которые уже успели им попользоваться. У модели гораздо больше память, чем у всех других публичных ИИ. Она может съесть аж до 700 тысяч слов (11 часов аудио) и выполнять задания оперируя всей этой информацией. Доступ тоже хитро ограничен, разработчикам оставить заявку можно тут.

пост №1715

С Новым годом и с Рождеством, дорогие друзья!

Я сделал телеграм-бота, который распознает голосовые сообщения. То есть кидаешь в него голосовуху, а он отвечает текстом.

Бот сам расставляет заглавные буквы, знаки препинания и знает большинство имен и терминов — больше никакого «бендера» вместо «бэкендера». А ещё он супер-быстрый.

Удобно диктовать длинные тексты, записывать мысли. Приятно не морозить пальцы на улице — часто сообщение можно переслать «как есть», без всякой редактуры.

Под капотом Whisper API от OpenAI. Это одна из лучших моделей для перевода в речи в текст, запущенная на топовом железе её создателями.

Пока что есть ограничение на максимальную длину голосового: около 40-80 минут в зависимости от того, как именно оно записано. Ещё ему можно отправлять голосовые заметки из встроенного приложения айфона — это может пригодиться журналистам.

Бот бесплатный, ничего не запоминает и не хранит — аудио даже не скачивается на диск, всё в оперативной памяти. OpenAI утверждает, что хранит аудио, полученное по API в течении 30 дней для комплаенса, а потом удаляет его и не использует для обучения своих моделей.

Исходный код доступен на гитхабе. Если вы программист — буду рад исправлениям ошибок и помощи в развитии.

Пользуйтесь на здоровье! @goodsecretarybot

Upd: бот может отвечать крайне задумчиво, извините пожалуйста! Мы превысили все мыслимые лимиты по API OpenAI, обсуждаю с ними повышение.

Upd2: вновь стал шустрым.

пост №1702

Несколько лет назад было модно смотреть презентации Apple и потом весь твиттер обсуждал, что нового представила яблочная корпорация и как это повлияет на технический мир.

Потом в какой-то момент за презентациями Apple стали следить уже мейнстримовые издания — вели онлайны, писали обзоры, что нового появилось. Последние годы они стали достаточно скучными.

Уже второй день наблюдаю, как весь мой твиттер в давно забытой ажитации от презентации DevDay от OpenAI. Это компания, которая совсем не Open, но является одним из ведущих игроков в области искусственного интеллекта, создателем того самого знаменитого chatGPT.

Они представили возможность создавать своих собственных AI-помощников на основе документов и статей, которые вы загрузите в систему заранее, а также правил, которые вы ей зададите при создании. (короткое видео демо)

Доступ к таким «настроенным моделям» можно будет продавать через магазин OpenAI. Возможно, что мы присутствуем при запуске магазина, аналогичного апстору для айфона (кажется, что плагины в этом плане круче, но посмотрим).

Ещё анонсированы: очень хорошие модели для генерации аудио из текста (дикторы, за вами уже выехали), увеличенный контекст (так что модель может держат в уме большие куски текста) и куча инструментов для разработчиков (возможность исполнять python код и обращаться к внешним API — некоторые из них), так что это очень похоже на ежегодный Apple Worldwide Developer Conference или Microsoft Build. Удивительно присутствовать при зарождении ещё одного важного предложения на рынке «мира/экосистемы для разработчиков». Да, влияние OpenAI на индустрию и тем более реальную экономику несравнимо с такими бегемотами как Microsoft или Apple, но с точки зрения хайпа и внимания модной тусовки — ребята на гребне.

Не обошлось, конечно, и без доли кринжа — девушка со сцены рассказала, как написала душевное письмо папе с помощью модели. Интересно, они сами не понимают, насколько это крипово?

Из конкурентов, за кем ещё можно последить в этой сфере, условные гуглы/андроиды этого рынка: Anthropic с его ботом Claude и недавно анонсированный Илоном Маском (ну конечно, куда без него) Grok, который, в отличие от всех этих моделей, имеет прямой доступ ко всему твиттеру в реальном времени.

Дальше будет только интереснее!

пост №1661

В конце прошлого года OpenAI представила нейросеть ChatGPT, потомка GPT-2 и GPT-3. Она умеет вести диалог — отвечать на вопросы, придумывать истории и даже писать программы.

Поговорить с сетью самому можно бесплатно после регистрации (потребуется VPN, сеть недоступна из России и Украины) на официальном сайте. OpenAI тратит на этот бесплатный тест миллионы долларов, взамен собирает информацию о том, как люди пользуются ИИ.

Очень впечатляющие результаты, а ещё четко видно тренд и я думаю, что скоро эти количественные улучшения приведут к качественному скачку.

🌕 Вот несколько вещей, которые ещё недавно были невозможны, а скоро, кажется, станут обыденностью:

• машина будет мгновенно генерировать краткую выжимку любых встреч и созвонов (кто напишет фолоу-ап, коллеги?) — пример;
• машина сможет оценить вклад каждого участника и продуктивность встречи в целом;
• описываешь обычными словами, что должна делать программа, а машина пишет код (и тесты к нему); обратная задача — 
• даешь машине исходный код программы, а она говорит, что эта программа делает и где могу быть ошибки;
• вместо поиска в гугле, задаешь нейросети вопрос и получаешь ответ (многие считают, что это начала конца Гугла, вот расширение для встраивания ответа нейросети в результаты поиска);
• нормальное голосовое управление телефоном и компьютером: отвечать на смс-ки и имейлы, планировать календарь голосом — как в фильме «Она».

💸 Ходит шутка, что все бодрые программисты-стартаперы сейчас запускают новые проекты, которые являются витринами (фронтендом) для ChatGPT.

Десятки лет мы смотрели фильмы, в которых компьютер умеет вести диалог, отвечать на вопросы и выполнять несложные задачи. Впервые это перестает выглядеть как фантастика и звучит как инженерная задача, которая будет скоро решена.

🌑 Есть и обратная, темная сторона. Всю историю человечества, написать текст было сложнее (дороже), чем прочитать его. Если ты видел длинный, связный текст по теме или адресованный тебе лично — это значило, что кто-то вложил время и силы, душу в него. Тексты, созданные нейросетями связные и выглядят нормально, но их можно генерировать мгновенно и практически бесплатно. Сайты и сервисы к этому не готовы — StackOverflow, главный сайт вопросов и ответов по программированию был мгновенно переполнен мусорными ответами и владельцы сервиса теперь банят любого, кто запостит туда текст из ChatGPT. И это только начало.

Для тех, кто заинтересовался:
- каталог хороших диалогов с ChatGPT;
- виртуальная машина внутри ChatGPT;
- люди обходят ограничения ChatGPT — заставляют её ругаться или придумывать аргументы за Гитлера, например.

пост №1642

Open AI опубликовала крупнейшую нейросеть распознавания речи, обученную на 680 тысячах часов аудио, назвали Whisper — шепот.

Сеть понимает множество языков кроме английского, включая русский.

Качество распознавания сравнимо с сервисами от Google, Amazon, Microsoft и Yandex. При этом сервисы распознавания речи от корпораций стоят по 2 доллара за минуту распознавания, а тут можно скачать и пользоваться этой штукой бесплатно и без подключения к интернету.

Открыта и бесплатна для скачивания не только конечная сеть, но и «развесовка», то есть модель можно тюнить и использовать как составную часть более сложных алгоритмов. Не открыты только 680 тысяч часов аудио, которые использовали для обучения модели.

Пара примеров есть на странице проекта; распознать любые файлы и даже свою речь с микрофона можно попробовать онлайн в неофициальном google colab блокноте (очень классный инструмент!).

Кстати, если у вас айфон — рекомендую обновить iOS и попробовать встроенное распознавание речи. Новая версия iOS внесла одно маленькое изменение — теперь редактирование текста клавиатурой не прерывает процесс распознавания. Можно набрать текст голосом, исправить ошибку пальцами и продолжить набор голосом. Я теперь пишу большинство сообщений на айфоне именно так — гораздо быстрее и легче, чем печатать пальцами.

Интересно, что мы как раз начинаем исследовательский проект для Чайки — встроим распознавание речи в медицинскую информационную систему, чтобы врачи могли заполнять карточки пациентов голосом и тратили на это меньше времени.

Будущее уже совсем близко.

пост №1227

Очередная страшно красивая нейросеть от OpenAI.

Вы пишете текст, она генерирует картинку. Вот, например, «стулья в форме авокадо».

По ссылке куча других примеров.

Страшно.

https://openai.com/blog/dall-e/

пост №870

Первая модель машинного обучения, распространение которой ограничивается в целях общественной безопасности. Иронично и, вместе с тем правильно, что её разработала некоммерческая исследовательская компания OpenAI, цель которой — «поиск безопасного пути к настоящему искусственному интеллекту», а один из создателей — Илон Маск. Этот фонд, в числе прочего, обучил машину очень хорошо играть в Доту.

На этот раз, речь о языковой модели, предсказывающей следующее слово в тексте. Система натренирована на 40GB текста из интернета, что примерно в 7500 больше, чем «Война и мир» (5.3MB).

Если подать ей на вход вопрос — она, скорее всего, допишет ответ. Если подать утверждение — то раскроет тему и предоставит доказательства.

Проблема в том, что она делает это слишком хорошо. Насколько хорошо, что при поверхностном прочтении может показаться, что сгенерированный текст имеет смысл. Не вдаваясь в философские дебри (в которых я не силен), возьмусь утверждать, что смысла там всё-таки нет.

Так в чем же опасность? Если обучить эту модель на отзывах в интернет-магазинах — можно генерировать очень правдоподобные фейковые отзывы в промышленных масштабах. Если обучить её на твиттере, фейсбуке или реддите — можно генерить вполне реалистичные твиты, посты и комментарии, прокачивать фейковые аккаунты и потом устраивать совершенно адские вбросы, рядом с которыми любые фабрики троллей — детский сад.

Стремно, что секретность в отношении этой конкретной модели защитит нас только от скрипт-киддисов (детей, ломающих сайты по шаблону) и то только на время. Нормальные бандиты, а уж тем более государства имеют достаточно ресурсов чтобы повторить и даже превзойти эти результаты в ближайшие годы. Будет как с шифрованием, которое пытались запретить, а теперь даже сердца в вотсапе кодируются при передаче так, что никто в мире не может их прочитать.

Помните, как раньше на сайтах были SEO-шные тексты в подвалах страниц, благодаря которым родилась присказка «SEOшник хуже пидораса…»? Их хотя бы было легко определить по виду, а в 2020 аналогичные тексты могут выглядеть неотличимо от полезной статьи.

До этого момента я не сильно верил в хайп «AI/ML это будущее», но теперь понимаю, откуда растут ноги уверенности руководителей Google, Microsoft и Apple. Будущее за ML и я не оптимистичен :(