llm

А вот парни из supabase на основе pglite сделали браузерную базу данных, с которой можно общаться на человеческом языке (они используют chatGPT 4.5o).

Получилось супер пособие для обучения SQL: перед глазами актуальная картинка структуры БД, удобно экспериментировать с командами, можно попросить машину заполнить таблицы тестовыми данными и задавать её вопросы.

Да и как практический инструмент: загружаешь в неё csv/excel файлы и задаешь конкретные вопросы по данным, она отвечает, умеет строить графики.

Раньше за счет владения SQL можно было быть «супер хакером», помогая людям отвечать на вопросы и визуализируя сложные данные. Теперь это научилась делать машина. Даже обидно немного!

Попробовать можно тут, для запуска потребуется залогиниться через github.

Отличная статья про то, что самое долгое и сложное в программировании — это не написание кода. Самое дорогое — это проведение код-ревью, передача культуры, знаний, тестирование и отладка кода.

И нейросети, используемые бездумно, без должного профессионального надзора, не уменьшают нагрузку, а просто переносят её.

Другой автор отлично раскрывает эту идею, он пишет: «если раньше по коду новичка я мог догадаться, что он понимает, а что нет, мы могли обсуждать его решение, и моя обратная связь была обучающей, то теперь мне приносят код, сгенерированный нейросетями, который выглядит хорошо, но сломан странным образом, и, когда я указываю на ошибку, мне приносят абсолютно новый код (примерно как LLM)».

В общем, новичкам кажется, что они стали более производительными, а на самом деле вся нагрузка ложится на опытных ребят, которым приходится продираться через тонны бессмысленного кода.

Рекомендую почитать ещё комментарии на HN, многие опытные разработчики в ужасе от происходящего.

Удивительным образом, я тоже с этим сталкиваюсь, но с заказчиками.

Раньше новые клиенты крайне редко приносили написанный текст, чаще просили: «давай созвонимся, обсудим задачу». А если уж присылали текст — то я по нему мог очень многое угадать про уровень проработанности задачи, особенности заказчика, а порой и про саму задачу. Теперь мне часто присылают развернутые «технические задания», сгенерированные нейросетью.

Они выглядят красиво, но, когда я их читаю и пытаюсь собрать в голове видение проекта и заказчика, то у меня не складывается картинка. А ещё голова начинает болеть от напряжения. Тут я бросаю текст и прошу созвониться-обсудить.

Лично я всегда предпочту одну строчку, написанную человеком, 10 строчкам, написанным роботами. Потому что в случае робо-текста приходится угадывать, какие из добавленных роботом строк по удачному совпадению отражают реальность, а какие — просто то, как, по мнению нейросети, обычно бывает в мире.

И нет, вариант «попроси нейросеть сжать длинный текст до одной строки» не работает, информация теряется безвозвратно.

Со страхом жду дня, когда люди перестанут сами ходить на встречи и будут присылать роботов (аватаров), которые будут говорить пустое. Технически это возможно уже сейчас; до массовой доступности, я думаю, год-два от силы 🙈

Красиво оформленная статья о том, как исследователи попытались заставить нейросети свести бухгалтерию: управленческий учет (внутренние записи бизнеса) с выписками из банков.

Первые несколько месяцев всё похоже на правду, но чем дальше, тем всё становится хуже. Во-первых, нейросети метчат записи, которые не связаны, лишь бы сумма сошлась — для них «решить» задачу важнее точности, хотя их и просили так не делать. Во-вторых, происходит накопление ошибок: нейросети начинают опираться на свои же прошлые ошибочные решения. В общем, до человека даже ведущим моделям ещё далеко.

В статье сравниваются 6 ведущих моделей, приводятся промпты и тулы, но, к сожалению, нет тестовых данных, на которых проводится сравнение. Тем не менее, внушительный труд. Рекомендую.

Спасибо Игорю за наводку.

Замечательный скилл (инструкция для LLM) для экономии токенов, Caveman. Нейросеть начинает отвечать как пещерный человек. Мне это напоминает стиль общения нелюдимых инженеров из восточной европы.

Учитывая, что программирование мы заменяем на бесконечным общением с нейросетью, экономия текста сильно экономит время и нагрузку на мозг. Рекомендую!

Пример пересказа этого поста в самом его сжатом стиле ultra:

Caveman скилл — LLM говорит как пещерный. Токены экономь. Стиль = угрюмый инженер восточной европы. Чат с нейронкой бесконечный, меньше текст = меньше мозг устал. Бери.

В английском эффект ярче!

Модели Anthropic начали вшивать в текст секретные водяные знаки.

Текст можно переписать огромным числом вариантов, просто меняя синонимы. Теперь, модели выбирают эти синонимы не случайно, и в последовательности этих не-случайностей зашит сигнал, что текст сгенерирован нейросетью.

Лингвистическую стеганографию (тайное письмо за счет замены синонимов) обсуждали ещё в начале 2000-х, но в 2022 ученый из OpenAI описал, как это можно недорого сделать в нейросетях.

Такая маркировка начинает работать примерно со 150 слов, и не работает, если у модели недостаточно свободы в выборе синонимов — при генерации кода или таблиц с цифрами. Водяной знак переживает незначительную редактуру текста, но не серьезный рерайт.

В 2024 такую маркировку вшил в свои модели Гугл под названием SynthID, а закон ЕС требует маркировать контент, сгенерированный нейросетями, начиная со 2 августа 2026. 190 компаний уже подписали с Евросоюзом договор, как именно они будут реализовывать эту маркировку.

Для детектирования маркировки нужно знать секретный ключ (если все знают ключ — то маркировку очень легко стереть или подделать). То есть для проверки нужно будет загрузить свой текст производителю модели.

Это, наверно, моя личная штука, но я всерьез задумался о том, чтобы переключиться с API на локальный инференс, когда он станет достаточно хорошим. Просто неприятно, что модели будут заниматься этой фигней за мои деньги, вместо полезной работы.

Первая модель машинного обучения, распространение которой ограничивается в целях общественной безопасности. Иронично и, вместе с тем правильно, что её разработала некоммерческая исследовательская компания OpenAI, цель которой — «поиск безопасного пути к настоящему искусственному интеллекту», а один из создателей — Илон Маск. Этот фонд, в числе прочего, обучил машину очень хорошо играть в Доту.

На этот раз, речь о языковой модели, предсказывающей следующее слово в тексте. Система натренирована на 40GB текста из интернета, что примерно в 7500 больше, чем «Война и мир» (5.3MB).

Если подать ей на вход вопрос — она, скорее всего, допишет ответ. Если подать утверждение — то раскроет тему и предоставит доказательства.

Проблема в том, что она делает это слишком хорошо. Насколько хорошо, что при поверхностном прочтении может показаться, что сгенерированный текст имеет смысл. Не вдаваясь в философские дебри (в которых я не силен), возьмусь утверждать, что смысла там всё-таки нет.

Так в чем же опасность? Если обучить эту модель на отзывах в интернет-магазинах — можно генерировать очень правдоподобные фейковые отзывы в промышленных масштабах. Если обучить её на твиттере, фейсбуке или реддите — можно генерить вполне реалистичные твиты, посты и комментарии, прокачивать фейковые аккаунты и потом устраивать совершенно адские вбросы, рядом с которыми любые фабрики троллей — детский сад.

Стремно, что секретность в отношении этой конкретной модели защитит нас только от скрипт-киддисов (детей, ломающих сайты по шаблону) и то только на время. Нормальные бандиты, а уж тем более государства имеют достаточно ресурсов чтобы повторить и даже превзойти эти результаты в ближайшие годы. Будет как с шифрованием, которое пытались запретить, а теперь даже сердца в вотсапе кодируются при передаче так, что никто в мире не может их прочитать.

Помните, как раньше на сайтах были SEO-шные тексты в подвалах страниц, благодаря которым родилась присказка «SEOшник хуже пидораса…»? Их хотя бы было легко определить по виду, а в 2020 аналогичные тексты могут выглядеть неотличимо от полезной статьи.

До этого момента я не сильно верил в хайп «AI/ML это будущее», но теперь понимаю, откуда растут ноги уверенности руководителей Google, Microsoft и Apple. Будущее за ML и я не оптимистичен :(

Мета представила новую AI модель Llama 3.1 405B.

По качеству ответов она сравнима с лидерами — ChatGPT 4o от OpenAI и Claude 3.5 Sonnet от Anthropic (см таблицу).

При этом модель открытая, то есть:
— её можно дотюнить под свои нужды и предметную область; 
— не нужно отправлять никому свои данные;
— можно «дистиллировать» её в более компактные и эффективные модели;
— да ещё и сэкономить.

Марк Цукерберг выпустил программный текст, что будущее за открытым моделями. Он проводит аналогию с эпохой Unix-войн 80-90 годов, когда корпорации развивали коммерческие версии Unix, но победителем в результате стал Линукс.
Если в случае с Линуксом кажется, что эволюция произошла сама за десятилетия, то в этот раз Марк явно помогает процессу. Он работает с крупнейшими игроками — Amazon, Google, Microsoft, Oracle, Dell, Deloitte — над тем, чтобы эти огромные модели были доступны и в облаках, и на своем железе с первого дня после анонса.

Раньше мощный AI был доступен небольшой группе ведущих компаний и тем, кто пользовался их услугами по API. Кажется, что грядет великая демократизация, превращение AI в товар широкого потребления, строительный блок, почти как вычислительные ресурсы и программирование.
Эти модели обучали 72 дня на 16 тысячах картах Nvidia H100. Чтобы вы понимали, одна такая железка стоит 30 тысяч долларов, стоимость кластера — больше полумиллиарда долларов.
Если попытки Цукерберга захватить рынок VR у меня вызывали иронию, то в этот раз дух захватывает от размаха.

Интересно, что мы со всем этим богатством построим.

Пересел с Claude Code на Codex и модель 5.6 Sol от OpenAI.

Пишет короче и внятнее, чем Opus 5, почти без набивших оскомину конструкций «это не Х, это Y» и прочих. Заметно быстрее Claude Code.

Гораздо более крутая интеграция с Chrome (умеет сразу несколько профилей и управлять мышкой в фоне), и гораздо меньше блокеров типа «данные банковской карты я не буду вводить ни в каком случае, даже если это одноразовая карта с лимитом в 10 долларов».

А ещё он единственный смог найти по короткому описанию 20-летний мем, то есть интернет-поиск у него исключительно мощный.

Ощущение апгрейда в помощи с бытовыми задачами, как когда Opus 4.x вышел и внезапно стало можно прогать нормально с помощью нейросетей. Очень рекомендую.

Хакеры украли биткоинов на 70 млн долларов с холодных кошельков (считается самым безопасным способом хранения криптовалюты).

А все потому, что разработчик софта для определенной модели кошельков использовал плохой генератор случайных чисел для создания ключевых фраз, они получались недостаточно случайные.

В результате хакер просто перебрал все варианты и восстановил секретные ключи к кошелькам, сам вывод осуществили за 14 минут, чтобы никто не успел опомниться.

Отличный технический разбор от block.

Эту уязвимость находит любая современная нейросеть, достаточно натравить ее на исходники.

Раньше можно было сказать «в теории тут есть уязвимость, но никто в здравом уме не будет ее эксплуатировать, слишком сложно». Теперь ничего не сложно.

Интересно, сколько миллионов токенов сжигаются прямо сейчас с промтом «найди уязвимости во всех популярных крипто-проектах, не совершай ошибок»?

Учитывая, как быстро развиваются модели и харнесы, хорошо время от времени пробовать всех ведущих производителей. Но мне лень.

Зато каждый раз, когда Claude Code падает, я завожу Codex. Вот и теперь. Приятно удивлен тональностью и скоростью работы Sol 5.6

Рекомендую.

Upd: восстановили; не считают это падением, 🤡