бенчмарк

Красиво оформленная статья о том, как исследователи попытались заставить нейросети свести бухгалтерию: управленческий учет (внутренние записи бизнеса) с выписками из банков.

Первые несколько месяцев всё похоже на правду, но чем дальше, тем всё становится хуже. Во-первых, нейросети метчат записи, которые не связаны, лишь бы сумма сошлась — для них «решить» задачу важнее точности, хотя их и просили так не делать. Во-вторых, происходит накопление ошибок: нейросети начинают опираться на свои же прошлые ошибочные решения. В общем, до человека даже ведущим моделям ещё далеко.

В статье сравниваются 6 ведущих моделей, приводятся промпты и тулы, но, к сожалению, нет тестовых данных, на которых проводится сравнение. Тем не менее, внушительный труд. Рекомендую.

Спасибо Игорю за наводку.

Мета представила новую AI модель Llama 3.1 405B.

По качеству ответов она сравнима с лидерами — ChatGPT 4o от OpenAI и Claude 3.5 Sonnet от Anthropic (см таблицу).

При этом модель открытая, то есть:
— её можно дотюнить под свои нужды и предметную область; 
— не нужно отправлять никому свои данные;
— можно «дистиллировать» её в более компактные и эффективные модели;
— да ещё и сэкономить.

Марк Цукерберг выпустил программный текст, что будущее за открытым моделями. Он проводит аналогию с эпохой Unix-войн 80-90 годов, когда корпорации развивали коммерческие версии Unix, но победителем в результате стал Линукс.
Если в случае с Линуксом кажется, что эволюция произошла сама за десятилетия, то в этот раз Марк явно помогает процессу. Он работает с крупнейшими игроками — Amazon, Google, Microsoft, Oracle, Dell, Deloitte — над тем, чтобы эти огромные модели были доступны и в облаках, и на своем железе с первого дня после анонса.

Раньше мощный AI был доступен небольшой группе ведущих компаний и тем, кто пользовался их услугами по API. Кажется, что грядет великая демократизация, превращение AI в товар широкого потребления, строительный блок, почти как вычислительные ресурсы и программирование.
Эти модели обучали 72 дня на 16 тысячах картах Nvidia H100. Чтобы вы понимали, одна такая железка стоит 30 тысяч долларов, стоимость кластера — больше полумиллиарда долларов.
Если попытки Цукерберга захватить рынок VR у меня вызывали иронию, то в этот раз дух захватывает от размаха.

Интересно, что мы со всем этим богатством построим.

Вот ещё прикольное сравнение, где модели, переходя по ссылкам в статьях, должны найти путь от одной страницы в википедии до другой (от бейсбола до солнца, например)

Конкурсы могут показаться смешными, но вообще выбрать один из нескольких вариантов — это то, на чём строится практически всё программирование. И до сих пор у нас был выбор либо жёсткие алгоритмы, либо тормозные, дорогие и галлюцинирующие LLM, которые для такого вида задач предрасположены плохо.

Круто, что есть люди, которые придумывают новые подходы, а не только масштабируют инвестиции и дата-центры. ⚡️

Вот тут мнение внешнего эксперта.