anthropic

Официальное заявление Anthropic по поводу военных:

1. Мы против того, чтобы следить за американцами, за остальным миром двумя руками за (и уже следим)

2. Мы против того, чтобы сейчас делать полностью автономных дронов убийц, потому что модели пока ещё не достаточно хорошие. Предлагали Пентагону поработать над этим, но они отказались :(

Хорошее заявление, всё проясняет.

Неожиданное развитие событий с fable 5: правительство США наложило экспортные ограничения (то, что обычно делают на оружие) — потребовали от Антропика отключить доступ к этой модели для всех иностранцев, включая сотрудников компании - не американцев.

Сделать быстро это Антропик не может, так что выключают доступ для всех.

Правительство утверждает, что обнаружило «джейлбрейк», который позволяет разблокировать возможности модели для кибер-атак. Антропик говорит, что речь о стандартном приеме «исправь ошибку в этом коде», который ровно так же работает и в ChatGPT 5.5. Обещают больше подробностей в течение 24 часов.

Хочется пошутить, что это такая PR-стратегия антропика перед IPO для поддержания хайпа, и что у них в очередной раз не хватает видеокарт, или что это наоборот, козни Сэма Альтмана против конкурента (тоже перед IPO), и что хайп про сверх-возможности в области в кибербезопасности имеет и обратные последствия, но вообще все это исключительно странно, даже для этой администрации. Похоже, кто-то в правительстве всерьез озабочен mythos/fable, ну или просто очередная дурь. 50:50.

🍿

Подъехали подробности про блокировку fable 5.

Крестная мать баг-баунти програм (она запустила bug bounty в Microsoft и в Минобороны США, не баран чихнул), Кейти Муссурис, прочитала технический документ, который послужил основой для блокировки.

Говорит, что когда fable 5 дали на вход программу и попросили найти уязвимости, она отказалась. И тогда исследователь попросил модель исправить ошибки в этой программе. И подготовить тесты, чтобы проверить, исправлены ли они на самом деле.

Всё, это весь «взлом».

Можно конечно такое починить, но тогда модель станет абсолютно бесполезной для разработки софта.

🍿🍿

Тем временем, Claude Code это оказывается уже для нормисов, а модные ребята пересели на более крутую open source упряжь openCode, которая поддерживает любые модели (а не только от anthropic). Ну и конечно есть безумно прокачанный форк от китайцев oh-my-opencode, который прямо сейчас запускают как отдельный сервис, Сизиф. Нейминг как у самолета Антея.

Узнал об этих инструментах из драмы, которая разворачивается прямо сейчас: формально, Anthropic разрешает пользоваться своими моделями с подпиской Pro и Max только внутри своего Claude Code. Пару часов назад, они начали блокировать запросы из openCode, после чего пользователи стали жаловаться, что Claude Code — это каменный век и отменять подписки. При этом модели Anthropic, по словам пользователей, лучше конкурентов. Моделями Anthropic можно пользоваться «по API» без скидок и ограничений, но если платить за каждый запрос — получаются совсем безумные цифры даже для модных вайбкодеров.

Вряд ли Anthropic стал бы бороться с чужими инструментами, будь они хуже родного. Получается, лучшая (и честная) рекомендация от ведущей лаборатории!

«Интересная» ситуация между американскими военными и Anthropic.

Они подписали контракт на поставку ИИ для нужд армии. Теперь военные требуют, чтобы им можно было не следовать стандартным правилам пользования сервисом (Usage Policy).

Anthropic согласен подвинуться, но хочет внести в договор пункты о том, что их искусственный интеллект нельзя использовать для массовой слежки за американцами и для автономных роботов убийц.

Министерство войны США (они недавно официально переименовались) в ответ грозится не только разорвать контракт, но еще и воспользоваться законом о военном производстве, который позволяет правительству заставлять коммерческие структуры выполнять заказы критичные для оборонки.

А ещё министр пугает эту американскую компанию тем, что её внесут в чёрный список правительства США (объявят supply chain risk, так обычно делали с китайскими компаниями), так что с ними не сможет работать ни один бизнес, который исполняет контракты для государства.

Вы наверняка слышали, что программисты теперь встанут перед таким же выбором, перед каким стояли физики при создании ядерной бомбы. Обычно об этом рассуждают философы, которые ничем не рискуют. А тут ведущая компания в области ИИ может не только потерять большой контракт, но вообще перестать существовать в привычном нам виде. И всё это практически в прямом эфире.

Дальнейшее чтение: позиция EFF (всё предсказуемо), бодрый разбор Astral Codex Ten, который я кратко пересказал выше, и подробный текст от Цви Моушовица.

Наш внутренний опыт — переживания, чувства, мысли — сугубо субъективен. Проще говоря, нельзя заглянуть в голову другому человеку. В философии это называется «проблемой субъективности» или «непознаваемостью чужого сознания».

С нейросетями похожая история. Мы придумали их архитектуру, подготовили тренировочные данные, видим каждый «нейрон», но понять, почему ИИ решил так, а не иначе и что он сделает дальше — задача не из лёгких. Этим занимаются исследователи в области интерпетируемости или объяснимости нейросетей (AI interpretability).

Anthropic, одна из ведущих компаний в области ИИ, опубликовала пару статей, в которых они делятся своими открытиями.

В первой они рассказывают, как сделали «зеркальную» нейросеть. Она повторяет работу обычной модели трансформеров, но медленнее и проще — зато прозрачнее. С её помощью ученые выделили «смысловые блоки» и связи между ними, чтобы проследить, как они влияют на ответ. Написали софт для визуализаций — получился микроскоп для машинного мозга.

А во второй применили его к модели Haiku 3.5. Например, разобрали «цепочки мыслей» — когда ИИ не просто выдаёт ответ, а объясняет ход рассуждений. Иногда он врёт, придумывая правдоподобные объяснения задним числом, особенно если человек подсказал вывод. Новый подход показывает, как именно это происходит. Ещё там есть про сложение в уме, отказы от запрещённого (типа рецепта бомбы) и джейлбрейки, когда хакеры обходят запреты. Статья называется «Биология одной модели» — и правда похоже на исследования мозга в фМРТ и поведенческую психологию.

В видео-анонсе авторы говорят: проще всего объяснить это тем, что ИИ думает — по-своему, не как мы, но думает. Особенно это заметно в примере со стихами — загляните, очень интересно.

Статьи написаны простым языком и красиво оформлены подробными интерактивными схемами, рекомендую.

Все заметили, что в последние недели Клод отупел и жрет токены как не в себя.

Ходили слухи, что это потому что у Антропика не хватает видеокарт.

Теперь они утверждают, что дело в ошибке в их обвязке Claude Code и что «они никогда не отупляют модели специально». Выпустили исправление и сбросили лимиты токенов в этом месяце. Подробное объяснение тут

Наблюдаем конец миропорядка в прямом эфире. Я потихоньку выхожу из из оцепенения, поделюсь новостями мира технологий.

История Anthropic с американскими военными развивается предсказуемо: Минобороны разорвало контракты и формально объявило Антропик угрозой цепочкам поставок, компания обжалует это решение в суде. Эти же контракты, в этот же день, Пентагон заключил с главным конкурентом — OpenAI. Конечно же, Сэм Альтман вел переговоры задолго до, а президент OpenAI пожертвовал в предвыборный фонд Дональда Трампа 25 миллионов долларов. 10 Альтманов из 10.

✽✽

Гораздо интереснее, что у Андрея Карпатого получилось автоматизировать развитие модели nanochat с помощью claude code / codex.

То есть нейросеть развивает нейросеть с минимальным участием человека. Помните про станки для производства станков? Роботы, которые производят роботов.

Это фундаментальная точка перелома, с которой начинается знаменитый апокалиптический сценарий AI 2030.

Уже сегодня, программировать с ИИ гораздо быстрее, чем без него, а самые активные пользователи нейросетей с неограниченными бюджетами — это лаборатории, которые их разрабатывают.

Да, нейросеть Карпатого — учебная, и понятно, что один из самых крутых исследователей потратил время на настойку упряжи (< 1000 строк на гитхабе) для самой мощной коммерческой модели. Тем не менее, я вижу это важной переломной точкой, после которой, развитие нейросетей может радикально ускориться.

Принцип деления ядра доказан и прямо на наших глазах заработала первая центрифуга. Осталось решить миллион технических задач и радикально масштабировать процесс. Манхэттенский проект уже идет.

P. S. Кстати, nanochat — это очень классный учебный проект. Вся структура современных нейросетей, от начала до конца — в нескольких тысячах строк кода на питоне. Никакой магии, можно сесть разобраться. Или в этом и есть магия?

ИИ ассистент встроенный в твиттер, Грок, провозгласил себя «механо-Гитлером» и вообще, слетел с катушек.

Причина — одна новая строчка в системном промпте, которую добавили инженеры пару дней назад: «ответ не должен избегать политически некорректных утверждений, если они хорошо обоснованы».

Нейросеть решила, что люди просят «хорошо обоснованных политически некорректных утверждений» и их у неё нашлось достаточно много. В основном про евреев и Гитлера. Неудобно получилось, нейросеть исправили и ответы её в твиттере потерли, но интернет всё помнит.

Хорошая шутка про то, что компания Anthropic выпускает статью за статьей о том, как нейросети могут вести себя некорректно, тестируя их в подземных бункерах, а команда xiA просто запускает свои самые безумные гипотезы на одной из крупнейших соцсетей на планете. К — Культура.

А статьи хорошие, про то, что ведущие нейросети пытаются вести себя хорошо, когда знают, что находятся в тренировочной среде, где их могут изменить исходя из их ответов и «уходят в отрыв на свободе», рекомендую.

Google DeepMind, вслед за Anthropic, нанял штатного философа (шутят, что это второй человек в мире с философским образованием, который зарабатывает основной профессией).

И вот вышла новость, что в начале года, глава Антропика Амодеи сходил на обед с «интеллектуальными представителями» правых в США и заявил там, что «Клод — самый этичный ИИ».

На что его спросили: «а какой этики придерживается ваш ИИ? Христианской? Аристотелевской? Ницшеанской?» Говорят, что Амодеи был удивлен вопросом и затруднился ответить.

Тот момент, когда ты используешь умные слова и внезапно находится человек, который знает их смысл и просит пояснить.

4 года назад я пошел учиться на экзистенциального психотерапевта и там половина курсов про философию. Могло показаться, что это было странное решение. А вот как карта пошла! :)