авария

Ходят слухи (пикабу, хабр), что Яндекс вчера случайно удалил виртуальные серверы клиентов в своем облаке (человеческий фактор).

Это отличное напоминание настроить бекапы (если вдруг их нет) и проверить, как работают процедуры восстановления.

Я не собираюсь шеймить яндекс за потерю данных клиентов — технических проблем в любом сложном проекте не избежать. Разбираться с такими ситуациями и улучшать системы по полученным урокам — часть нормальной работы. Если система построена правильно, то вероятность аналогичной аварии в будущем сильно упала.

Внушают опасение слухи, что клиентам написали письма о проблеме только через несколько часов и никакой публичной реакции Яндекса на ситуацию до сих пор нет.

Интересно, там было затронуто так мало машин, что они не видят видят причин официально комментировать? Классическое «это затронуло 0.004% клиентов и вот что мы сделали, чтобы такого больше не случилось» — тоже часть работы.

Basecamp уже несколько часов в read-only. У чуваков переполнились первичные ключи в таблице в базе (были в int, нужно было bigint).

Работы всё ещё идут, но они ведут идеальный status report и уже написали два детальных объяснения (сначала покороче и потом подлиннее), что идет не так, почему так получилось и что они делают для починки. ИДЕАЛЬНО.

30 января на несколько часов сломались сайты .ru

Это произошло из-за проблем с DNS — одним из старейших протоколов интернета, которым мы пользуемся до сих пор.

Обсудили с сотрудником ICANN Мишей Анисимовым, как он устроен и что пошло не так. Слушайте здесь: Apple, Google, Яндекс, Spotify, Castbox, Overcast, веб-версия.

Очень неприятная история с потерей данных на гитхабе.

Если у вас активная разработка и пул-реквесты конкурируют между собой при мерже в main, то гитхаб предлагает решить это через merge queue, который мержит PR-ы по очереди.

Так вот из-за бага в коде, часть ранее замерженных коммитов пропадала из main в течение четырех с половиной часов начиная с 2026-04-23 16:05 UTC.

Страшно представить, как такое дебагать.

И как вообще вести разработку, если не можешь доверять системе контроля версий, что она не потеряет коммиты? 🤷‍♂️

Уверен, что по всему миру инженеры думали, что сходят с ума.

Ну а дальше github предлагает исправлять это руками... Sic transit gloria mundi

Стремная автономная система из России анонсировала 80 префиксов таких компаний как Google, Apple, Facebook, Microsoft, Twitch и Riot Games. Вчера утром было два инцидента длительностью 3 минуты, роуты успели утечь в некоторые крупные провайдеры, так что часть трафика этих компаний какое-то время ходила через Россию. Почему такое возможно я объяснял на пальцах вот тут. Тот случай, когда «ночью наши учёные чуть-чуть изменят гравитационное поле Земли...»

Удивительно наблюдать, как гиганты (не)справляются с вайб-кодингом:

Github потерял последнюю девятку в своем SLA. Отдельно замечу, что status page вендоров уже давно нельзя верить и вот люди собрали собственный, народный.

Амазон был вынужден сильно замедлить выкатку фич после падений и теперь требует сениор-ревью перед релизами.

Хотя казалось бы, уж у них-то должны быть и автоматизированные тесты и легион ручных QA-инженеров!

Вот целый список подобных падений, с оценкой, сколько пользователей они задели.

С одной стороны, нужны нормальные процессы, чтобы слоп не лез в продакшен и были хотя бы пара живых людей, которые понимают, что там происходит под капотом в сложной системе.

С другой стороны, мы сейчас во временном переходном периоде, когда ещё есть программисты, которые не умеют ставить задачи (хотя и умеют писать код самостоятельно) и с этим нужно что-то делать.

В общем, быть техдиром опять становится интересно.

В Канаде авария у крупнейшего интернет-провайдера Rogers, интернета (а в некоторых случаях даже телефона) нет у десятков миллионов клиентов. Причины аварии пока неизвестны. Надеюсь, хоть тут обошлось без русских хакеров.

Если у вас не открываются какие-то западные сайты и приложения (привет, hackernews) — это может быть связано. Наши клиенты из Канады просто написали «мы сегодня оффлайн».

Прямо сейчас Rogers пытается купить другого крупного канадского провайдера, Shaw Communications, за 20 млрд канадских долларов. Интересно, повлияет ли авария на сделку, не вмешаются ли регуляторы — уж больно показательная история.

«В России второй день не выдают права и не регистрируют автомобили. Серверы ГИБДД залило водой».

Во первых, помещение для серверов, которое залило водой — в 2021 году звучит как нонсенс. Современный дата-центр — это не амбар, в котором серверы стоят под трубами с водой и потолок протекает. Рекомендую эпизод нашего подкаста про дата-центры, чтобы стало понятно, почему это звучит как бред.

Во вторых, у подобных систем обязаны быть чётко прописанные процедуры восстановления из бэкапов, то есть запасных копий данных. Что не менее важно, эти процедуры проверяют в ходе регулярных «учений». Если вы подобных учений не проводите — хороший повод начать.

У Амазона лежал сайт сразу после начала дня скидок Prime Day. Тонны денег вложены в рекламу, за 40 часов Амазон планирует продать товаров на 4 миллиарда долларов и сайт сломался. Не боги горшки обжигают.

Жаль, что post mortem вряд ли появится в публичном доступе :(

Подробная и полезная статья, как один стартап боролся с мощной DDoS атакой.

История очень хорошо написана. Например, число одновременных соединений они измеряют в подписчиках твиттера Джастина Бибера. Почитайте, оно того стоит.

Практическое: они жили на AWS и подключили услугу AWS Shield Advanced — это когда anti-DDoS специалисты амазона помогают разобраться с вашей конкретной атакой. Стоит 3k$ в месяц, договор на год. Чувакам очень понравилось, и я возьму на заметку.