#сбой

15 постов
пост №2084

В Германии уже третий час не ходят поезда, упала специальная сотовая сеть GSM-R, которая поддерживает связь между машинистами и диспетчерами и обмен технической информацией между поездами. Чтобы не было столкновений, все поезда встали.

На немецком ЖД-реддите ходят слухи, что причина в кривом обновлении софта.

Я и не знал, что у поездов есть своя сотовая сеть из 90-х. У нас уже 5G, а поезда на 2G.

Вообще, в этом вся суть инфраструктуры: пока всё работает — никто не замечает. Я восхищаюсь инфраструктурой, и чем более базовая — тем круче. Надеюсь, когда-нибудь возьму интервью у инженера, который занимается водопроводом и канализацией.

P. S. Недавно узнал, как работали римские акведуки. Там, оказывается, вода становилась чистая за счет точно рассчитанного наклона трубы; вода течет медленно и вся грязь оседает, но и не слишком медленно, чтобы не застаивалась. 🪄

пост №1917

Большая часть облачных сервисов AWS лежала почти 3 часа. Если у вас глючили Слек, Зум, Сигнал и прочие — это всё от этого. Уже поднимаются. Официальный статус тут.

Как обычно, система поддержки AWS тоже легла. Говорят, что из-за проблем с DNS отвалилась база данных DynamoDB на восточном побережье США, ну а дальше эффект домино. Ждем официального post mortem.

Время шутки, что один сервак в hetzner может дать больший аптайм, чем вся современная облачная инфраструктура.

пост №1850

В 21:46 мск отказала большая часть гугловского облака GCP. Ходят слухи, что всё из-за одного ключевого технического внутреннего сервиса, но в результате в разной степени поломались гугловские продукты, вроде Cloud, Drive, Meet, Gmail.

Предположительно, из-за этого начал глючить Cloudflare, один из самых популярных CDN-провайдеров.

Дальше по цепочке легла половина интернета — Spotify, Discord, Snapchat и тысячи других. Особенно тревожно, что для многих людей сломался RCS — это протокол, продвигаемый Гуглом, который должен заменить смски.

Предвкушаю увлекательные постмортемы от Гугла и Cloudflare, последние уж точно не упустят шанса рассказать, что это было.

В тысячах инженерных команд по всему мира сейчас была жара — все тушили пожары. А завтра все сядут составлять списки, что нужно поменять, чтобы в следующий раз было не так больно. Так и живем.

P. S. Про одновременное падение Amazon Web Services — кажется дезинформация.

пост №1763

Windows-компьютеры по всему миру уходят в так называемый синий экран смерти — то есть перестают работать вообще. Нарушена работа магазинов, банков, авиакомпаний по всему миру.

Проблема в обновлении популярного корпоративного антивируса CrowdStrike, который используют 20% компаний из списка Forbes 500. Ошибка в обычной программе ломает только её саму, но это — антивирус, он имеет специальный уровень доступа к ядру и поэтому ломает систему до основания.

Производитель антивируса уже придумал, как вылечить заболевшие машины, но для этого требуется физическое присутствие технаря рядом с компьютером. Представьте, инженерам нужно прямо сейчас обойти ногами десятки, если не сотни тысяч компьютеров. А компьютеры сотрудников, которые работают из дома? Ад!

Можно своими глазами увидеть: 1) какие известные компании НЕ используют CrowdStrike (таких немного) 2) как это прокатывается волной по всему глобусу — технарь из Австралии пишет, что «у нас в магазинах всё только за наличку», а американец отвечает «у нас все пока спят, кроме тех, кого разбудили, чтобы это починить».

Это как шторм. Прямо сейчас ты ничего не можешь сделать, но с ужасом наблюдаешь за стихией и чувствуешь себя щепкой. Интересно, какое решение мы придумаем, чтобы такие ситуации больше не повторялись.

пост №1732

Фейсбук упал, так что если фб, инстаграм или даже вацап просят ввести пароль и говорят, что он неправильный — не спешите паниковать. Это техническая ошибка, уже почти час не могут починить.

Страница со статусом инфраструктуры ФБ тоже работает через раз — видимо, что-то серьезное.

Ходят слухи, что это может быть связано с подводным интернет-кабелем, который хуситы перерезали в красном море. С нетерпением ждем постмортем от мета-инженеров.

пост №1731

30 января на несколько часов сломались сайты .ru

Это произошло из-за проблем с DNS — одним из старейших протоколов интернета, которым мы пользуемся до сих пор.

Обсудили с сотрудником ICANN Мишей Анисимовым, как он устроен и что пошло не так. Слушайте здесь: Apple, Google, Яндекс, Spotify, Castbox, Overcast, веб-версия.

пост №1460

В облаке Amazon AWS опять проблемы и это задело Slack — популярный рабочий мессенджер, так что если он у вас глючит — «дело не в офисном интернете».

У всех крупных онлайн платформ есть так называемый Status page, в котором инженеры отражают «здоровье сервиса». Ходят слухи, что в Amazon инженеров наказывают за то, что их сервис отметился на этой странице. К чему это приводит — довольно очевидно. Вот ребята сделали юмористический и чуть более удобный «правдивый статус Амазона».

пост №1340

Половина сайтов в интернете не работают, потому что сломался один из крупнейших CDN — fastly.

Задело Амазон, Нетфликс, Бибиси, сайты правительств и многих других.

Через этот сервис сайты отдают статические картинки, файлы стилей и жаваскрипты.

Удивительная на самом деле ситуация: основные сервера всех сайтов кроме fastly работают отлично, но без картинок, стилей и скриптов, подгружаемых через fastly, пользоваться сайтами невозможно.

Отдаём мы эти файлы через fastly для того, чтобы они загружались у пользователей максимально быстро. У фастли тысячи серверов по всему миру, так что обычно, картинки через них отдавать в разы быстрее, чем самому.

В Fastly работают настоящие профи, так что будет очень интересно почитать, почему они так капитально сломались.

3 минуты назад написали, что нашли причину и чинят. Ждём.

Текущий статус тут https://status.fastly.com/incidents/vpk0ssybt3bj

пост №1251

Сервис общего редактирования документов и командной работы Notion упал из-за DNS. Что происходит пока не понятно, но 3 минуты назад они попросили у себя в твиттере «у кого есть контакты name.com». 😲

Текущая оценка Notion — 2 миллиарда долларов.

Upd: починили, ждем постмортем 🍿