авария

Лучшая система онлайн-опросов и онлайн-форм Typeform полегла, не работают ни формы, ни админка. Пишут, что знают о проблеме и чинят. Имейте в виду, если у вас на него процессы завязаны.

Слек сегодня глючил весь день - это у них проблемы, а не с вайфаем в офисе. Уже 6 час не могут починить.

Классная формулировка на странице статуса: «Though we saw signs of improvement earlier, unfortunately the fix we had in mind didn't do the trick.»

«Казалось, дело идёт на поправку и мы нашли решение, но оно не сработало. Работаем дальше.»

Спасибо Александру Арбузову за наводку в чате.

Клиент поделился, что у них в дата-центре выбило электричество, а дизель-генератор выключился из-за жары. Результат — серьезный простой продакшена. Всё бы ничего, но это клиент, у которого я только что закончил аудит и на то, что у них свой ДЦ я достаточного внимания не обратил 🙈

ОК, добавляем пункт «аудит ДЦ, если он не дай бог не Tier 3» в чеклист.

Чеклист аудита написан деньгами, прямо как техника безопасности — кровью.

Гугл опубликовал публичный постмортем про воскресную аварию. Текст длинный, но суть простая: у них ломается сеть, если специальная программа не подвозит правильную конфигурацию сети (BGP) каждые пару минут. Несколько копий этой программы запущены на отдельных серверах в каждом дата-центре (отказоустойчивость!). Эти серверы включает-выключает другая программа управления конфигурацией. Во второй программе была ошибка, из-за которой она выключила все копии первой программы. Через пару минут после этого протухли BGP-анонсы и развалилась сеть.

Из-за сломанной сети были недоступны внутренние инструменты, которыми пользуются сисадмины при исправлении проблем. Гугл говорит, что у них есть специальные бункеры с какими-то особыми доступами, но пока админы туда доехали — прошло дополнительное время. Самое главное, что система конфигурации потеряла своё внутреннее состояние и админам пришлось заново настраивать всё руками — это заняло очень много времени.

Чинят тем, что 1) запретят подсистеме выключения задач тушить сразу несколько серваков 2) система не будут терять состояние при потушенных серверах (не придется настраивать её заново руками) 3) сеть будет дольше работать без внешней поддержки программой управления (самое очевидное решение).

Не постесняюсь ещё раз напомнить, что бэкапы нужно держать у второго провайдера и регулярно тестировать восстановление.

Пока московская часовая зона спала, ютуб успел полежать с 4:41 до 6 утра — 1ч и 21м, если верить официальному аккаунту. Никогда такого не видел. Интересно узнать, что у них там случилось; пока подробностей 0. Если бы был такой тотализатор — я бы поставил на то, что опять сеть упала из-за ошибок конфигурации.