502 и 504: кто именно не ответил и что чинить
Как диагностировать и устранять ошибки 502 и 504, чтобы восстановить работу серверной инфраструктуры
Уровни логирования: что писать, а что выключить
Как правильно выбирать уровни логирования и что писать в логах, чтобы быстро находить причины сбоев
Очередь между сервисами: когда она окупается
Модель расчёта в часах: когда очередь окупается, а когда никогда
Обратный прокси: что он решает и что ломает
Что он действительно снимает с приложения и что ломает молча
Образ, который собирается минуту вместо десяти
Время сборки определяется не объёмом работы, а тем, какая её часть выполняется заново. Одна перестановка строк даёт больше, чем подбор базового образа.
Деплой без кластера: что осталось живым
Что кластер даёт на самом деле, почему однонодовый вариант — тупик и как выкатывать сервисы через релиз-каталоги, атомарный симлинк и systemd
Golden path вместо документации
Почему документация гниёт, почему её нельзя спасти процессами и ревью, и как golden path делает стандартные операции исполняемыми
Своё железо под инференс: расчёт на три сценария
Пошаговая модель расчёта, которая покажет, когда свой сервер для инференса дешевле облака, если подставить ваш профиль нагрузки и тариф на электричество
Kubernetes на команду из двенадцати человек
Как на своих числах решить, нужен ли команде Kubernetes: сравниваем часы нынешней эксплуатации с налогом на обслуживание кластера
Стоимость владения кодом: что считать и что игнорировать
Как посчитать в часах, сколько труда съедает уже написанный код, — по горячим модулям и следам, которые система и команда оставляют сами
Платформенная команда: когда её заводить
Как посчитать на ваших числах, когда платформенная команда окупается, почему стандарты и одиночный инфра-инженер не спасают, и что проверить перед стартом
Алерты, на которые перестали смотреть
Почему дежурные рационально перестают читать канал алертов и почему подстройка порогов меняет частоту алертов, а не их применимость
OpenTelemetry: что стало стандартом, а что ещё нет
Разберёмся, какие слои OpenTelemetry действительно стали стандартами, а какие остаются удобным клеем, и почему граница проходит именно между ними
Как вообще узнают, что сайт сломался
Почему владелец узнаёт о поломке сайта последним, почему ручные проверки не помогают и как работает робот, который следит за сайтом вместо человека
Трассировка шагов вместо логов
Как заменить ленту логов на дерево шагов, чтобы видеть не только где упало, но и почему агент решил именно так
Что писать в трассировку, а что нет
Как проектировать трассировку под дежурного: какие поля писать в спанах, а какие выносить в архив, чтобы трейс сразу показывал, где сломался запрос