DevOps FM
5.29K subscribers
745 photos
15 videos
10 files
854 links
♾️ Канал для тех, кто живёт слиянием разработки и эксплуатации (DevOps) и сис. администрированием.

Новости, статьи, практики, инструменты и развлекательный контент. Cloud Native, Docker, Kubernetes, БД, мониторинг и пр.

Анастасия @cryptographyinu
Download Telegram
Новостной дайджест от DevOps FM!

⌨️Делимся свежими новостями и релизами за прошедшую неделю.

Kubeflow получил статус CNCF Graduated.

Kubeflow получил высший статус зрелости в CNCF. Проект объединяет инструменты для построения AI/ML-платформ на Kubernetes — от подготовки данных и обучения моделей до inference.

Для DevOps это ещё один сигнал: Kubernetes всё активнее становится инфраструктурой для AI — от обучения моделей до inference и serving. Детали читайте в статье.

AWS продолжает развивать Argo CD в EKS.

В понедельник мы разбирали сценарий, где Git становится control plane для инфраструктуры и deployment. Теперь AWS расширяет возможности настройки управляемой Argo CD Capability в EKS — в частности, добавляет поддержку кастомных health checks и параметров сравнения ресурсов.

Похоже, AWS постепенно углубляет интеграцию GitOps с EKS, беря на себя всё больше операционных задач по управлению Argo CD. Подробнее — в блоге AWS.

IncidentRelay 2.0 — новый релиз self-hosted incident management.

Open-source проект для управления дежурствами, маршрутизации алертов и incident response получил новый major-релиз.

IncidentRelay ориентирован на SRE и DevOps-команды, которым нужна self-hosted альтернатива облачным платформам управления инцидентами.
Подробности о ключевых обновлениях и список основных изменений — читайте в OpenNET.

GitHub опубликовал разбор масштабного сбоя 17 августа.

Напомним, тогда GitHub был недоступен или работал с ошибками почти 8 часов. Теперь компания раскрыла детали: проблема с autoscaling Istio sidecar-подов привела к перегрузке сети и каскаду отказов.

Ситуацию дополнительно усугубили агрессивные retry: нагрузка на отдельные сервисы выросла многократно.

Получился отличный пример того, как ошибка в автоматическом масштабировании + retry storm могут превратить локальную проблему в большой outage.
Подробнее — в разборе GitHub.

#devops #инциденты #gitlab #kubeflow
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍43🔥2