Библиотека девопса | DevOps, SRE, Sysadmin
10.4K subscribers
2.04K photos
83 videos
13 files
3.51K links
Все самое полезное для девопсера в одном канале.

Наши курсы: https://clc.to/ZJ7Z1w

По рекламе: @proglib_adv

Для обратной связи: @proglibrary_feeedback_bot

РКН: https://gosuslugi.ru/snet/6798b4e4509aba56522d1787
Download Telegram
💡 Почему облака ломаются: главные выводы отчётов за 2026 год

IncidentHub изучил более 30 тысяч сбоев у 1082 облачных и SaaS-провайдеров за первую половину 2026 года. Больше всего инцидентов пришлось на облачные платформы и инструменты разработчиков.

🔴 Один из главных выводов: плохие изменения распространяются по инфраструктуре так же быстро, как хорошие.

В распределённых системах новая конфигурация может за минуты попасть во все регионы и сервисы. Но откатить её часто сложнее: нужно понять причину, остановить распространение и вернуть систему в стабильное состояние.

Параллельно Uptime Institute отметил ещё несколько тенденций:

🔹 сети стали причиной 23% IT-сбоев и обогнали проблемы с электропитанием;
🔹 человеческий фактор участвовал в 92% значимых инцидентов;
🔹 физическая инфраструктура дата-центров становится надёжнее, но зависимости между сетями, облаками и внешними сервисами усложняются.


🔴 Отдельный риск — GPU-кластеры. Во время обучения моделей тысячи ускорителей могут одновременно резко увеличить потребление энергии. При переключении дата-центра на резервное питание такой скачок создаёт нагрузку, на которую старые схемы резервирования могли быть не рассчитаны.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека devops'a

#локализация
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2
🌍 us-east-1 снова лёг. Значит ли это, что пора переходить на multi-region?

Несмотря на статус самого крупного региона AWS, именно us-east-1 регулярно оказывается в центре крупных инцидентов. В июле проблемы затронули Lambda, CloudFormation и Management Console. В отчёте IncidentHub за H1 2026 этот регион снова оказался лидером по суммарному времени недоступности.

Построение multi-region повышает отказоустойчивость, но за это приходится платить: сложнее архитектура, дороже инфраструктура, труднее поддержка и деплой.

А как у вас:

👍 Уже работаем в нескольких регионах
🔥 Планируем переход
🤔 Пока хватает одного региона — риски оправданы

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека devops'a

#холиварня
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥1🤔1
Куда на самом деле уходят токены во время агентного кодинга? 😧
Please open Telegram to view this post
VIEW IN TELEGRAM
😱 Знакомо? Лимит уже закончился, а задача всё ещё не готова. Часть токенов могла уйти на повторное чтение файлов, лишний контекст и неудачные попытки.

⚡️ Этому посвящён отдельный блок курса «ИИ для разработчиков». Вы разберёте расходы на собственных проектах, сравните подходы и найдёте места, где агент выполняет лишнюю работу.

В итоге станет понятнее, сколько ресурсов выделять на запуск, когда его останавливать и в какой момент лучше изменить подход 🔍


До 31 июля курс можно купить со скидкой, а все материалы останутся в бессрочном доступе.

🔗 Узнать подробности о курсе

🏃‍♀️ Proglib Academy
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
🔐 Как не пропустить истечение сертификата

Истёкший сертификат может остановить сервис. Чтобы этого не произошло, достаточно настроить пару простых проверок.

➡️ В Kubernetes (cert-manager)

Проверить сертификаты:


kubectl get certificates -A


Если используете kube-prometheus-stack, можно добавить алерт:


- alert: CertExpiringSoon
expr: certmanager_certificate_expiration_timestamp_seconds - time() < 7 * 24 * 3600


➡️ Для внешних сервисов

blackbox_exporter умеет проверять срок действия SSL-сертификатов. Используйте метрику:


probe_ssl_earliest_cert_expiry


и настройте алерт, например за 30 дней до истечения.

📌 Хорошая практика:

🟡 Warning — за 30 дней.
🔴 Critical — за 7 дней.

Автоматическое обновление сертификатов — это хорошо. Но мониторинг нужен, чтобы вовремя узнать, если автоматизация не сработала.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека devops'a

#арсенал_инженера
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Что делает ConfigMap в Kubernetes?

👾 — Управляет сетевым трафиком
👍 — Хранит большие наборы данных
🥰 — Управляет секретами приложений
⚡️ — Отделяет конфигурацию от кода приложения

Библиотека задач по DevOps
38👍2😢1👾1
🤔 Вопрос от подписчика: как обновляете stateful-приложения без downtime?

Со stateless всё относительно просто — rolling update обычно хватает.

А вот со stateful начинаются нюансы:

— миграции БД;
— WebSocket и gRPC-соединения;
— rollback;
— совместимость старой и новой версии.


Кто-то использует Blue-Green, кто-то expand/contract для миграций, кто-то вообще предпочитает небольшое окно обслуживания вместо усложнения инфраструктуры.

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека devops'a

#dev_null
Please open Telegram to view this post
VIEW IN TELEGRAM
5🌚1
Кажется, у онлайн-обучения появился формат, которого давно не хватало 👇
🤔 У большинства разработчиков уже есть подписки на IDE, GitHub Copilot, Claude, ChatGPT или облачные сервисы.

Логично, что обучение тоже постепенно приходит к той же модели: не покупать отдельный курс под каждую новую тему, а иметь доступ ко всей библиотеке и выбирать, что актуально именно сейчас.


Такой формат недавно появился и в Proglib Academy. Вместо одного курса — доступ сразу ко всей библиотеке и новым материалам, которые появляются в подписке 😎

🔗 Подробнее

🏃‍♀️ Proglib Academy
Please open Telegram to view this post
VIEW IN TELEGRAM
0️⃣ Калькулятор для сравнения облака и собственной инфраструктуры

Когда нужно решить, где разворачивать инфраструктуру — в облаке или на своих серверах — начинается головная боль. Цифры нужны точные, но переменных слишком много: железо, электричество, зарплаты, лицензии, безопасность. Excel быстро превращается в хаос.

InfraWise — открытый инструмент, который считает полную стоимость владения (TCO) для облачной и on-premise инфраструктуры.

🔵 Он учитывает больше 80 параметров: от стоимости электроэнергии и GPU до затрат на compliance: SOC 2, HIPAA, GDPR и человеческие ресурсы.

Инструмент строит прогнозы на несколько лет вперед с учетом инфляции и роста нагрузки, показывает точку безубыточности, разделяет капитальные и операционные расходы, визуализирует данные интерактивными графиками и предлагает готовые пресеты для стартапов, средних компаний и энтерпрайза.


➡️ Посчитать затраты

📍 Навигация: ВакансииЗадачиСобесы

🐸 Библиотека devops'a

#арсенал_инженера
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
☁️☁️☁️☁️☁️☁️☁️

24 сентября Yandex Cloud проведёт Yandex Scale 2026 — флагманскую технологическую конференцию, посвящённую облачным технологиям, инфраструктуре и искусственному интеллекту.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
В программе четыре продуктовых трека — AI, Data, Security и Hybrid Infrastructure & DevOps, — и отдельный углублённый технологический трек DeepTech, который пройдёт только онлайн.

В треке Hybrid Infrastructure & DevOps откроем программу рассказом про главные инфраструктурные анонсы и новинки 2026 года. На примере Stackland расскажем, как построить свою внутреннюю платформу по методологии Platform Engineering и ускорить time to market. Разберём, зачем бизнесу кластеры Yandex Managed Service for Kubernetes на тысячи нод — на реальном продакшн-кейсе Mindbox. Расскажем, как получить предсказуемую и безопасную ИИ‑разработку с ИИ‑командой на платформе SourceCraft и максимизировать возврат инвестиций от ИИ. Разберём возможности построения реальной гибридной инфраструктуры на базе единой технологической платформы и то, как полноценно объединить локальную и облачную среды, включая выделенные серверы BareMetal. И на примере крупного банка рассмотрим, как создать полноценный гибрид, соблюдая требования безопасности, регуляторов и бизнеса одновременно.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨
Отдельно пройдут воркшопы по Hybrid Infrastructure & DevOps. Смоделируем аварию на физическом сервере и проверим, как гибридная архитектура на облаке и BareMetal держит отказоустойчивость. Научим разворачивать корпоративную ИИ-систему с RAG-сценарием на Yandex BareMetal и Stackland — чтобы модель работала с внутренней документацией и базами знаний. Разберём, как эффективно делить GPU-ресурсы Yandex Managed Service for Kubernetes между параллельными задачами обучения моделей. И покажем, как команда ИИ-агентов SourceCraft проходит путь от бизнес-требований до безопасного релиза — с проверкой на уязвимости на каждом шаге.

🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨
🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨

На конференции будут не только треки — ещё демозоны, питчинг решений, IT-квест и мерч. Параллельно в онлайн-студии — розыгрыш призов и секретный гость.


Программа целиком — на сайте конференции, регистрация там же, а участие бесплатное!
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1🌚1