DevOps FM
5.29K subscribers
742 photos
15 videos
10 files
851 links
♾️ Канал для тех, кто живёт слиянием разработки и эксплуатации (DevOps) и сис. администрированием.

Новости, статьи, практики, инструменты и развлекательный контент. Cloud Native, Docker, Kubernetes, БД, мониторинг и пр.

Анастасия @cryptographyinu
Download Telegram
От надежности CI/CD до задач Kubernetes – на митапе Спортс"

Не успели отойти от встречи на DevOps Lab, как уже Спортс" приглашает инженеров поговорить об инфраструктурной безопасности в эту пятницу.

В программе четыре доклада:

• как защитить GitLab Runner
• в чем особенность CDN и что учесть при миграции инфраструктуры
• опыт внедрения ArgoCD и GitOps
• запуск GPU-задач в Kubernetes на нестандартном железе

📅 10 июля, 18:30
📍 Онлайн

➡️Полная программа и другие подробности — по ссылке. А зарегистрироваться можно – здесь.

#партнёрский_пост
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍74🔥4
Новостной дайджест от DevOps FM!

🔔Выходим в эфир с подборкой новостей и практических разборов.

В блоге Sysdig опубликовали отчёт по безопасности. В июне среди причин инцидентов выделили ошибки конфигурации, свободный доступ к открытым ресурсам в облаке.

Также в отчёте разобрали атаки от 8 июня на Tchap с кражей 13,5 ГБ данных, и от 11 июня с выводом 1,3 ТБ данных. В первом случае в открытый доступ попали email-адреса и сведения об организациях более 73 тыс. из 600 тыс. учетных записей. Детали отчёта – здесь.

В понедельник вышел релиз OpenSSH версии 10.4. Из нового добавили экспериментальную поддержку схемы подписи ML-DSA 44 + Ed25519, включили реализацию на основе NFA и ужесточили требования к протоколу SSH при обмене ключами. Усилили безопасность и устранили уязвимости в ssh(1), sshd(8), scp(1) и sftp(1). Подробнее об улучшениях – тут.

С релизом Docker Desktop 4.81.0 от 6 июля обновили Docker Compose до версии 5.2.0 и Docker Scout CLI v1.22.0. Также внесли исправления для работы с kind-кластерами, улучшили загрузку образов и устранили проблему с остановкой контейнеров. В новой версии Docker Desktop учитывает заданные таймауты вместо принудительного завершения через 1 секунду. Все изменения – здесь.

На портале FreeCodeCamp вышла статья о включении политик нулевого доверия в Kubernetes. Дестини Эрхабор подробно разбирает идентификацию рабочих нагрузок через SPIFFE, SPIRE и Cilium.

На примере Kind-кластера он показывает, почему традиционные политики безопасности, не работают в динамической среде Kubernetes, а также объясняет, как Cilium реализует аутентификацию (mTLS) без Sidecar. Демо – тут.

На Info Q Мэтт Сондерс разобрал архитектуру HubSpot и рассказал, как компания масштабировала платформу семантического поиска до 20 млрд векторов.

Внутренняя платформа Vector as a Service (VaaS) работает поверх Qdrant и обеспечивает контроль доступа, версионирование данных и сбор обратной связи. Сейчас система обслуживает 38+ команд, включает 200+ индексов, 140+ кластеров в пяти регионах и двух окружениях, а пиковая нагрузка достигает 100 тыс. запросов в секунду.

Как HubSpot сократил время запуска кластеров с Kubernetes Operator читайте – здесь.

#новостная_подборка #devops #kubernetes #openssh #zerotrust
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍53🔥3
🚨 Что убивает этот под разбор инцидента

Всем DevOps! В конце недели подготовили для вас кейс прямиком из производственной среды.

После выката нового ML-инференс-сервиса в Kubernetes поды один за другим уходят в CrashLoopBackOff. На первый взгляд кажется, что проблема в приложении. Но все ли так очевидно?


STATUS: CrashLoopBackOff


При этом в событиях Kubernetes видно:


Liveness probe failed:
connect: connection refused


А в логах контейнера:


Starting model server...
Loading model weights...
Loaded shard 1/4
Loaded shard 2/4
<SIGTERM received, shutting down>


И фрагмент Deployment:


livenessProbe:
initialDelaySeconds: 10
periodSeconds: 5
failureThreshold: 3


👨‍💻Что здесь происходит? Почему сервис так и не успевает запуститься и оказывается в бесконечном CrashLoopBackOff?

Голосуйте в опросе ниже ⬇️

#devops #kubernetes #k8s #разборинцидента
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥4👍32💅1
🚨 Что убивает этот под разбор инцидента

Разрешение инцидентов в производственной среде с участием агентов — задача со звёздочкой даже для опытных инженеров. На DevOps Lab мы подробно разобрали сценарии работы ML-сервисов. Показываем, как исправить конфигурацию ⬇️

Добавьте startupProbe с запасом на время загрузки модели:


startupProbe:
httpGet: { path: /health, port: 8080 }
periodSeconds: 5
failureThreshold: 30 # 30 × 5 = 150 секунд на загрузку модели


👀Если хотите глубже разобраться в теме, оставили записи всех выступлений DevOps Lab:

«Запуск приватных LLM в Kubernetes» — Пётр Рукин
😉 Youtube
🥰 Rutube
😄 VK

«AI-агенты как второй DevOps» — Евгений Дехтярёв
😉 Youtube
🥰 Rutube
😄 VK

Желаем хороших выходных, а дежурным – спокойных смен!

#devopslab #ИИ #агенты
Please open Telegram to view this post
VIEW IN TELEGRAM
👍43🔥3
10 ошибок в CI/CD, которые замедляют работу инженеров

🔔В этот солнечный понедельник подготовили для вас подборку ошибок, собранную инженером портала DevOps.

Процессы непрерывной поставки связаны с эффективной работой пайплайнов. По мере роста числа репозиториев и циклов тестирования процессы СI/CD, которые работали на старте проекта, требуют инфраструктурных изменений.

В статье автор собрал 10 типичных ошибок в организации CI/CD. Вы узнаете, почему монолитные пайплайны приводят к росту времени сборок и как неправильная стратегия тестирования зависимостей и окружений влияет на стабильность доставки.

Какие ошибки вы бы добавили в этот список?

#devops #ci_cd #лучшие_практики
Please open Telegram to view this post
VIEW IN TELEGRAM
26👍4🔥3
👨‍💻Как сэкономить время на интеграционном тестировании с 28 до 17.5 с?

Рассказали инженеры CoreInfra ⬇️
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥43👍2
Forwarded from CoreInfra
Некоторое время назад я запустил autoresearch на задаче по ускорению тестов. Неожиданная находка: мы упирались не в сами тесты, а в путь до базы через порт-форвардинг докера. Изменение только этого ускоряет локальный прогон интеграционных тестов на macOS в полтора раза: 17.5 s против 28 s

Мы использовали Docker в Colima, а с Postgres, запущенным напрямую, каждый запрос к базе почти в 4 раза быстрее: ~0.1 мс против ~0.4 мс. Эти 0.3 мс уходят на SSH port-forwarding: host → SSH-туннель → VM → контейнер. А интеграционные тесты — это десятки тысяч последовательных запросов, так что 0.3 мс превращаются в +10 секунд.

Вывод: для локальной разработки лучше нативный Postgres. Если докер обязателен — Docker Desktop заметно лучше Colima: у него порт пробрасывается через vmnet, а не SSH.

Постфактум нашёл, что есть опция заменить ssh на grpc, но это все равно медленнее Docker Desktop 0.28 мс против 0.20 мс
colima start --port-forwarder grpc

@razmser
1🔥43👍2
Новостной дайджест от DevOps FM!

⌨️Делимся свежими новостями, туториалами и разборами инженерных практик.

Microsoft выкатили патч с рекордным числом исправлений.

Вчера, 14 июля, компания представила релиз с 570 фиксами ОС Windows, обнаруженных искусственным интеллектом. Из них устранили 60 критических уязвимостей, включая CVE-2026-56155, ошибку сервисов активной директории, и CVE-2026-56164, уязвимость Microsoft SharePoint.

В блоге Kubernetes вышла пошаговая инструкция по созданию собственного экспортера метрик, когда встроенных показателей CPU и памяти недостаточно. В ней разобрали, для каких задач нужен экспортер и как выбрать между Counter, Gauge и Histogram в зависимости от разных сценариев. В конце автор упомянул, как подготовить метрики для использования в HorizontalPodAutoscaler через Prometheus Adapter.

На Хабре вышло сравнение LLM в производственной среде. На примере использования llama.cpp, Gemma и Qwen в разных сценариях инженеры Wb-Tech решили:

• Перейти с Ollama на llama.cpp, чтобы получить больше контроля над инференсом, настройками, воспроизводимостью и структурированным выводом через GBNF
• Не использовать одну универсальную модель
• Использовать собственные конвееры для стабильных процессов
• Считать веса моделей критической зависимостью и фиксировать версии, хранить копии, не полагаться на внешние репозитории

Больше о бенчмарках и особенностях кейса – в статье.

Причины низкой производительности GitLab CI разобрал инженер компании OTUS. В статье он приводит 6 основных ошибок в работе: в кэшировании, распределении нагрузки между раннерами, выбором Docker-образов, параллелизацией, сборкой контейнеров и автоскейлингом. А также показывает, в чем измерять эффективность без усложнения инфраструктуры.

Брайан Грант, СТО ConfigHub, перечислил инструменты по управлению общими настройками рабочих нагрузок в Kubernetes.

Речь идет об автоматизированных проверках и изменениях в контексте безопасности, пробах, запасе количества упавших подов. В статье Брайн описывает подход Configuration as Data и дает готовые инструменты для анализа состояния кластеров, выявления нарушений. Подробности – на Medium.

#новостная_подборка #devops #kubernetes #llm #gitlab
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥4👍32
Пятничное чтиво на DevOps FM

📚 В эту пятницу собрали для вас подборку гайдов по обеспечению стабильной работы агентов в производственной среде. Автор статьи на Medium разделяет все 12 книг из рекомендации на 3 категории:

Для тех, кто строит автономных агентов
Начните с Designing Multi-Agent Systems, чтобы понять механику систем с нуля
А затем продолжите с Agentic AI Engineering, чтобы научиться делать агентов безопасными и не дать им случайно сломать производственную среду, например базу данных.

Для тех, кто выстраивает RAG-пайплайны
Автор советует Mastering Retrieval-Augmented Generation, чтобы разобраться в сегментации, извлечении и других практиках работы с контекстом.

Для инженерных лидов
Начать стоит с LLMOps для понимания контекста мониторинга, эксплуатации и стоимости ИИ-систем.

Автор не рекомендует читать все книги из подборки, ведь так легко застрять в бесконечном «туториальном аду» в недрах теории. ИИ-технологии быстро меняются, а значит, пора применять навыки на практике как можно скорее.

👀Какие материалы по работе с ИИ помогли вам? Делитесь в комментариях, расширим подборку полезного.

#пятничное_чтиво #подборка_книг #ии
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍5🔥4🤔2
👨‍💻Всем DevOps! Мы уже рассказывали о сервисе для аренды VPS/VDS с выделенными ресурсами от Cortel. Коллеги делятся специальным предложением ⬇️
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Forwarded from CORTEL
🤑 Как заработать с инфраструктуры больше?

Мы подняли партнёрское вознаграждение до 100% первого платежа клиента и гарантируем регулярный доход до 20% с дальнейших оплат.

Если назрела задача по VPS, облаку, бэкапам, каналам или чувствительным данным — можно дополнительно заработать в CORTEL : ребята подключатся, разберут задачу, подготовят решение, запустят инфраструктуру и будут поддерживать её 24/7, а вы получите регулярный дополнительный доход.

Выплаты не отменяются через год — вы продолжаете зарабатывать, пока клиент с нами. А сумма заработка не ограничена сверху 😊

📣 Полные условия и регистрация тут.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥32
В эфире DevOps FM – срединедельный дайджест новостей и статей!

OpenAI заявили, что GPT-5.6 Sol и предрелизная модели причастны к атаке на Hugging Face от 16 июля.

Атака началась с конвейера обработки данных. Вредонос использовал 2 уязвимости, получил доступ к ноде, проник в несколько внутренних кластеров и завладел учетными данными в облаке.

В статье OpenAI сообщили, что модели работали в экспериментальном режиме для оценки функционала. Всё об инциденте – здесь, прогнозы от OpenAI – тут.

Всего 1 комментарий в запросе на слияние Azure DevOps может настроить Агента-ревьюера против пользователя.

В MCP-сервере Microsoft обнаружена уязвимость c инъекцией промта через описание запроса на слияние. Команда Manifold Security присвоила ей тип confused deputy. Разбор причин и PoC найдете – здесь.

На прошлой неделе выкатили релиз GitLab 19.2. В новой версии сосредоточились на автоматизации в бэклоге. Представили бета-функции сканирования и исправления, проверки рабочего цикла.

Теперь ИИ-агенты сканируют содержимое конвеера и открывают запрос на слияние, чтобы устранить уязвимости и ошибки в коде. Также упростили работу в терминале с GitLab Duo CLI и агентами в цепочке (Agentic Flows), которые в версии 19.2 вышли на уровень GA. Подробнее об изменениях – тут.

20 июля состоялся релиз стабильной ветки Kata Containers 4.0.0, проекта с открытым исходным кодом от Intel, Hyper и OpenStac. Он отличается безопасностью, защиты от уязвимостей в ядре Linux, сочетает удобство контейнеров с изоляцией виртуальных машин.

В новой версии совершили переход на runtime с языка Go на Rust, включили поддержку гипервизоров Cloud Hypervisor, Firecracker, Dragonball, QEMU и улучшили интеграцию с Kubernetes и Docker. Особенности обновления оставили – здесь, а сравнение Kate Containers с Docker от NorthFlank – тут.

На Хабре опубликовали заключительную часть из серии статей о защите CI/CD в проектах с открытым кодом. В первой сосредоточились на контроле доступа, разместили конфиги YAML и список улучшений для Cilium. Во второй дали инструкции по укреплению зависимостей, а в свежем переводе речь пошла о защите учётных данных и верификации, изоляции секретов CI.

#devops #инциденты #ии #gitlab #ci_cd
Please open Telegram to view this post
VIEW IN TELEGRAM
13🔥31
Как ИИ-агенты снижают нагрузку: кейсы

👨‍💻Переход к агентам начинается с осознания, что ИИ – лишь инструмент, а не универсальное решение. Вместо того чтобы держать 10 вкладок Claude Code в браузере, DevOps-инженер Евгений Дехтярёв создал автономную систему на базе оркестратора Paperclip и моделей Claude (Opus/Sonnet).

Ниже мы описали, как агенты справляются с задачами команды из 50 разработчиков и менеджеров.

Рутина под ключ

На практике агенты отлично справляются с рутиной для оптимизации времени и ресурсов. Так, Claude Code самостоятельно создает техническое задание с соблюдением логики и контекста и по нему выполняет простую инфраструктурную задачу.

За месяц 34 тикета были отданы агентам:

⁃ GitLab CI/ Runners – 7
⁃ Kubernetes – 6
⁃ Storage/S3 – 6
⁃ Базы данных – 6
⁃ VM lifecycle – 4
⁃ Бэкапы. Домены – 4
⁃ Мониторинг (Grafana) – 1

Разбор алертов

Получив RO доступ к stage- и prod-средам, а также общий контекст системы, SRE-агент запускает разбор ошибок в системе оповещений. После диагностики он ставит гипотезу о первопричине ошибки и сообщает о результатах в тредах Slack-каналов. Так, разработчики сразу видят RCA и могут сразу приступить к внесению изменений.

FinOps по нескольким облакам

Для оптимизации облачных расходов команда должна держать руку на пульсе и обосновывать каждое техническое решение. Агент-аналитик упрощает ведение отчетности, собирает биллинг по всем провайдерам. С его помощью Евгений обнаружил подключенные мониторинг и логирование от Google. После отказа от сервисов команда сэкономила 400$ ежемесячно.

👀Подробнее о ролях и задачах агентов, подводных камнях в работе – в записи выступления.

#devops #ai #агенты #кейс
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍6🔥65🤣1
🎉 Команда DevOps FM поздравляет с Днём системного администратора!

Забавно, что идеальный рабочий день системного администратора выглядит примерно так:
- мониторинг молчит;
- платформа управления ИТ-инцидентами не звонит;
- бэкапы успешно проходят проверку;
- пользователи не пишут «ничего не менял, оно само».

То есть когда инфраструктура незаметна, именно потому что очень много для этого сделано. Поздравляем всех, кто делает ее такой незаметной 🙌🏼

Желаем всем хороших выходных и спокойных дежурств!

#SysAdminDay
2🔥176👍2
Интересно, как проходит ваш сегодняшний День системного администратора?
Anonymous Poll
27%
☕️ Чаи гоняю, все спокойно
41%
💻 Плановые задачи
11%
🚨 Тушу пожар
21%
🏖️ Отпуск/выходной
Новостной дайджест от DevOps FM!

🔔 Делимся свежими новостями, релизами и разборами инженерных практик за неделю.

🟡 В блоге Kubernetes вышел предварительный обзор версии 1.37, релиз которой запланирован на конец августа.

Разработчики рассказали о ключевых изменениях, которые планируется включить в релиз: более 20 новых экспериментальных функций, а также улучшения для динамического распределения ресурсов, сетевого стека и управления рабочими нагрузками. Подробнее читайте в обзоре.

⚫️ В том же блоге Kubernetes вышел анонс релиза Gateway API v1.6, в котором ресурсы TCPRoute и UDPRoute перешли в стабильный канал Standard.

Это обновление приносит переносимую и стабильную маршрутизацию трафика на L4-уровне. Детали читайте в официальном обзоре.

🟡 Исследователи Wiz обнаружили критическую цепочку уязвимостей CosmosEscape в Azure Cosmos DB (не без ИИ-помощника). Найденая брешь в API Gremlin позволяла полностью обойти изоляцию облака, получить доступ к внутреннему токену платформы и получить доступ на чтение и запись к базам данных любых клиентов, включая внутренние сервисы Microsoft вроде Teams и Copilot.

Microsoft уже полностью устранила проблему, переработав архитектуру безопасности. Подробный технический разбор читайте в материале The Hacker News.

⚫️ Компания Percona представила Technical Preview сервера для MongoDB 8.3, пропустив промежуточные ветки 8.1 и 8.2.

Сборка объединила улучшения сразу трех минорных релизов, включая новый планировщик запросов Cost-Based Ranker, а также прирост производительности до 195% при массовой вставке временных рядов.

Разработчики подчеркивают, что версия предназначена только для ознакомления — какие архитектурные изменения и новые лимиты памяти ждут СУБД, читайте в официальном блоге Percona.

🟡 В блоге Red Hat вышел технический обзор обновлений OpenShift, посвященный защищенным вычислениям и безопасности ИИ.

Одним из ключевых нововведений стал инструмент Agent Sandbox — изолированная среда на уровне виртуальных машин для безопасного запуска автономных ИИ-агентов и выполнения непроверенного кода.

Также технология конфиденциального ИИ на bare-metal серверах перешла в статус GA. Как новые механизмы защищают веса моделей на уровне процессора и GPU — читайте в обзоре.

⚫️ Исследователи обнаружили компрометацию npm-пакета keyv в рамках масштабной кампании Shai-Hulud (“Дюна”, привет).

Вредоносный код запускался через lifecycle-скрипт preinstall и мог извлекать секреты из окружений разработки и CI/CD-пайплайнов, включая токены облачных сервисов.

Зараженные версии удалены из npm. Проверить затронутые зависимости и индикаторы компрометации можно в техническом разборе Wiz.

#новостная_подборка #devops #kubernetes #security #cloudsecurity #mongodb #openshift #supplychain #npm
2🔥4👍32
🎙 Что послушать на выходных: Kubernetes и энергопотребление

В пятницу делимся свежим выпуском Kubernetes Podcast про Project Kepler — open-source проект для наблюдения за энергопотреблением Kubernetes-нагрузок.
В гостях Ники Маноледаки, Staff Platform Engineer в Grafana Labs и мейнтейнер Project Kepler. Вместе с ведущими она обсуждает, как оценивать энергопотребление рабочих нагрузок, какие метрики для этого можно собирать и почему получить реально точные данные не так просто.
Отдельно поговорили о том, зачем Kepler недавно переписали, как проект использует eBPF и Prometheus и при чём здесь растущие вычислительные нагрузки AI.

🎧 Выпуск «Measuring Sustainability via Project Kepler» послушать можно здесь.

Желаем приятного прослушивания и хороших выходных! А тем, кто дежурит🛡, — спокойных смен 🙌🏼

#подкаст #devops #kubernetes #observability #opensource
2🔥52👍2
KYAML vs YAML: зачем усложнять простое?

YAML давно стал привычным инструментом для DevOps. Но у него есть обратная сторона: неявные типы, зависимость структуры от отступов и множество возможностей, которые Kubernetes на самом деле не использует.

Kubernetes предлагает более строгий подход к конфигурациям — KYAML и описывает его преймущества в своем блоге. Идея в том, чтобы оставить от YAML только то, что действительно нужно Kubernetes, и убрать неоднозначности.

Что получает DevOps?
🟡 меньше зависимости от отступов;
🟡 более предсказуемую работу со строками и типами;
🟡 явное обозначение списков [] и структур {};
🟡 более удобную работу с генерацией, шаблонами и автоматизацией;
🟡 KYAML остаётся валидным YAML и рассчитан на совместимость с существующими YAML-парсерами.

Но есть и другая сторона. Среди обсуждений инженеров можно встретить мнение, что KYAML не избавляет Kubernetes-конфиги от сложности, объясняя это тем, что: 
🟡 KYAML не уберёт Helm-шаблоны, огромные манифесты и десятки взаимосвязанных параметров. А значит, вместо решения основной проблемы можно получить ещё один формат, который команде придётся изучать и поддерживать;
🟡YAML уже встроен практически во всю DevOps-экосистему — от IDE и линтеров до CI/CD-инструментов. KYAML — новый подход, а значит, не все инструменты одинаково хорошо его поддерживают.

И здесь возникает главный вопрос:
KYAML действительно решает проблемы YAML — или просто вводит более строгие правила там, где и так всё работало?

👀 А вы бы использовали KYAML в своих проектах, либо же обычного YAML вам вполне хватает? Поделитесь мыслями.
25👍4🔥3
В эфире DevOps FM – срединедельный дайджест новостей и статей!

10 августа Docker выпустил обновление Docker VMM, переведя технологию в статус Public Beta.

Docker VMM — новый уровень виртуализации для Docker Desktop, который сделает работу контейнеров на Mac и Windows быстрее и стабильнее. Среди заявленных улучшений — более быстрый запуск контейнеров, ускоренный файловый I/O и более эффективное управление памятью. Сейчас технология доступна в Docker Desktop 4.86, а финальный релиз по имеющейся информации запланирован на конец октября.

Подробнее о том, что изменилось и как попробовать новый VMM — в блоге Docker.

После двух месяцев разработки Линус Торвальдс представил релиз ядра Linux 7.2.

Новая версия ядра традиционно приносит изменения в подсистемах, драйверах и производительности. Подробности о ключевых обновлениях и список основных изменений — читайте в OpenNET.

Debian обсуждают использование AI при разработке.

Debian объявили о начале общего голосования разработчиков по вопросу использования больших языковых моделей и AI-инструментов при разработке дистрибутива.

Прием голосов будет осуществляться до 28 августа. Как проходит голосование и какие позиции обсуждаются — читайте в OpenNET.

GitHub пережил масштабный сбой.

17 августа проблемы затронули сразу несколько ключевых сервисов платформы: Web и API показывали около 20% ошибок, а количество неудачных запросов к архивам и Raw-контенту доходило до 50%. Были затронуты Actions, Pull Requests, Issues, Webhooks, Copilot и другие сервисы.

GitHub постепенно восстановил сервисы. В качестве причины сбоев эксперты предположили сетевые инциденты в Amazon Web Services. Подробнее о масштабах сбоя — в статье.

#новостная_подборка #devops #github #docker #linux #debian
Please open Telegram to view this post
VIEW IN TELEGRAM
14🔥3👍2