Пятничный деплой
4.74K subscribers
1.51K photos
35 videos
167 files
7.95K links
Подборка ссылок, статей и постов из мира DevOps\SRE\разработки. Если вы хотите прислать фидбек, интересную статью или просто поболтать пишите @count0ru https://xn--r1a.website/s/count0_digest
Download Telegram
Forwarded from ITGram
YAML Multiline — a quick cheat sheet on multiline strings in YAML because it's not that simple. I guess I use this site too often for such a trivial task >.<

#yaml
Forwarded from Мониторим ИТ
PostgreSQL Monitoring for App Developers: Alerts & Troubleshooting

If you choose only one thing to alert on in your PostgreSQL cluster (and as I hope this article makes clear, you should alert on multiple things), it should be availability. If your application is unable to connect or transaction with your database, you're probably in for a bad day. Читать дальше.
Хашикорп что ты делаешь, прекрати!
Forwarded from CatOps
Ну вот и дождались CI/CD от HashiCorp

Встречайте: Waypoint

Хотя это не совсем CI/CD, а скорее application lifestyle management tool. Но нужно ещё разбираться.

#cicd #hashicorp
Открытые практикумы DevOps и Linux by REBRAIN: 20 и 21 октября
Количество мест строго ограничено. Успевайте зарегистрироваться. Запись практикума NGINX by REBRAIN в подарок за регистрацию!

Rebrain x DataArt: Управление Kubernetes кластером с помощью Terraform. 20 октября 19.00 МСК

Регистрация
: https://kutt.it/C6rmh5

🔹Зачем это надо, если есть yaml?
🔹Как подключиться?
🔹Какие подводные камни?

Кто ведет?
Александр Снеговой - Cloud/DevOps Architect в DataArt. Сертифицированный AWS и GCP Architect. Выступает с докладами про cloud и DevOps. 7 лет в IT.

Linux by Rebrain: Мониторинг на примере Prometheus. 21 октября 20.00 МСК

Регистрация
: https://kutt.it/VLDTBy

🔹Виды мониторинга
🔹Что такое prometheus
🔹Обзор необходимых компонентов
🔹Установка и настройка

Кто ведет?
Буранов Андрей - Специалист по UNIX-системам в компании Mail.Ru Group. Опыт работы с ОС Linux более 7 лет. Опыт преподавания более 5 лет. Входит в топ 3 лучших преподавателей образовательных порталов.
Forwarded from Мониторим ИТ
We’re making Prometheus use less memory and restart faster

A few months ago, I blogged about memory-mapping of full chunks of the head block from disk. The feature, which was introduced in Prometheus v2.19.0, brings down memory usage and restart time.

Additionally, there’s another Prometheus feature in progress that snapshots in-memory data during shutdown for faster restarts; it’s expected to cut down the restart times by a big factor. Интересно, как это.
Начинаешь свой путь в IT? Попробуй силы в Java-разработке на реальных задачах и создай приложение, которое украсит твоё портфолио.

Ждём тебя на бесплатном интенсиве 22–24 октября в 16:00!
Нужна только регистрация: 👉 https://clc.am/pNHxRQ

Ты узнаешь, как:
✔️ писать код на Java и вносить в него изменения;
✔️ отлавливать исключения и обрабатывать их;
✔️ читать и записывать файлы в Java;
✔️ подключать внешние библиотеки.

🔊 За три дня под руководством опытного разработчика ты создашь приложение, которое записывает звук с микрофона, сохраняет запись в файл и отправляет его в Dropbox!

🎁 Авторы трёх лучших проектов получат сертификаты на 30 000 рублей для поступления на любой онлайн-курс университета Skillbox, а все участники, дошедшие до конца, — электронную книгу Кей Петерсон и Дэвида Колба «Век живи — век учись» от издательства «МИФ».
Интересная статья, которая познакомит вас с паттерном Расширение интерфейса в Go: https://proglib.io/w/c9b49350
Go MeetUp

1. RPC over NATS — умная доставка сообщений - Александр Ковалев, Go Teamlead, IVA Technologies
Для обеспечения быстрой, надежной и масштабируемой доставки сообщений между компонентами, было решено использовать NATS .io в качестве транспорта и модифицированный JSON RPC, как начальную реализацию протокола. Что из этого уже получилось, какие возможности дает такой подход и что еще планируется сделать.

2. Go Modules в production - Данилкин Илья, Senior Engineer, Scrum Master, Авито
Со времени анонса модулей прошло уже 2 года. За это время их успели выпустить в виде официального эксперимента, сломать и починить несколько раз.
Готовы ли они к использованию в проде? Зачем переезжать с dep/Glide (и как)? Как работать с ними в IDE?
__________________________________

🗓 29 октября 18:00–20:00, Четверг

🌐 ОНЛАЙН

Регистрация на мероприятие
Forwarded from Админим с Буквой (bykva)
Настройка Heartbeat для проверки работы системы мониторинга

Расскажу на примере prometheus, alertmanager, opsgenie.

opsgenie:
0) создаем команду
1) по адресу https://app.opsgenie.com/settings/heartbeat создаем хартбит по нужным вам параметрам (severity, на кого повесить, описание). Запоминаем имя (далее ${name})
2) идем в интеграции, создаем для prometheus - именуем, назначаем команду, получаем api ключ.
https://app.opsgenie.com/settings/integration/integration-list (далее ${opsgenie_api_key})

alertmanager.yml:

receivers:
- name: deadmansswitch
webhook_configs:
- url: https://api.opsgenie.com/v2/heartbeats/${name}/ping
send_resolved: true
http_config:
basic_auth:
password: ${opsgenie_api_key}
route:
group_by:
- job
group_interval: 5m
group_wait: 10s
receiver: default
repeat_interval: 1m
routes:
- receiver: deadmansswitch
match:
severity: DeadMansSwitch
repeat_interval: 1m

prometheus.yml -> далее если у вас правила вынесены в отдельный файл, если нет, ну, сами поправите)

...
rule_files:
- /etc/prometheus/prometheus.rules
...

prometheus.rules:

groups:
- name: prometheus.alerts.rules
rules:
- alert: PrometheusAlertmanagerE2eDeadManSwitch
expr: vector(1)
for: 5m
labels:
severity: DeadMansSwitch
annotations:
summary: "Prometheus AlertManager E2E dead man switch (instance {{ $labels.instance }})"
description: "Prometheus DeadManSwitch is an always-firing alert. It's used as an end-to-end test of Prometheus through the Alertmanager.\n VALUE = {{ $value }}\n LABELS: {{ $labels }}"

Как это работает:
1) в течение 5 минут прометей проверяет выражение vector(1), которое всегда будет отдавать 1, а значит фейлиться.
2) через 5 минут (а затем еще каждую минуту) он будет пиннать алертменеджер и говорить что есть проблема.
3) Алертменеджер будет долбиться раз в минуту на специальный урл opsgenie.
4) В настройках хартбита вы выставляете время которое считаете нормальным для того чтобы система оповещения лежала. и далее ход конём:
5) если у вас погиб прометей (или сеть до алертменеджера), он не будет долбить алертменеджер и рефрешить гарантированный алерт. в таком случае автоматически происходит разрезолв алерта (по-умолчанию 5 минут) и перестают посылаться сообщения на урл из п.3. Тогда по истечению таймаута из п4. на вашу команду упадет алерт о том что хартбит просрочен.
6) если у вас умер алертменеджер (или связность до апи opsgenie), то по истечению таймаута из п4. на вашу команду упадет алерт о том что хартбит просрочен.

т.о. такая связка гарантирует что вся цепочка от мониторинга до алертменеджера и апишки opsgenie находится в работоспособном состоянии

Источник знаний:
- https://xn--r1a.website/metrics_ru
- https://docs.opsgenie.com/docs/heartbeat-api
- https://github.com/prometheus/alertmanager/pull/444#issuecomment-428493861

#prometheus #opsgenie #alertmanager