DevOps Expert
3.33K subscribers
176 photos
4 videos
8 files
291 links
✔️ کانال آموزش دوآپس به فارسی

Contact:
@BobyCloud
@H_TESLA_S
@Majid_Aghamohamad
Download Telegram
Forwarded from DevOps (Ahmadali Bagheri)
🚀 شروع انتشار جدیدترین دوره DevOps Hobbies!
دوره‌ای که به جرأت می‌تونم بگم قوی‌ترین آموزش Prometheus به زبان فارسی هست 💪
اگر به مانیتورینگ، Observability یا زیرساخت‌های Cloud علاقه داری، این دوره دقیقاً برای توئه!

🔥 تا حالا خواستی بدونی:

👈برنامه ا‌ت زیر فشار بالا دقیقاً چطور رفتار می‌کنه؟
👈هر Pod توی Kubernetes در لحظه چقدر CPU و RAM مصرف می‌کنه؟
👈چند نفر همین الآن از اپلیکیشن استفاده می‌کنن؟
👈یا بدونی بیشترین ترافیک روی Nginx یا Network در چه ساعتیه؟

حتی می‌خوای:
⚡️ قبل از پر شدن دیسک یا داغ شدن CPU هشدار بگیری؟
📊 داده‌های SQL رو به داده‌های سری‌زمانی تبدیل کنی و تحلیل‌های آماری انجام بدی؟
🧠 از لاگ‌ها متریک استخراج کنی، تست‌های A/B اجرا کنی و رفتار سیستم‌هارو دقیق بررسی کنی؟

همه‌ی این کارها با Prometheus ممکنه!

🎯 در این دوره یاد می‌گیری:

📍مفاهیم Monitoring و Observability
📍نوشتن Custom Metrics
📍کار با PromQL
📍طراحی داشبورد در Grafana
📍ساخت سیستم Alerting
📍اتصال Prometheus به Kubernetes، Exporterها و سرویس‌های مختلف

🎓 در پایان دوره می‌تونی هر سرویس یا زیرساختی رو مانیتور کنی، خطاها رو قبل از وقوع شناسایی کنی و سیستم‌هات رو در مقیاس بزرگ‌تر با اطمینان نگهداری و توسعه بدی.

با تشکر از دانیال عزیز برای تولید این دوره مهم

👇 لینک و جزئیات دوره در کانال یوتیوب دواپس هابیز ببینید.

https://www.youtube.com/watch?v=jJfpE13dNDE&list=PLYrn63eEqAzaw0Q7HsD_KHfyAU1wOX1mv

#DevOps #Prometheus #Grafana #Kubernetes #Monitoring #Observability
👍73🤔1
اصطلاحات مانیتورینگ که هر برنامه‌نویس و DevOps باید بداند

فرض کنید میانگین زمان پاسخ API شما فقط ۲۰۰ میلی‌ثانیه است؛ اما همچنان بعضی کاربران از کندی سرویس شکایت دارند.

مشکل کجاست؟

ممکن است Average وضعیت خوبی نشان دهد، اما p95 یا p99 مشخص کند بخشی از کاربران چند ثانیه منتظر پاسخ می‌مانند.

در محیط‌های حرفه‌ای، برای بررسی دقیق وضعیت سرویس از مفاهیمی مثل این‌ها استفاده می‌شود:

۱. p95 و p99 برای تشخیص کندی واقعی
۲. Error Rate برای اندازه‌گیری نرخ خطا
۳. Throughput و RPS برای بررسی حجم ترافیک
۴. SLO و Error Budget برای سنجش پایداری سرویس
۵. MTTR برای اندازه‌گیری سرعت بازیابی پس از خرابی

اما هرکدام دقیقاً چه معنایی دارند؟ چه زمانی باید از آن‌ها استفاده کنیم و چه عددی می‌تواند نشانه یک مشکل جدی باشد؟

در مقاله جدید Watchlog، مهم‌ترین اصطلاحات مانیتورینگ را با زبان ساده، مثال‌های عددی و کاربرد واقعی در محیط Production توضیح داده‌ایم:

👇 مطالعه مقاله
https://watchlog.ir/blogs/monitoring-terms-every-developer-should-know

اگر برنامه‌نویس، DevOps یا SRE هستید، این مقاله می‌تواند به شما کمک کند وضعیت واقعی سرویس‌ها را بهتر تحلیل کنید و Alertها و Dashboardهای دقیق‌تری بسازید.

#مانیتورینگ #Observability #DevOps #SRE #برنامه_نویسی #Watchlog
4
🚨 ۵ اشتباه پنهان که مانیتورینگ شما را بی‌اثر می‌کنند

تصور کنید همه نمودارها سبز هستند و هیچ هشدار مهمی هم دریافت نکرده‌اید؛ اما کاربران همچنان با کندی و خطا روبه‌رو هستند.

این اتفاق معمولاً یعنی داده دارید، اما مانیتورینگ شما تصویر کاملی از وضعیت واقعی سرویس ارائه نمی‌دهد.

پنج اشتباه رایج می‌توانند مشکلات مهم را از دید شما پنهان کنند:

۱. اعتماد به میانگین‌ها و نادیده‌گرفتن p95 و p99
۲. ساخت هشدار برای هر نوسان و ایجاد خستگی هشدار
۳. بررسی زیرساخت بدون توجه به تجربه واقعی کاربران
۴. جمع‌آوری متریک، لاگ و تریس بدون ارتباط میان آن‌ها
۵. نداشتن مسئول مشخص و فرایند واکنش پس از هشدار

در مقاله جدید Watchlog، هرکدام از این اشتباهات را با مثال‌های واقعی بررسی کرده‌ایم و برای اصلاح آن‌ها راهکارهای عملی ارائه داده‌ایم.

👇 مطالعه مقاله
https://watchlog.ir/blogs/common-monitoring-mistakes

به نظر شما رایج‌ترین اشتباه در مانیتورینگ چیست؟ اگر تجربه‌ای داشته‌اید که با وجود سبزبودن داشبوردها، کاربران با مشکل مواجه بوده‌اند، در کامنت‌ها بنویسید تا دیگران هم از تجربه شما استفاده کنند.

#مانیتورینگ #Observability #DevOps #SRE #برنامه_نویسی #Watchlog
👍2