529 subscribers
36 photos
5 videos
2 files
1.53K links
👑 DevOps Labdon

حمایت مالی:
https://www.coffeete.ir/mrbardia72

ادمین:
@mrbardia72
Download Telegram
🔵 عنوان مقاله
How to run AI model inference with GPUs on Amazon EKS Auto Mode

🟢 خلاصه مقاله:
اجرای استنتاج مدل‌های هوش مصنوعی روی GPU در Amazon EKS Auto Mode با اعلام نیازمندی‌ها در سطح Pod ساده می‌شود و خودکار ظرفیت GPU را فراهم و مقیاس می‌دهد. کافی است سرور استنتاج (مثل TensorFlow Serving، TorchServe یا NVIDIA Triton Inference Server) را با CUDA/cuDNN و NVIDIA Container Toolkit در یک ایمیج آماده کنید، در Deployment منابع nvidia.com/gpu و CPU/Memory را درخواست دهید، و با نصب NVIDIA device plugin امکان شناسایی GPU را فراهم کنید. Auto Mode براساس این درخواست‌ها نودهای GPU مناسب را در EC2 تأمین و زمان‌بندی را تسریع می‌کند. برای مقیاس‌پذیری از HPA و اتوسکیلینگ کلاستر استفاده کنید و با تکنیک‌هایی مثل dynamic batching و multi-model throughput را بالا ببرید؛ برای مدیریت هزینه، right-sizing، استفاده هدفمند از Spot و scale-to-zero را در نظر بگیرید. امنیت و شبکه با VPC CNI، Security Group و IAM Roles for Service Accounts و مشاهده‌پذیری با Prometheus/Grafana، DCGM و CloudWatch تکمیل می‌شوند. در نهایت، با CI/CD و Amazon ECR و الگوهای انتشار امن (blue/green یا canary) استقرار به‌صورت قابل تکرار و پایدار از توسعه تا تولید انجام می‌شود.

#AmazonEKS #Kubernetes #GPU #MLOps #AWS #Inference #AutoScaling #NVIDIA

🟣لینک مقاله:
https://ku.bz/jyGr1NGBX


👑 @DevOps_Labdon
🔵 عنوان مقاله
Cost-optimized ml on production: autoscaling GPU nodes on Kubernetes to zero using keda

🟢 خلاصه مقاله:
این آموزش نشان می‌دهد چگونه با استفاده از Kubernetes و KEDA ظرفیت GPU را بر اساس طول صف پیام‌ها به‌صورت خودکار تا صفر کاهش دهیم و هزینه اجرای ML در محیط تولید را کم کنیم. معماری مبتنی بر یک message queue (مثل Kafka، RabbitMQ یا AWS SQS) است و KEDA با ScaledObject تعداد پادهای مصرف‌کننده GPU را نسبت به backlog تنظیم می‌کند (minReplicaCount=0). با فعال‌بودن Cluster Autoscaler و یک GPU node pool با حداقل اندازه صفر، نودهای GPU فقط هنگام نیاز ایجاد و سپس آزاد می‌شوند. نکات کلیدی شامل تنظیم nodeSelector/tolerations، درخواست nvidia.com/gpu، کنترل pollingInterval/cooldownPeriod، کاهش cold start با pre-pull و پایش با Prometheus/Grafana است. نتیجه: پرداخت هزینه GPU فقط هنگام وجود کار، همراه با حفظ قابلیت اطمینان و کنترل تأخیر.

#Kubernetes #KEDA #GPU #MLOps #Autoscaling #CostOptimization #MessageQueue #ProductionML

🟣لینک مقاله:
https://ku.bz/Zhb9q3BZx


👑 @DevOps_Labdon
1
🔵 عنوان مقاله
AI Infrastructure on Kubernetes

🟢 خلاصه مقاله:
** این گزارش از kube.today با اتکا به ۹۱۷ پاسخ نظرسنجی نشان می‌دهد تیم‌ها در عمل چگونه بارهای کاری AI را روی Kubernetes مقیاس می‌دهند. نتیجه اصلی، شکاف میان ادعاهای فروشندگان و واقعیت بهره‌گیری از GPU است: تأخیر در زمان‌بندی، تکه‌تکه‌شدن منابع، گلوگاه‌های داده و ضعف در مشاهده‌پذیری باعث می‌شود GPUها کمتر از حد انتظار کار کنند. گزارش الگوهای عملی برای بهبود ارائه می‌کند؛ از right-sizing و bin-packing و زمان‌بندی آگاه از توپولوژی تا autoscaling مبتنی بر صف، اولویت‌دهی و preemption و رصد دقیق حافظه و I/O روی GPU. این رویکردها به تبدیل ظرفیت پرهزینه GPU به کار مفید کمک می‌کند و Kubernetes را برای بارهای کاری AI قابل‌اعتمادتر می‌سازد.

#Kubernetes #AI #GPU #MLOps #CloudNative #K8s #AIInfrastructure #Observability

🟣لینک مقاله:
https://ku.bz/B3nxKPYpV


👑 @DevOps_Labdon
🔵 عنوان مقاله
Kubernetes Dynamic Resource Allocation for NVIDIA

🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات امروزی، مدیریت منابع یک چالش مهم برای تیم‌های فناوری است. یکی از فناوری‌های نوآورانه در این زمینه، امکان تخصیص دینامیک منابع در سیستم‌های مدیریت کانتینر مانند کوبرنتیس است، خصوصاً زمانی که با کارت‌های گرافیک NVIDIA سر و کار داریم. این فناوری به صورت هوشمندانه و در زمان اجرا، منابع مورد نیاز برنامه‌ها را بر اساس درخواست‌های جاری تنظیم می‌کند و بدین‌صورت بهره‌وری سیستم را به حداکثر می‌رساند.

در گذشته، تخصیص منابع در سیستم‌های مبتنی بر کوبرنتیس معمولاً به صورت ثابت و پیش‌فرض انجام می‌شد، که این امر می‌توانست منجر به هدر رفتن منابع یا محدودیت‌های غیرضروری شود. اما حالا، با توسعه فناوری‌های جدید، امکان تخصیص دینامیک‌های منابع GPU برای تسهیل اجرای برنامه‌های سنگین و پرترافیک فراهم آمده است. این قابلیت، به صورت خودکار موارد نیازمند GPU را شناسایی و به‌روزرسانی می‌کند، که این امر سرعت و کارایی عملیات‌های مختلف را به طور قابل توجهی افزایش می‌دهد.

استفاده از این فناوری به توسعه‌دهندگان و مدیران سیستم این امکان را می‌دهد که بهتر از منابع GPU بهره‌مند شوند و هزینه‌های زیرساخت را کاهش دهند. همچنین، امکان انعطاف‌پذیری در مدیریت منابع، کارایی کلی سیستم را افزایش می‌دهد و اجرای برنامه‌های مبتنی بر هوش مصنوعی و یادگیری ماشین را سریع‌تر و موثرتر می‌سازد، مخصوصاً در محیط‌های چندکاربره و سرورهای بزرگ.

در نتیجه، بهره‌گیری از تخصیص دینامیک منابع NVIDIA در کوبرنتیس، یک قدم مهم به سمت بهبود روندهای اجرایی و افزایش بهره‌وری در توسعه و اجرای برنامه‌ها است. این فناوری نویدبخش آینده‌ای است که در آن منابع سیستم به صورت هوشمندانه و بهینه مدیریت می‌شوند و توسعه‌دهندگان می‌توانند با اطمینان بیشتری روی پروژه‌های پیشرفته خود کار کنند.

#کوبرتیس #هوش_مصنوعی #GPU #مدیریت_منابع

🟣لینک مقاله:
https://ku.bz/vVQHtF-jK


👑 @DevOps_Labdon
🔵 عنوان مقاله
GPU-based containers as a service

🟢 خلاصه مقاله:
در دنیای فناوری امروز، وظیفه‌ی ارائه‌ی خدمات مبتنی بر کارت‌های گرافیک یا GPU، اهمیت روزافزون یافته است. شرکت‌ها و توسعه‌دهندگان نیازمند راهکارهای موثری هستند که بتوانند به صورت همزمان چندین کاربر یا tenant را بر روی پلتفرم‌های ابری مدیریت و پشتیبانی کنند. در این مقاله، به بررسی چگونگی ساخت یک بستر چندمستاجر بر پایه‌ی Kubernetes می‌پردازیم که از GPUها به بهترین شکل بهره‌برداری می‌کند. این سامانه با بهره‌گیری از راهکارهای نوآورانه‌ای نظیر کانتینرهای Kata، پلاگین‌های سفارشی CDI و جداسازی شبکه‌ای NVLink، قادر است تا وظایف محاسباتی مبتنی بر GPU را در قالب ماشین‌های مجازی به صورت امن و کارا اجرا کند.

برای ایجاد این پلتفرم، نیاز به هماهنگی دقیق میان فناوری‌های مختلف داریم تا بتواند نیازهای امنیتی و عملیاتی را برآورده کند. استفاده از کانتینرهای Kata، راهکاری است که امکان اجرای ایمن و مقیاس‌پذیر برنامه‌ها در ماشین‌های مجازی را فراهم می‌کند و این در حالی است که پلاگین‌های CDI سفارشی، امکانات لازم برای مدیریت و تخصیص منابع GPU را در محیط Kubernetes فراهم می‌آورند. همچنین، تکنولوژی NVLink موجب جداسازی سریع و امن ترافیک بین دستگاه‌های GPU و سرور می‌شود، که این امر تضمین‌کننده‌ی انتقال داده‌های حجیم و عملکرد بی‌وقفه است.

در نتیجه، این رویکرد نوآورانه نه تنها سطح امنیت و تخصص‌پذیری در اجرای وظایف GPU را بالا می‌برد، بلکه توانایی‌ها و انعطاف‌پذیری یک پلتفرم ابری چندمستاجر را نیز به طور قابل توجهی توسعه می‌دهد. این سیستم به کسب‌وکارها امکان می‌دهد تا به شکلی امن و مؤثر از منابع GPU بهره‌مند شوند و در عین حال، تجربه‌ای پایدار و قابل اعتماد برای کاربران خود فراهم نمایند.

#GPU #Kubernetes #کانتینر #هاست

🟣لینک مقاله:
https://ku.bz/gvmky__4m


👑 @DevOps_Labdon
🔵 عنوان مقاله
GPU Starvation in Kubernetes: How Dynamic MIG Partitioning Saved Our GPU Budget

🟢 خلاصه مقاله:
در دنیای رایانش ابری و پردازش‌های سنگین، مدیریت بهینه منابع گرافیکی اهمیت زیادی دارد. یکی از چالش‌هایی که مدیران مراکز داده معمولا با آن مواجه هستند، کمبود و یا ناتوانی در استفاده کامل از منابع GPU است. در این مقاله، با نمونه‌ای واقعی آشنا می‌شویم که نشان می‌دهد چگونه با استفاده از فناوری تقسیم‌بندی دینامیک MIG، توانسته‌اند مشکل کمبود منابع GPU را برطرف کنند و در نتیجه، اقتصاد و کارایی سیستم خود را به نحو چشمگیری ارتقاء دهند.

در این مطالعه موردی، نویسندگان توضیح می‌دهند که چگونه با بهره‌گیری از فناوری تقسیم‌بندی دینامیک در فناوری MIG (معروف به Multi-Instance GPU)، توانسته‌اند واحدهای بزرگ GPU مانند NVIDIA A100 و H100 را به چند قسمت مجزا و ایزوله تقسیم کنند. این روش امکان می‌دهد که چندین کار کوچک و هم‌زمان روی یک GPU واحد اجرا شوند، بدون آنکه با هم تداخل داشته باشند و منابع آن‌ها به صورت بهینه استفاده شود. این تکنیک به خصوص در شرایطی که نیاز به اجرای چند سمت‌گرای کوچک و هم‌زمان باشد، نقش کلیدی ایفا می‌کند.

استفاده از این فناوری نه تنها بهره‌وری را افزایش داد، بلکه هزینه‌های مربوط به خرید و نگهداری سخت‌افزارهای گران‌قیمت را نیز کاهش داد. مدیران و تیم‌های فنی توانستند با تقسیم‌بندی دینامیک منابع، نیازهای متنوع پروژه‌ها را برآورده کنند و هم‌زمان از کمبود منابع GPU جلوگیری نمایند. این رویکرد، نمونه‌ای از نوآوری و بهره‌برداری هوشمندانه از فناوری‌های جدید است که اثربخشی عملیات را به میزان قابل توجهی بهبود می‌بخشد.

در نتیجه، این راه‌کار، یک استراتژی اثبات‌شده برای مدیریت منابع GPU در محیط‌های پیچیده و حساس است. فناوری تقسیم‌بندی دینامیک MIG در واقع، یک انقلاب در نحوه استفاده از منابع سخت‌افزاری است که می‌تواند به شکل چشمگیری هزینه‌ها و زمان‌های انتظار را کاهش دهد و عملکرد کلی سیستم را تقویت کند.

#هوش_مصنوعی #مدیریت_منابع #GPU #کبرنامه‌نویسی

🟣لینک مقاله:
https://ku.bz/h4B9DHKH0


👑 @DevOps_Labdon
🔵 عنوان مقاله
GPU Starvation in Kubernetes: How Dynamic MIG Partitioning Saved Our GPU Budget

🟢 خلاصه مقاله:
در این مطالعه موردی، تیم ما با چالش مهمی در مدیریت منابع GPU در محیط‌های کلاود مواجه شد. استفاده از کارت‌های گرافیک قدرتمند و بزرگ مانند NVIDIA A100 و H100 در مراکز داده، همیشه همراه با مشکل اشتراک‌گذاری بهینه و بهره‌برداری موثر است. زمانی که تعداد وظایف کوچک زیادی همزمان اجرا می‌شد، شاهد بروز مشکل‌هایی مانند “گرسنگی GPU” یا همان نبود ظرفیت کافی برای اجرای وظایف جدید بودیم. این مشکل به معنای هدر رفتن منابع و کاهش بهره‌وری سیستم‌های ما بود و نیازمند راه حل مناسبی بود.

برای مقابله با این چالش، تیم ما از فناوری نوین تقسیم‌بندی پویا یا همان Dynamic MIG Partitioning استفاده کرد. این فناوری امکان تقسیم‌بندی هوشمند و دینامیک کارت‌های گرافیک بزرگ بر اساس نیازهای جاری را فراهم می‌کند. به این صورت، یک NVIDIA A100 یا H100 بزرگ را می‌توان به چند بخش مجزا و مستقل تقسیم کرد، هر بخش به عنوان یک “سایز کوچک‌تر” عمل می‌کند و منابع آن به صورت جدایی‌ناپذیر در اختیار وظایف قرار می‌گیرد. این تکنولوژی به ما اجازه داد تا منابع GPU را به شکل بسیار کارآمدتری مدیریت کنیم و همزمان چند وظیفه کوچک را در هر کارت گرافیک اجرا کنیم، بدون آنکه نگران اختلال یا نابرابری در دسترسی به منابع باشیم.

نتیجه استفاده از این فناوری، بهبود قابل توجهی در بهره‌وری GPU و کاهش مشکل “گرسنگی” بود. با این روش، توانستیم حجم زیادی از وظایف کوچک را به صورت همزمان روی سیستم‌های GPU بزرگ اجرا کنیم، بدون اینکه منابع خالی و بی‌استفاده بماند. این استراتژی نه تنها هزینه‌های کلی ما را کاهش داد، بلکه هزینه‌های مربوط به خرید و نگهداری سخت‌افزار را هم به شکل چشم‌گیری کاهش داد و در نتیجه، صرفه‌جویی قابل توجهی در بودجه GPU ما صورت گرفت.

در نهایت، فناوری تقسیم‌بندی پویا در محیط‌های ابر و مراکز داده، راه‌حلی کارآمد برای بهره‌برداری حداکثری از منابع GPU قدرتمند است. این رویکرد، فرصت‌های جدیدی برای بهینه‌سازی مصرف منابع و افزایش راندمان سیستم‌های مجازی فراهم می‌کند، به خصوص در شرایطی که تعداد وظایف کوچک و متنوع زیاد است.

#GPU #کلاود #پایگاه_داده #بهینه‌سازی

🟣لینک مقاله:
https://ku.bz/h4B9DHKH0


👑 @DevOps_Labdon
🔵 عنوان مقاله
KEDA GPU Scaler

🟢 خلاصه مقاله:
الگوهای مقیاس‌پذیری در حوزه فناوری‌های ابری روزبه‌روز در حال توسعه و بهبود هستند تا پاسخگوی نیازهای مختلف نرم‌افزارها و سرویس‌ها باشند. یکی از ابزارهای جدید و کاربردی در این زمینه، KEDA GPU Scaler است که نقش مهمی در بهینه‌سازی مصرف منابع سخت‌افزاری بر عهده دارد. این اسکیلر خارجی، به صورت خاص برای نظارت بر میزان استفاده از کارت‌های گرافیک NVIDIA طراحی شده است و از طریق NVML، مقادیر مربوط به GPU را به‌روز می‌کند.

این ابزار، امکان مانیتورینگ و مقیاس‌پذیری خودکار بر روی سرویس‌ها و کارهای مختلف AI و یادگیری ماشین، از جمله vLLM، Triton، وظایف آموزش مدل‌ها و همچنین استراحت‌های درون inference، را فراهم می‌آورد. یکی از ویژگی‌های برجسته آن، عدم نیاز به استفاده از Prometheus است که این امر سبب سادگی نصب و راه‌اندازی این ابزار شده است. به کمک KEDA GPU Scaler، می‌توان به صورت دقیق و کارآمد، منابع GPU را مدیریت و مقیاس‌پذیری متناسب با نیازهای در لحظه، انجام داد و عملکرد سیستم‌های مبتنی بر GPU را بهبود بخشید.

این فناوری جدید، به توسعه‌دهندگان و مدیران سیستم‌های هوشمند کمک می‌کند تا بهره‌وری سخت‌افزارهای NVIDIA را در برنامه‌های پیچیده و پرفشار به حداکثر برسانند و از منابع خود به بهترین شکل بهره‌مند شوند.

#هوشمندسازی_سرویس‌ها #مقیاس‌پذیری #GPU #هوش_مصنوعی

🟣لینک مقاله:
https://ku.bz/Hg61Tjm7h


👑 @DevOps_Labdon
🔵 عنوان مقاله
One forgotten notebook on an A100. $1,800 a month.

🟢 خلاصه مقاله:
در دنیای مدیریت منابع ابری، نظارت دقیق بر عملکرد اجزای مختلف اهمیت بسیاری دارد. یکی از چالش‌های رایج در سامانه‌های مبتنی بر Kubernetes، شناسایی کارت‌های گرافیک (GPU) است که در حال حاضر بی‌استفاده یا کم‌استفاده هستند. در این زمینه، ابزارهای متعددی برای رصد این منابع طراحی شده‌اند، اما برخی از آن‌ها نیازمند نصب و پیکربندی پیچیده‌ای هستند. مقاله‌ای که مطالعه کردیم، به معرفی ابزار "kube-gpu-top" می‌پردازد؛ ابزاری بی‌نظیر برای کمک به تیم‌های Kubernetes در تشخیص کارت‌های گرافیک غیرفعال و یا استفاده کم، به روشی ساده و کارآمد.

این ابزار، با نقشه‌برداری دقیق از معیارهای عملکرد کارت‌های NVIDIA GPU و ارتباط آن با پادهای مرتبط، توانسته است تصویری واضح از وضعیت مصرف منابع در اختیار تیم‌ها قرار دهد. مهم‌ترین ویژگی این سیستم، این است که بدون نیاز به ابزارهای پرخرج و پیچیده مانند Prometheus یا Grafana، میزان هدررفت ماهانه منابع را تخمین می‌زند. این بدان معناست که تیم‌ها می‌توانند به راحتی تصمیم‌گیری‌های بهتری در مورد تخصیص یا آزادسازی منابع داشته باشند، و در نتیجه هزینه‌های جاری مرتبط با GPUها را تا حد زیادی کاهش دهند.

در نتیجه، "kube-gpu-top" ابزار مفیدی است که با روشی ساده و کارآمد، راهکاری نوین برای مدیریت هوشمندانه منابع در محیط‌های Kubernetes ارائه می‌دهد، و می‌تواند صرفه‌جویی قابل توجهی در هزینه‌ها ایجاد کند—هزینه‌ای که شاید در ابتدا نادیده گرفته شده باشد، اما در طول زمان می‌تواند به چندین هزار دلار در ماه برسد، فقط با شناسایی کارت‌هایی که کارایی لازم را ندارند یا بی‌استفاده باقی مانده‌اند. این ابزار به تیم‌های فناوری اطلاعات کمک می‌کند تا بهره‌وری منابع خود را به حداکثر برسانند و هزینه‌ها را بهینه کنند.

#مدیریت_منابع #Kubernetes #GPU #کاهش_هزینه‌ها

🟣لینک مقاله:
https://ku.bz/RztgvXMZZ


👑 @DevOps_Labdon
🔵 عنوان مقاله
Does Kubernetes DRA Replace HAMi? (10 minute read)

🟢 خلاصه مقاله:
در راستای توسعه فناوری‌های مدیریت کانتینر و ماشین‌های مجازی، پروژه‌های متعددی برای بهبود عملکرد و بهره‌وری سیستم‌های ابری ارائه می‌شوند. یکی از این پروژه‌ها، HAMi است که به طور خاص برای اشتراک‌گذاری GPUها در میان پادهای مختلف در محیط‌های کوبرنتیس طراحی شده است. این پروژه، با هدف ساده‌تر کردن فرآیند استفاده مجدد از منابع گرافیکی قدرتمند، توانسته است جایگاه ویژه‌ای در جامعه توسعه‌دهندگان پیدا کند.

در تاریخ ۱۵ ژوئیه، HAMi به عنوان یک پروژه در حال نمو در مؤسسه‌ی زنجیره‌ی کنترلی نرم‌افزارهای متن‌باز (CNCF) پذیرفته شد. این پذیرش نشان‌دهنده‌ی اهمیت و پتانسیل بالای آن در صنعت فناوری ابری است، چرا که CNCF نقش مهمی در نگهداری و توسعه‌ی پروژه‌های متن‌باز دارد و تأیید این پروژه، می‌تواند باعث پیشرفت بیشتر و پذیرش گسترده‌تر آن شود. این پروژه در کنار دیگر ابزارهای مدیریت منابع، امکان توزیع بهینه‌ی منابع سخت‌افزاری مانند GPUها را فراهم می‌کند و به تیم‌های توسعه و زیرساخت کمک می‌کند تا بهره‌وری سرورهای کوبرنتیس خود را افزایش دهند.

اما در چنین شرایطی، سوال مطرح می‌شود که آیا فناوری DRA، که برای مدیریت بهتر و ساده‌تر منابع در محیط‌های کوبرنتیس توسعه یافته است، قرار است جایگزین HAMi شود یا نه؟ پاسخ این سؤال نیازمند بررسی دقیق اهداف، امکانات و مقایسه‌ی ویژگی‌های دو فناوری است. اگرچه DRA ممکن است راهکارهای نوینی را برای مدیریت منابع ارائه کند، اما هر یک از این فناوری‌ها در جایگاه خاص خود قرار دارند و شاید بتوانند در کنار هم، یک اکوسیستم قدرتمند و یکپارچه را تشکیل دهند. در نهایت، پیشرفت‌های آینده در این حوزه نشان خواهد داد که چگونه فناوری‌های مختلف می‌توانند بهم پیوند خورده و راهکارهای جامع‌تری در مدیریت منابع در محیط‌های ابری فراهم آورند.

#کوبرنتیس #GPU #پروژه‌های_متن‌باز #مدیریت_منابع

🟣لینک مقاله:
https://www.cncf.io/blog/2026/08/07/does-kubernetes-dra-replace-hami/?utm_source=tldrdevops


👑 @DevOps_Labdon