884 subscribers
44 photos
3 videos
1 file
1.4K links
🕸 Database Academy

حمایت مالی:
https://www.coffeete.ir/mrbardia72

ادمین:
@mrbardia72
Download Telegram
🔵 عنوان مقاله
What COVID did to our forecasting models (12 minute read)

🟢 خلاصه مقاله:
در مارس سال 2020، پاندمی کووید-19 باعث شد تا مدل‌های پیش‌بینی تقاضای Airbnb به شدت دچار مشکل شوند. این مدل‌ها که بر اساس الگوهای تاریخی و ثابتی آموزش دیده بودند، در مواجهه با نوسانات شدید در حجم رزروها، افزایش غیرمنتظره در میزان کنسل‌ها و همچنین از هم پاشیدگی رابطه معمول بین تاریخ رزرو و تاریخ سفر (ترکیب زمان پیش‌بینی) ناتوان شدند. این شوک‌های ناگهانی و بی‌سابقه، نیازمند اصلاح و به‌روزرسانی‌های جدی در ساختار مدل‌ها بود تا بتوانند وضعیت جدید را بهتر درک کرده و پیش‌بینی‌های دقیق‌تری ارائه دهند.

برای مقابله با این چالش‌ها، تیم‌های فنی Airbnb تصمیم گرفتند فرآیند پیش‌بینی خود را به دو بخش مجزا تقسیم کنند: ابتدا، شاخص‌های کلان رزرو در محور تاریخ رزرو، که نشان‌دهنده حجم کلی و روندهای کلی در درخواست‌های سفر است؛ و دوم، ترکیب زمان پیش‌بینی یا همان نسبت رزروهایی که در هر بازه زمانی خاص انجام شده است، که به طور مستقیم به رفتارهای سفر و معمولاً تغییرپذیر مشتریان مرتبط است. این رویکرد جداگانه کمک کرد تا مدل‌ها بتوانند بهتر با تحولات ناگهانی و نوسانات بازار تطابق پیدا کنند و پیش‌بینی‌های قابل اعتماد‌تری در شرایط بحرانی ارائه دهند.

در نتیجه، این تغییرات باعث شد تا Airbnb بتواند دودسته از داده‌های حساس و متفاوت را به صورت مستقل تحلیل کرده و با انعطاف بیشتری به تغییرات واکنش نشان دهد. ترمیم و بهبود مدل‌ها پس از بحران کووید، دلیل مهمی بود که شرکت در ادامه توانست اعتماد کاربران و میزبانان را حفظ کند و پایه‌ای مستحکم برای مواجهه با نوسانات آینده شکل دهد.

#پیش‌بینی #تحولات_بازار #ویزای_سفر #مدل‌سازی

🟣لینک مقاله:
https://medium.com/airbnb-engineering/what-covid-did-to-our-forecasting-models-and-what-we-built-to-handle-the-next-shock-ccbf0e1f7fa9?utm_source=tldrdata


👑 @Database_Academy
🕊1
🔵 عنوان مقاله
SlowQL: A SQL Static Analyzer

🟢 خلاصه مقاله:
در دنیای مدیریت بانک‌های اطلاعاتی، امن و بهتر کردن عملکرد کوئری‌ها اهمیت زیادی دارد. یکی از چالش‌های اصلی توسعه‌دهندگان، شناسایی الگوهای خطرناک قبل از انتشار در محیط عملیاتی است تا از ایجاد آسیب‌پذیری‌های امنیتی و کاهش کارایی سیستم جلوگیری شود. در پاسخ به این نیاز، ابزاری به نام SlowQL توسعه یافته است که به عنوان یک تحلیلگر استاتیک SQL عمل می‌کند و می‌تواند الگوهای خطرناک و نادرست در کوئری‌ها را پیش از آنکه وارد محیط عملیاتی شوند، شناسایی کند.

این ابزار به‌طور کامل به صورت آفلاین کار می‌کند و بیش از ۲۵۰ قاعده مختلف در زمینه‌هایی مانند امنیت، جلوگیری از الگوهای منفی در عملکرد، و رعایت نکات مطابقت و استانداردها را در بر می‌گیرد. از مزایای مهم آن، امکان تحلیل دقیق و معیاری است که باعث می‌شود توسعه‌دهندگان بتوانند کوئری‌های خود را قبل از اجرای نهایی، بررسی و بهبود دهند. همچنین، این برنامه بیش‌ترین تطابق را با دیالوگ‌های مختلف پایگاه‌های داده مانند PostgreSQL دارد، که این امر تحلیل‌های dialect-aware آن را ممکن می‌سازد و نتایج دقیق‌تر و سازگارتر با سیستمی که در حال توسعه است، ارائه می‌دهد.

این ابزار به عنوان یک راهکار مؤثر و کارآمد در پیشگیری از مشکلات رایج در کوئری‌های SQL، به توسعه‌دهندگان کمک می‌کند تا بهبود امنیت و کارایی برنامه‌های خود را تضمین کنند و از بروز مشکلات جدی در محیط‌های عملیاتی جلوگیری نمایند. حرکت به سمت کدهای امن‌تر و بهینه‌تر، بدون نیاز به اتصال اینترنت و در محیط‌های کاملاً آفلاین، یکی از ویژگی‌های برجسته این سیستم است که آن را به ابزاری قدرتمند و مناسب برای تیم‌های توسعه داده است.

#امنیت_بانک_اطلاعات #بهینگی #تحلیلگر_استاتیک #SQL

🟣لینک مقاله:
https://postgresweekly.com/link/182741/web


👑 @Database_Academy
🔵 عنوان مقاله
TigerFS: A Filesystem Backed by Postgres

🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات، سیستم‌های فایل نقش حیاتی در مدیریت داده‌ها ایفا می‌کنند. پروژه جدیدی از تیم Tiger Data با نام TigerFS به عنوان یک سامانه فایل نوآورانه معرفی شده است که بر پایه پایگاه داده قدرتمند Postgres ساخته شده است. این سیستم فایل، به عنوان یک پل میان کاربران و داده‌ها، امکان دسترسی و مدیریت فایل‌ها را با رویکردی منحصر به فرد فراهم می‌آورد.

TigerFS با استفاده از فناوری FUSE و NFS، هر فایل در این سیستم به عنوان یک ردیف در یک جدول پایگاه داده در نظر گرفته شده است. به عبارت دیگر، تمام فایل‌ها در قالب رکوردهای جداول ذخیره می‌شوند؛ بنابراین، عملیات نوشتن و خواندن فایل‌ها در این سامانه از طریق تراکنش‌های پایگاه داده انجام می‌گیرد. این طراحی باعث می‌شود که همه عملیات‌ها از نظر ACID (تقویت، ناسازگاری، ایزولاسیون و دوام) حفظ شوند و در نتیجه، پایایی و صحت داده‌ها تضمین شود.

یکی از ویژگی‌های برجسته TigerFS، قابلیت همزمانی در خواندن و نوشتن است. چند کاربر می‌توانند به صورت همزمان فایل‌ها را بخوانند و ویرایش کنند بدون نگرانی از به هم خوردن تراکنش‌ها یا ایجاد ناسازگاری. این امر به ویژه در سیستم‌هایی که نیازمند هماهنگی و همکاری میان عوامل مختلف هستند، اهمیت فراوانی دارد. در نتیجه، TigerFS به عنوان ابزاری ایده‌آل برای مدیریت منابع و انجام عملیات همزمان در ابزارهای مختلف، به کاربران عرضه شده است.

در نهایت، این سامانه فایل طراحی شده است تا در پروژه‌های مربوط به هماهنگی میان عامل‌ها و یا هر ابزاری که با فایل‌ها سروکار دارد، کارایی و قابلیت اطمینان بالایی داشته باشد. با ترکیب قدرت پایگاه داده PostgreSQL و فناوری‌های مدرن فایل سیستم، TigerFS امکان مدیریت داده‌های بزرگ و همزمانی پیچیده را با سادگی و کارآمدی فراهم می‌کند.

#سیستم_فایل #پایگاه_داده #تراکشن #همزمانی

🟣لینک مقاله:
https://postgresweekly.com/link/182736/web


👑 @Database_Academy
🔵 عنوان مقاله
How Notion Scaled AI Q&A to Millions of Workspaces (11 minute read)

🟢 خلاصه مقاله:
در طول زمان، پلتفرم پرسش و پاسخ مبتنی بر هوش مصنوعی نوتیون توانسته است به طور گسترده‌ای در میان میلیون‌ها فضای کاری سراسر جهان برود و کاربران زیادی را جذب کند. این موفقیت بزرگ نتیجه تحولاتی است که در ساختار جستجوی برداری سیستم صورت گرفته است، از جمله وارد کردن داده‌ها به صورت دوگانه، بهینه‌سازی وضعیت صفحات، مهاجرت به زیرساخت سرورلس، و تغییر به توربوپافر. این تصمیمات مهندسی باعث شد تا فرآیند ثبت‌نام و راه‌اندازی سیستم تا حد قابل توجهی بهبود یابد، هزینه‌های مربوط به جستجو همچنان کاهش یابد و پاسخگویی سیستم سریع‌تر و کارآمدتر باشد؛ به‌طوری که، برای نمونه، تأخیر در پاسخ‌گویی (پایین‌ترین حالت) به ۵۰ تا ۷۰ میلی‌ثانیه رسید.

علاوه‌براین، با استفاده از فناوری‌های مانند ری و آنی‌اسکیل، هزینه‌های زیرساخت مرتبط با ایجاد و مدیریت وکتورها بیش از ۹۰ درصد کاهش یافته است. تمامی این تحولات، در کنار ساده‌سازی ساختار سیستم، باعث شد تا سیستم حالا بسیار کم‌هزینه‌تر، کاربرپسندتر و برای کاربردهای لحظه‌ای و زمان واقعی بسیار مناسب‌تر باشد. این پیشرفت‌ها نشانگر یک مرحله مهم در توسعه فناوری نوتیون است که توانسته است با بهره‌گیری از نوآوری‌های مهندسی، تجربه کاربر و هزینه‌های عملیاتی را به شکل چشم‌گیری ارتقا دهد.

#هوش_مصنوعی #توسعه_تکنولوژی #نوتیون #پردازش_پایگاه

🟣لینک مقاله:
https://www.datatinkerer.io/p/how-notion-scaled-ai-q-and-a-to-millions-of-workspaces?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Digging into pg_plan_advice: Query Plan 'Hints' for Postgres 19

🟢 خلاصه مقاله:
در مقاله اخیر، به بررسی دقیق و جامع بخش «pg_plan_advice» در پایگاه داده پستگرس پرداخته شد، جایی که به نوعی "تغییرات راهنمایی" در برنامه‌های استعلام، مورد بررسی قرار می‌گیرد. این قابلیت، امکان ارائه پیشنهاداتی برای بهبود و بهینه‌سازی برنامه‌های استعلام را فراهم می‌کند و می‌تواند نقش مهمی در افزایش کارایی و عملکرد سیستم‌های پایگاه داده ایفا کند.

در این مطلب، رابرت هاس، کارشناس معروف در حوزه پستگرس، توضیحات مفصلی در این زمینه ارائه داد، اما هوبرت در ادامه با نمونه‌هایی عملی و کاربردی، توضیحات خود را عمیق‌تر کرده است. او از ابزار explain.depesz برای نشان دادن نحوه استفاده و تأثیر این پیشنهادات در برنامه‌های استعلام بهره گرفته است. این نمونه‌ها به خوانندگان کمک می‌کنند تا بتوانند بهتر درک کنند چطور می‌توانند از «pg_plan_advice» بهره‌مند شوند و استعلام‌های خود را به صورت بهینه‌تر اجرا کنند.

این مقاله، تمرکز ویژه‌ای بر نحوه عملی‌سازی و مزایای این فناوری در مدیریت بهتر منابع و کاهش زمان اجرای استعلام‌ها دارد، که می‌تواند برای توسعه‌دهندگان و مدیران پایگاه داده بسیار مفید باشد. در نتیجه، مطالعه این منابع و آزمایش نمونه‌های ارائه شده، بی‌شک گامی مؤثر در بهبود بهره‌وری و بهینه‌سازی عملکرد سیستم‌های پستگرس است.

#پستگرس #بهینه‌سازی #پایگاه_داده #برنامه_نویسی

🟣لینک مقاله:
https://postgresweekly.com/link/182716/web


👑 @Database_Academy
🔵 عنوان مقاله
Beyond the Vector Store: Building the Full Data Layer for AI Applications (7 minute read)

🟢 خلاصه مقاله:
در دنیای پیشرفته هوش مصنوعی امروزی، تکیه صرف بر روی یک پایگاه داده وکتوری دیگر کافی نیست، مخصوصاً در حوزه‌هایی مانند سیستم‌های سؤال و پاسخ مبتنی بر اطلاعات (RAG) و سامانه‌های عامل‌پذیر (Agentic systems). برای توسعه یک لایه داده‌ای کامل و کارآمد در این حوزه‌ها، نیازمند ترکیب چندین مؤلفه مهم و هم‌راستا هستیم. این مؤلفه‌ها شامل ذخیره‌گاه وکتور، متادیتا و فیلترگذاری، لایه گراف، کش (Cache)، و همچنین نظارت و حاکمیت داده‌ها می‌شوند. ترکیب این عناصر، معماری‌های هیبریدی مبتنی بر وکتور، گراف و رابطه‌ای را به وجود می‌آورد که در نهایت منجر به بهبود دقت، صرفه‌جویی در هزینه و آمادگی واقعی برای تولید در سامانه‌های عملی می‌شود.

این رویکرد چندجانبه، امکان مدیریت بهتر داده‌ها، کاهش اشتباهات و افزایش کارایی سامانه‌های هوش مصنوعی را فراهم می‌آورد. به جای تکیه بر یک منظره محدود، به سمت معماری‌های جامع و ترکیبی حرکت می‌کنیم که هر عنصر نقش مشخص و مکمل خود را ایفا می‌کند. در نتیجه، سیستم‌های هوشمند قادر خواهند بود به صورت مؤثرتر و سریع‌تر به نیازهای پیچیده کاربران پاسخ دهند و در محیط‌های تولیدی با نیازهای واقعی عملیات کنند.

#هوش_مصنوعی #معماری_هیبرید #توسعه_داده #مدیریت_هوشمند

🟣لینک مقاله:
https://machinelearningmastery.com/beyond-the-vector-store-building-the-full-data-layer-for-ai-applications/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
PostgreSQL Conference Germany 2026

🟢 خلاصه مقاله:
کنفرانس PostgreSQL در آلمان در سال ۲۰۲۶ قرار است در شهر آخن (Essen) برگزار شود. این رویداد مهم در تاریخ ۲۱ و ۲۲ آوریل برگزار می‌گردد و فرصت بسیار خوبی برای توسعه‌دهندگان، مدیران و کارشناسان پایگاه داده‌های PostgreSQL است تا در کنار یکدیگر جدیدترین فناوری‌ها، بهترین شیوه‌ها و پیشرفته‌ترین ابزارها را بررسی و تبادل نظر کنند. کنفرانس‌های مشابه در گذشته نقش مهمی در ارتقاء دانش فنی جامعه PostgreSQL داشته‌اند و انتظار می‌رود که این رویداد در سال آینده نیز با حضور فعال شرکت‌کنندگان و سخنرانان برتر، به یکی از بزرگ‌ترین گردهمایی‌های مرتبط با این فناوری تبدیل شود.

این همایش محل جمع‌ شدن علاقه‌مندان به PostgreSQL است تا در جلسات تخصصی، کارگاه‌های آموزشی و میزگردهای تخصصی، فرصت‌های بی‌نظیری برای یادگیری، شبکه‌سازی و همکاری‌های جدید بیابند. برگزارکنندگان با هدف ارتقاء سطح علمی و فنی جامعه، برنامه‌هایی جذاب و متنوع تدارک دیده‌اند که هم فرصت آموزشی است و هم محیط مناسبی برای ایجاد ارتباطات حرفه‌ای و تعمیق دانش فنی است.

این رویداد در شهر آخن، که یکی از شهرهای تاریخی و فرهنگی آلمان است، برگزار می‌شود و می‌تواند به عنوان یک فرصت طلایی برای شرکت‌کنندگان ایرانی و علاقه‌مندان بین‌المللی باشد تا ضمن حضور در یک مکان فرهنگی و تاریخی، از نزدیک با آخرین دستاوردهای PostgreSQL آشنا شوند و شبکه‌سازی جهانی انجام دهند.

#PostgreSQL #کنفرانس #آلمان #توسعه_فنی

🟣لینک مقاله:
https://postgresweekly.com/link/182722/web


👑 @Database_Academy
🔵 عنوان مقاله
Building a Production-Grade Multi-Node Training Pipeline with PyTorch DDP (8 minute read)

🟢 خلاصه مقاله:
در دنیای یادگیری ماشین و آموزش مدل‌های پراکنده، ساختن یک مسیر آموزشی قابل اعتماد و کارآمد برای سیستم‌های گسترده و چندگانه اهمیت زیادی دارد. این مقاله بر ارائه یک راهکار مدولار و آماده بهره‌برداری در قالب پلی‌لاین تولیدی با استفاده از PyTorch Distributed Data Parallel (DDP) تمرکز دارد که امکان آموزش در چندین نود و چندین کارت گرافیک را به صورت همزمان فراهم می‌کند. هدف اصلی، طراحی یک سامانه مقاوم، مقیاس‌پذیر و آسان در پیاده‌سازی است تا تیم‌های توسعه بتوانند پروژه‌های بزرگ و پیچیده را با اطمینان اجرا کنند و نتایج مطلوبی کسب نمایند.

در بخش‌های آغازین، مفهوم DDP در PyTorch و اهمیت آن در آموزش‌های توزیع‌شده توضیح داده می‌شود. سپس، جزئیات مربوط به ساختار اولیه و نحوه تنظیم زیرساخت‌های لازم برای اجرای یک مسیر آموزشی چندنود ارائه می‌گردد. در ادامه، نکات کلیدی در بهبود عملکرد و کاهش زمان آموزش، مانند مدیریت صحیح حافظه و همگام‌سازی داده‌ها، بررسی می‌شود. علاوه بر این، مثال‌های عملی و کدهای نمونه برای پیاده‌سازی یک مسیر آموزشی مدولار و قابل توسعه، شرح داده می‌شود تا توسعه‌دهندگان بتوانند به راحتی آن را در پروژه‌های خود به کار گیرند.

در پایان، مزایای استفاده از این رویکرد مدولار و تولیدی در مقیاس سازمانی مورد تأکید قرار می‌گیرد و نکاتی در رابطه با بهترین شیوه‌ها و نکات نگهداری و پشتیبانی در پیاده‌سازی چنین مسیرهای آموزشی ارائه می‌شود. این مقاله، راهنمایی کامل برای توسعه‌دهندگانی است که می‌خواهند آموزش در مقیاس بزرگ را به روشی کارآمد و پایدار پیاده‌سازی کنند.

#یادگیریماشین #پایتورچ #توزیع_یادگیری #هوش_مصنوعی

🟣لینک مقاله:
https://towardsdatascience.com/building-a-production-grade-multi-node-training-pipeline-with-pytorch-ddp/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Monitoring Your Feast Feature Server with Prometheus and Grafana (5 minute read)

🟢 خلاصه مقاله:
در دنیای امروزی، نظارت بر سرورها و سرویس‌های کاربردی اهمیت زیادی دارد تا بتوان از عملکرد صحیح آن‌ها اطمینان حاصل کرد. فیست، یکی از ابزارهای مدیریت ویژگی‌ها، به‌طور داخلی امکاناتی برای نظارت ارائه می‌دهد که با ادغام با Prometheus و OpenTelemetry، این سرویس دقیق‌تر و قابل‌مشاهده‌تر می‌شود. به لطف این قابلیت‌ها، تیم‌های توسعه و عملیات می‌توانند در زمان واقعی میزان تأخیر، حجم درخواست‌ها، نحوه بازگرداندن ویژگی‌ها و سلامت سیستم را پایش کنند. این امکانات کمک می‌کند تا اطمینان حاصل شود که سرویس‌ها مطابق سطح خدمات مورد انتظار (SLO) عمل می‌کنند و در صورت بروز مشکل، هشدارهای مناسب فعال شوند. در نتیجه، مدیریت و بهبود فرآیندها بسیار آسان‌تر خواهد شد و بهره‌وری تیم‌ها به شکل چشمگیری افزایش می‌یابد.

در واقع، افزودن سیستم‌های نظارتی قدرتمند مانند Prometheus و Grafana به فیست، تجربه‌ای مشابه با نظارت بر APIهای تولیدی را فراهم می‌آورد. این ابزارها با جمع‌آوری داده‌های عملکرد، به تیم‌ها این امکان را می‌دهند تا بهره‌وری سرویس را ارزیابی کرده، مشکلات را سریع‌تر شناسایی کرده و در نهایت، کیفیت ارائه خدمات را ارتقاء دهند. استفاده از این فناوری‌ها نه تنها باعث تثبیت اعتماد به سرویس می‌شود، بلکه فرآیندهای بهبود مستمر را تسهیل می‌کند و از بروز احتمالی خطاها جلوگیری می‌نماید.

در نهایت، با بهره‌گیری از این سیستم‌های نظارتی، تیم‌های فنی می‌توانند دیدی جامع نسبت به وضعیت سرویس‌های فیست داشته باشند و اطمینان حاصل کنند که محصول نهایی با استانداردهای لازم مطابقت دارد، همواره آماده پاسخگویی به نیازهای کاربران و بازار باشد. این رویکرد، کلید موفقیت در ارائه خدمات پایدار، قابل‌اعتماد و با کیفیت است.

#نظارت #Prometheus #Grafana #فیست

🟣لینک مقاله:
https://feast.dev/blog/feast-feature-server-monitoring/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Why Data Engineers Should Care About Pydantic (5 minute read)

🟢 خلاصه مقاله:
در دنیای پردازش داده‌ها، مهندسان داده نقش مهمی در ساخت و نگهداری زیرساخت‌های داده‌ای دارند. یکی از دغدغه‌های اصلی آن‌ها، اطمینان از صحت و سازگاری داده‌ها در طول مسیر انتقال و پردازش است. در این راستا، ابزارها و فریمورک‌های مختلفی توسعه یافته‌اند، اما یکی از فناوری‌های نوین و کارآمد در این حوزه، Pydantic است. نسخه جدید آن، یعنی Pydantic v2، با امکانات فوق‌العاده خود، نقشی حیاتی در بهبود فرآیند اعتبارسنجی داده‌ها ایفا می‌کند. این ابزار با اجرای اعتبارسنجی سریع و تعاریف صریح، کمک می‌کند قراردادهای داده‌ای که در قالب کد نوشته می‌شوند، کاملاً قابل فهم و قابل اطمینان باشند. به عبارت دیگر، Pydantic v2، جایگزین قابل اعتمادی برای بررسی و کنترل صحت داده‌ها در مسیرهای پردازشی پایتون است و باعث شفاف‌تر شدن ساختارهای داده می‌شود.

نسخه جدید این ابزار با روشی سریع و بر مبنای تعریف‌های صریح، تغییر داده‌های نهان (implicit data contracts) را به سیستمی شفاف و قابل بررسی تبدیل می‌کند. این ویژگی به مهندسان داده امکان می‌دهد تا بررسی‌های دقیقی روی داده‌ها انجام دهند و خطاهای احتمالی را قبل از ورود به مراحل حساس پیگیری و رفع کنند. در نتیجه، این فناوری به عنوان یک ابزار قدرتمند در پیاده‌سازی خطوط داده‌ی موثر و امن در پروژه‌های پایتون شناخته می‌شود، چرا که بهبود کیفیت داده‌ها و جلوگیری از بروز خطاهای پیش‌بینی نشده را تسهیل می‌کند.

در نهایت، استفاده از Pydantic v2 برای مهندسان داده، نه تنها فرآیند اعتبارسنجی را تسریع می‌کند، بلکه شفافیت و اعتمادپذیری سیستم‌های داده‌ای را نیز افزایش می‌دهد. در دنیای امروز که حجم داده‌ها روز به روز بیشتر می‌شود، این ابزار می‌تواند به عنوان یک پلتفرم پیشرو، نقش کلیدی در ساخت داده‌های معتبر و پایدار ایفا کند. بنابراین، مهندسان داده باید این فناوری را جدی بگیرند و از امکانات آن در پروژه‌های خود بهره‌مند شوند.

#مهندسی_داده #Pydantic #اعتبارسنجی_داده #پایپ‌لاین

🟣لینک مقاله:
https://blog.dataengineerthings.org/why-data-engineers-should-care-about-pydantic-821eb0f6c892?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
When upserts don't update but still write: Debugging Postgres performance at scale (11 minute read)

🟢 خلاصه مقاله:
در هنگام ایجاد و بروزرسانی داده‌ها، گاهی اوقات مشاهده می‌شود که عملیات آپ‌سرت به‌درستی انجام نمی‌شود اما همچنان داده‌ها نوشته می‌شوند. این موضوع در ‎Postgres‎، وقتی اتفاق می‌افتد که قصد دارید رکوردهای موجود را با استفاده از دستور ‎UPSERT‎ بروزرسانی کنید، اما در عین حال عملکرد سیستم کاهش پیدا می‌کند و تعداد نوشته‌ها و همزمان‌سازی‌های WAL به طور غیرمنتظره‌ای افزایش می‌یابد.

در یک تجربه عملی، تیم Datadog هنگام پاک‌سازی میلیونی میزبان‌های موقتی متوجه مشکلی در ‎Postgres‎ شد. در این فرآیند، عملیات ساده‌ای برای به‌روزرسانی زمان مشاهده آخرین بار در سرویس داده شد؛ ولی این عمل منجر به دو برابر شدن تعداد نوشتن‌های روی دیسک و چهار برابر شدن همزمان‌سازی‌های WAL شد. بررسی‌های بعدی نشان داد که مشکل اصلی از نحوه مدیریت عملیات ‎ON CONFLICT DO UPDATE‎ ناشی می‌شود، زمانی که این دستور همواره قفل ردیف مورد نظر را می‌گیرد و حتی در مواردی که داده تغییری نمی‌کند، عملیات نوشتن در WAL انجام می‌گیرد.

راه‌حل این مشکل، جلوگیری از قفل شدن در مواردی است که آپ‌سرت بدون تغییر داده‌ها انجام می‌شود. به عبارت دیگر، باید راهی پیدا کنیم که در صورت عدم نیاز به بروزرسانی، عملیات قفل و نوشته انجام نگیرد تا کارایی سیستم حفظ شود و فشار روی دیسک و WAL کاهش یابد. این رویکرد باعث می‌شود که سیستم پایدارتر و بهینه‌تر عمل کند، مخصوصاً در فرآیندهای بزرگ و مقیاس‌پذیر.

#پایگاه_داده #Postgres #بهینه‌سازی #عملکرد

🟣لینک مقاله:
https://www.datadoghq.com/blog/engineering/debugging-postgres-performance/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
The Real Cost of Random I/O

🟢 خلاصه مقاله:
با گذشت بیش از بیست و پنج سال، سوالی که درباره میزان مناسب هزینه‌ی صفحات تصادفی (random_page_cost) در سیستم‌های مدیریت پایگاه داده مطرح می‌شود، همچنان محل بحث است. در ابتدا، مقدار پیش‌فرض ۴.۰ برای این پارامتر، بر اساس فرضیه‌ای ساده مبنی بر کارایی نسبی دسترسی‌های تصادفی نسبت به ترتیبی تعیین شده بود. اما با پیشرفت فناوری‌های ذخیره‌سازی، مخصوصاً استفاده از حافظه‌های فلش، این فرضیه دیگر چندان صادق نیست و نیازمند بازبینی است.

در آزمایش‌های کنترل‌شده‌ای که واندر انجام داده است، تأثیر مستقیم عملیات I/O بر روی حافظه‌های فلش مورد بررسی قرار گرفت. نتایج این تحقیقات نشان می‌دهند که پاسخ به سؤال درباره‌ میزان مناسب هزینه‌ی تصادفی بسیار پیچیده‌تر از تنها تنظیم مقدار آن روی ۱ است. در واقع، فاکتورهای متعددی نظیر نوع ذخیره‌سازی، نوع عملیات‌های داده‌ای و ساختار ماشین‌آلات اثرگذارند و باید متناسب با شرایط خاص هر سیستم، تنظیم شوند.

بنابراین، گزینه‌ی «تنظیم مستقیم این پارامتر بر روی ۱» تنها یک راه حل ساده و کلیشه‌ای نیست؛ بلکه باید بر اساس آزمایش‌ها و سنجش‌های نمونه‌ای مشخص، تعیین گردد. این یافته‌ها نشان می‌دهند که در عصر فناوری‌های نوین، گام‌های مدیریتی باید بر پایه داده‌های عملی و تجزیه و تحلیل‌های دقیق باشد و صرفاً روی مقادیر پیش‌فرض یا تنظیمات قدیمی تکیه نکنیم.

به همین دلیل، متخصصان و مدیران پایگاه داده باید به جای اعتماد صرف به مقادیر از پیش تعیین شده، آزمایش‌های تخصصی بر روی محیط‌های خود انجام دهند و تنظیمات مناسب را بر اساس نتایج به‌دست‌آمده بریزند. این روند کمک می‌کند عملکرد سیستم‌ها به صورت بهینه‌تر و با توجه به فناوری‌های روز مدیریت شود.

#پایگاه_داده #حافظه_فلش #مدیریت_بهینه #تنظیمات_فناوری

🟣لینک مقاله:
https://postgresweekly.com/link/183118/web


👑 @Database_Academy
🔵 عنوان مقاله
MotherDuck Now Speaks Postgres (4 minute read)

🟢 خلاصه مقاله:
در دنیای داده‌ها، یکی از چالش‌های مهم مدیریت همزمان فعالیت‌های تراکنشی و تحلیل‌های پیچیده است. MotherDuck با معرفی یک نقطه انتهای جدید سازگار با PostgreSQL، قابلیت‌هایی را فراهم کرده است که این دو حوزه بتوانند با هماهنگی بیشتری عمل کنند. این ویژگی جدید به کاربران این امکان را می‌دهد که با استفاده از هر کلاینت، درایور یا ابزار تجاری برخط استاندارد PostgreSQL، به داده‌های خود در مخزن داده MotherDuck متصل شوند و کوئری‌های مورد نیاز خود را اجرا کنند.

این راه‌حل به تیم‌ها کمک می‌کند تا تراکنش‌های روزمره و عملیات‌های حساس را در محیط تراکنشیِ PostgreSQL مدیریت کرده و در عین حال، بار تجزیه و تحلیل‌های پیچیده و سریع را بر روی سرورless و مقیاس‌پذیر MotherDuck انجام دهند. نتیجه این است که شاهد بهبود کارایی، کاهش بار روی سیستم‌های تراکنشی و افزایش سرعت در تحلیل داده‌ها خواهیم بود، بدون اینکه نیاز به انتقال داده‌ها یا پیکربندی مجدد زیرساخت‌ها باشد.

در نتیجه، این ابزار جدید به تیم‌های داده‌ای اجازه می‌دهد تا تمرکز خود را صرفا بر روی توسعه و تحلیل‌های هوشمندانه نگه دارند و عملیات تراکنشی و تحلیلی خود را به شکل بهتری مدیریت کنند. این ابتکار، مسیر جدیدی را در یکپارچگی و کارایی سیستم‌های مدیریت داده‌ها رقم زده است.

#داده #تحلیل_پایگاه‌داده #PostgreSQL #MotherDuck

🟣لینک مقاله:
https://motherduck.com/blog/motherduck-now-speaks-postgres/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Multigres Operator: A Kubernetes Operator for Multigres

🟢 خلاصه مقاله:
متاکرز یک فناوری مبتنی بر معماری افقی‌پایدار و شیاردار همچون Vitess است که برای پایگاه‌داده Postgres توسعه یافته است. این معماری به طور خاص برای افزایش قابلیت توسعه و مدیریت آسان‌تر داده‌ها در محیط‌های بزرگ و مقیاس‌پذیر طراحی شده است. یکی از مهم‌ترین ویژگی‌های متاکرز، امکان تقسیم داده‌ها و توزیع بار است، که به تیم‌های توسعه کمک می‌کند تا بتوانند بار ترافیک را به صورت موثر مدیریت کنند و سیستم‌های پایگاه‌داده را از نظر قابلیت اطمینان و کارایی بهبود بخشند.

در این راستا، توسعه‌دهندگان یک اپراتور مخصوص برای Kubernetes ساخته‌اند که متاکرز را در این پلتفرم قدرتمند به کار می‌گیرد. این اپراتور اجازه می‌دهد تا نمونه‌های پایگاه‌داده به شکل خودکار در محیط کلاسترهای Kubernetes ساخته شده و مدیریت شوند. با این کار، فرآیندهای پیچیده مرتبط با راه‌اندازی و نگهداری پایگاه‌داده‌های شیاردار به صورت قابل اعتماد و ساده‌تر انجام می‌پذیرد و به تیم‌ها کمک می‌کند تا سریع‌تر تمرکز خود را بر توسعه و بهبود برنامه‌های خود بگذارند.

با این حال، باید توجه داشت که این اپراتور در حال حاضر به صورت کامل برای محیط‌های تولیدی آماده نیست. تیم توسعه در حال کار مداوم بر روی بهبود و تثبیت آن است و انتظار می‌رود طی چند ماه آینده، نسخه نهایی و قابل اعتماد برای استفاده در محیط‌های عملیاتی آماده شود. این پروژه پتانسیل زیادی دارد و می‌تواند راه‌حل مناسبی برای سازمان‌هایی باشد که به دنبال بهره‌برداری بهتر از پایگاه‌های داده در استقرارهای مبتنی بر Kubernetes هستند.

در مجموع، توسعه این اپراتور نشان‌دهنده حرکت رو به جلو در زمینه ادغام پایگاه‌داده‌های شیاردار با فن‌آوری‌های مدرن است و می‌تواند نقش مهمی در آینده زیرساخت‌های ابری و مدیریت داده‌ها ایفا کند.

#پایگاه_داده #Kubernetes #متاکرز #مدیریت_داده

🟣لینک مقاله:
https://postgresweekly.com/link/183127/web


👑 @Database_Academy
🔵 عنوان مقاله
AI Is Here, But The Hard Parts Haven't Changed (8 minute read)

🟢 خلاصه مقاله:
در حال حاضر، استفاده از هوش مصنوعی تقریباً در تمامی حوزه‌ها رایج شده است؛ به طوری که ۹۹.۵ درصد شرکت‌ها از ابزارهای مبتنی بر AI بهره‌مند هستند و ۸۲ درصد افراد، روزانه یا بیشتر از این فناوری استفاده می‌کنند. در این میان، مدل‌های مانند کلود (Claude) نقش غالب را دارد و جایگاه ویژه‌ای در این عرصه پیدا کرده است. اما با وجود این پیشرفت‌های چشمگیر، هوش مصنوعی نتوانسته است بر چالش‌های اصلی غلبه کند که همان مسائل بنیادین و اساسی فناوری است.

مشکلات کلاسیک و قدیمی مانند سیستم‌های قدیمی وLegacy، کمبود رهبری و هدایت استراتژیک، نیازهای نامشخص و ناقص، و لایه‌های داده‌ای و معنایی پیچیده هنوز هم باقی مانده‌اند و مانع اصلی در بهره‌برداری کامل از قابلیت‌های AI محسوب می‌شوند. در واقع، هوش مصنوعی می‌تواند سرعت تولید محصولات و خدمات را افزایش دهد، اما اگر اصول پایه و زیرساخت‌های اساسی مانند درک درست زمینه، مسئولیت‌پذیری، و معماری مناسب نادیده گرفته شوند، ممکن است نتیجه‌ای جز بدهی فنی بیشتر و ایجاد محیط‌های تولیدی پر از مشکلات به همراه نداشته باشد.

در نتیجه، علی‌رغم سرعت و کارایی که AI ارائه می‌دهد، نمی‌توان از چالش‌های ساختاری و سازمانی صرف‌نظر کرد. بدون توجه به این نکات، فناوری تنها سطحی از پیشرفت است و نمی‌تواند جایگزین مدیریت هوشمند و تعریف استراتژیک صحیح در سازمان‌ها شود. تنها با تمرکز بر اصلاح این ضعف‌های بنیادین است که می‌توان حداکثر بهره‌برداری از فناوری‌های نوین داشت و آینده‌ای پایدار و کارآمد ساخت.

#هوش_مصنوعی #توسعه_فناوری #مدیریت_سخت‌افزار #برنامه‌نویسی

🟣لینک مقاله:
https://joereis.substack.com/p/ai-is-here-but-the-hard-parts-havent?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Analyzing round-trip query latency (6 minute read)

🟢 خلاصه مقاله:
در دنیای مدیریت پایگاه‌های داده، توجه صرف به زمان اجرا درونی پایگاه‌ داده کافی نبوده و نمی‌تواند تصویری کامل از عملکرد سیستم ارائه دهد. به همین دلیل، تیم Datadog تمرکز خود را بر روی اندازه‌گیری و تحلیل « زمان تاخیر سفر رفت و برگشت پرس‌وجو» قرار داد، یعنی مدت زمانی که یک پرس‌وجو طول می‌کشد تا از کاربر به سرور برسد و پاسخ نهایی برگردد. با استفاده از ابزارهای مشاهده‌پذیری سفارشی، آن‌ها توانستند بخش‌های مختلف این تاخیر را تجزیه و تحلیل کنند و جزئیات دقیقی از عوامل موثر بر آن بدست آورند.

این رویکرد جدید به شناسایی بن‌بست‌ها و مشکلات پنهان در سیستم‌های پایگاه‌ داده کمک کرد. نتایج نشان داد که عوامل مختلفی می‌توانند باعث ایجاد تأخیرهای قابل توجه شوند، از جمله رقابت در استخر اتصالات، نوسانات مدت زمان انتقال داده‌ها در شبکه، و روش‌های ناکارآمد در پردازش نتایج. شناخت این عوامل، راهکارهای بهبود و بهینه‌سازی عملکرد سیستم را آسان‌تر ساخت و به تیم‌های توسعه و عملیات کمک کرد تا مشکلات را سریع‌تر شناسایی و برطرف کنند.

در نتیجه، تمرکز بر روی اندازه‌گیری و تحلیل دقیق زمان‌های سفر رفت و برگشت پرس‌وجو، راهکاری قدرتمند برای بهبود کارایی پایگاه‌های داده است. این رویکرد نه تنها به کشف مشکلات پنهان کمک می‌کند، بلکه امکان بهبود مستمر و افزایش بهره‌وری سیستم‌های اطلاعاتی را فراهم می‌آورد. با استفاده از این روش، شرکت‌ها می‌توانند تجربه کاربری بهتری فراهم کرده و پاسخ‌دهی سریع و کارآمدتری داشته باشند.

#پایگاه_داده #عملکرد_سیستم #تحلیل_تاخیر #پایش_سرویس

🟣لینک مقاله:
https://www.datadoghq.com/blog/analyzing-roundtrip-query-latency/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Migrating a Production Database from Heroku to AWS

🟢 خلاصه مقاله:
در این مقاله، فرآیند مهاجرت یک بانک اطلاعاتی تولیدی از پلتفرم هرکو به سرویس آمازون ردی (AWS RDS) به طور کاربردی شرح داده شده است. یکی از نکات جالب در این روش، استفاده از یک سرور موقت EC2 به عنوان پلی برای انتقال داده‌ها است. این روش به دلیل محدودیت‌های خاص هرکو است که تنها از طریق آرشیوهای WAL (Write-Ahead Logging) امکان انتقال داده‌ها وجود دارد، زیرا Amazon RDS نمی‌تواند به طور مستقیم از طریق نسخه‌برداری فیزیکی WAL داده‌ها را دریافت کند. به همین دلیل، راه‌حل موقت و مؤثر تضمین انتقال ایمن و بی‌وقفه اطلاعات بود و در نهایت موفق شد کانال انتقال داده‌ها به سمت RDS را فراهم کند.

به طور کلی، این فرآیند نیازمند برنامه‌ریزی دقیق، تهیه سرورهای واسط مؤثر و اجرای مراحلی مرحله‌به‌مرحله بوده است تا داده‌ها بدون از دست رفتن یا آسیب، از محیط‌های قدیمی به محیط‌های جدید منتقل شوند. در ادامه، با همراهی جزئیات فنی و نکات عملی، این مسیر چالش‌برانگیز با موفقیت طی شد، و حالا بانک اطلاعاتی با اطمینان و کارآیی در سرویس ابری جدید بهره‌برداری می‌شود.

#مهاجرت_دیتابیس #AWS #Heroku #رعایت_امنیت

🟣لینک مقاله:
https://postgresweekly.com/link/181921/web


👑 @Database_Academy
🔵 عنوان مقاله
pgmetrics: Collect and Report Stats from Running Postgres Servers

🟢 خلاصه مقاله:
ابزار pgmetrics یک برنامه نوشته‌شده به زبان گو (بدون نیاز به وابستگی‌های خارجی) است که قادر است بیش از ۳۵۰ معیار مختلف مربوط به سرورهای PostgreSQL در حال اجرا را جمع‌آوری و گزارش دهد. این برنامه با جمع‌آوری این داده‌ها، به مدیران پایگاه‌های داده امکان می‌دهد وضعیت سرورها را به سرعت ارزیابی و نظارت کنند. گزارش‌های حاصل از این برنامه نه تنها برای بررسی سریع مفید است، بلکه قالب آن به گونه‌ای طراحی شده است که برای تحلیل توسط مدل‌های زبانی بزرگ (LLMs) نیز بسیار مناسب باشد. این ابزار یک راهکار جامع و کارآمد برای مدیریت و نظارت بر سرورهای PostgreSQL است که قابلیت‌های آن می‌تواند به بهبود عملکرد و رفع مشکل‌های پایگاه داده کمک شایانی کند.

پروژه pgmetrics به عنوان یک ابزار متن‌باز، با طراحی ساده و بدون نیاز به نصب کتابخانه‌های جانبی، امکان استفاده آسان و قابل اعتمادی را فراهم می‌کند. این برنامه نه تنها برای توسعه‌دهندگان و مدیران پایگاه داده، بلکه برای هر کسی که نیاز دارد وضعیت سرورهای PostgreSQL را در لحظه بررسی کند، کاربردی است. بهره‌گیری از این ابزار می‌تواند به بهبود فرآیندهای نگهداری و مدیریت پایگاه داده‌ها کمک زیادی کند و اطمینان حاصل کند که سیستم‌های دیتابیس همیشه در بهترین حالت عملکرد قرار دارند.

#پایگاه_داده #PostgreSQL #نظارت_سرورها #ابزارهای_باز

🟣لینک مقاله:
https://postgresweekly.com/link/183124/web


👑 @Database_Academy
🔵 عنوان مقاله
AlloyDB AI (6 minute read)

🟢 خلاصه مقاله:
در دنیای پایگاه‌های داده، فناوری‌های نوینی در حال توسعه هستند که امکانات جدیدی را برای تحلیل و پردازش داده‌ها فراهم می‌آورند. یکی از این نوآوری‌ها، AlloyDB AI است که به پایگاه داده قدرتمند PostgreSQL امکانات فوق‌العاده‌ای اضافه کرده است. این سیستم جدید با افزودن قابلیت‌های پردازش و جست‌وجوی برداری درون‌ساختی، امکان انجام عملیات پیشرفته روی داده‌ها را برای کاربران فراهم می‌کند. علاوه بر این، AlloyDB AI از روش‌های جست‌وجوی برداری مبتنی بر ScaNN بهره می‌برد که به کسب‌وکارها کمک می‌کند تا داده‌های ناهمگن و پیچیده را به شیوه‌ای سریع و دقیق کاوش کنند.

در حقیقت، این فناوری امکان استفاده از زبان طبیعی در نهادینه کردن پرسش‌های SQL را فراهم می‌کند، به طوری که حتی کاربران غیرتخصصی نیز می‌توانند به راحتی با پایگاه داده تعامل داشته باشند. علاوه بر این، روش‌های تماس مستقیم با مدل‌های هوشمند در این سامانه تسهیل شده است، و کاربران می‌توانند بدون نیاز به واسطه‌های پیچیده، درخواست‌های خود را مستقیماً به مدل‌های زبانی ارسال کنند.

در نتیجه، AlloyDB AI نه تنها سطح عملکرد و انعطاف‌پذیری پایگاه داده را افزایش می‌دهد، بلکه تجربه کاربری را نیز به شدت بهبود می‌بخشد. این نوآوری‌ها آینده مدیریت داده‌ها را دستخوش تحول خواهد کرد و ابزارهای قدرتمندتری را برای تحلیل، بازیابی و بهره‌برداری از داده‌ها در اختیار توسعه‌دهندگان و کسب‌وکارها قرار می‌دهد.

#هوش_مصنوعی #پایگاه داده #تحلیل_داده #فناوریهای_نوین

🟣لینک مقاله:
https://cloud.google.com/alloydb/ai?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Postgres 19 Adding Built-in JSON Export via COPY

🟢 خلاصه مقاله:
در نسخه آینده پایگاه داده پستگرس، قرار است ویژگی‌هایی جدید به ابزار قدرتمند آن افزوده شود که مدیریت داده‌های Json را بسیار ساده‌تر و کارآمدتر می‌کند. یکی از این ویژگی‌ها، افزودن قابلیت صدور مستقیم داده‌های JSON با استفاده از دستور `COPY` است. این امکان به کاربران اجازه می‌دهد داده‌های JSON را مستقیماً و با سرعت بالا از پایگاه داده استخراج کنند، بدون نیاز به انجام عملیات‌های پیچیده یا تبدیل‌های اضافی.

این ویژگی بخصوص برای توسعه‌دهندگان و تحلیل‌گران داده‌ها بسیار حیاتی است، زیرا فرآیند خروجی گرفتن از داده‌های JSON را به شکل قابل اطمینان و کاربرپسند فراهم می‌کند. در نتیجه، کار با داده‌های ساخت یافته در قالب JSON در پروژه‌های مختلف، چه در تولید محتوا، چه در تحلیل‌های آماری یا طراحی سامانه‌های توزیع شده، بسیار آسان‌تر می‌شود. این ابتکار جدید به پایگاه داده پستگرس کمک می‌کند تا ثبت، نگهداری و انتقال داده‌های ساخت یافته را سریع‌تر و موثرتر انجام دهد، و در نهایت، بهره‌وری کاربران را افزایش دهد.

پستگرس با افزودن این قابلیت، استانداردهای جدیدی در زمینه مدیریت داده‌های ساخت یافته تعریف می‌کند و امکان راه‌اندازی سیستم‌های بزرگ و مقیاس‌پذیر را با سرعت و کیفیت بالا فراهم می‌سازد. این به‌روزرسانی وعده می‌دهد که کاربران در آینده بتوانند عملیات‌های مربوط به داده‌های JSON را به شکل کاملاً بومی و بدون نیاز به ابزارهای جانبی انجام دهند، که این امر باعث روزافزون شدن محبوبیت آن در جامعه توسعه‌دهندگان می‌شود.

#پستگرس #داده‌های_JSON #دوره_جدید #توسعه_پایگاه_داده

🟣لینک مقاله:
https://postgresweekly.com/link/183115/web


👑 @Database_Academy