883 subscribers
44 photos
3 videos
1 file
1.39K links
🕸 Database Academy

حمایت مالی:
https://www.coffeete.ir/mrbardia72

ادمین:
@mrbardia72
Download Telegram
🔵 عنوان مقاله
Benchmarking Single Node vs Distributed (5 minute read)

🟢 خلاصه مقاله:
در آزمون عملکرد TPC-H با حجم ۱ ترابایت، زمانی که مشخصات کلی سیستم‌ها هم‌سطح بودند، تفاوت مناطق قابل توجهی مشاهده شد. در این تست، سیستم توزیع‌شده‌ی Polars که روی ۳۲ گره قرار داشت، کمی بهتر از یک سرور تک‌نود m8i.32xlarge عمل کرد؛ اما این برتری تنها در مواردی بود که نوع بار کاری، I/O محور بود. در این نوع کوئری‌ها، شبکه‌ی burst به اوج سرعت ۴۰۰ گیگابیت در ثانیه رسید، در حالی که نود واحد تنها توانایی برقراری ارتباط ماندگار با سرعت ۵۰ گیگابیت در ثانیه داشت. در نتیجه، در این بخش، توان عملیاتی شبکه‌ی بزرگ‌تر باعث شد عملکرد سیستم توزیع‌شده بهتر باشد.

اما در مقابل، کوئری‌هایی که رابطه‌های پیوسته و نیازمند جست‌وجوهای پیوسته و پیچیده بودند، در سیستم تک‌نود سریع‌تر اجرا شدند. این موضوع ناشی از هزینه‌ی بالای جابه‌جایی داده‌ها بین گره‌ها یا همان shuffle بود، به‌خصوص زمانی که شبکه‌ی توزیع شده تلاش می‌کرد این عملیات را مدیریت کند. در چنین مواردی، تکرار عملیات در یک نود واحد، هزینه‌ی مربوط به ارتباط باتری داده‌ها را کاهش داد و در نتیجه سرعت اجرا بهتر بود.

در مجموع، این نتایج نشان می‌دهد که انتخاب بین سیستم‌های تک‌نود و توزیع‌شده باید بر اساس نوع بار کاری و محدودیت‌های سخت‌افزاری انجام گیرد، چرا که هر کدام مزایا و معایب خاص خود را دارند.

#پایگاه‌داده #عملکرد #سیستم‌های‌توزیع‌‌شده #تحلیل‌پایدار

🟣لینک مقاله:
https://pola.rs/posts/single-node-vs-distributed/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
plx: Write Stored Functions in PHP, JavaScript, Python, and More

🟢 خلاصه مقاله:
در هفته‌های اخیر، توسعه‌دهندگان پایگاه داده‌ها شاهد انتشار افزونه‌های متنوعی بودند که قدرت و قابلیت‌های برنامه‌نویسی را درون ساختارهای پایگاه داده تقویت می‌کنند. به تازگی، یک افزونه جدید و جذاب عرضه شده است که امکان نوشتن و اجرای توابع ذخیره شده را در زبان‌های برنامه‌نویسی مختلفی مانند PHP، جاوااسکریپت، پایتون، روبی و حتی COBOL فراهم می‌کند. این ابزار نوآورانه به توسعه‌دهندگان این امکان را می‌دهد که کدهای پیچیده و کاربردی را به راحتی در محیط پایگاه داده بنویسند و اجرا کنند، بدون نیاز به مهاجرت به زبان‌های برنامه‌نویسی جداگانه یا استفاده از واسط‌های خارجی.

این توسعه، به عنوان یک گام مهم در یکپارچه‌سازی زبان‌های برنامه‌نویسی مدرن داخل سیستم‌های مدیریت پایگاه داده، امکانات جدید و کارآمدی را برای برنامه‌نویسان فراهم می‌کند. با این ابزار، نوشتن توابع ذخیره شده در زبان‌های مختلف که مورد نیاز پروژه‌های تخصصی است، بسیار ساده‌تر و مستقیم‌تر خواهد شد. این ویژگی به ویژه در پروژه‌های بزرگ و چندزبانه، که نیازمند هماهنگی و ادغام زبان‌های مختلف است، نقش کلیدی ایفا می‌کند و موجب صرفه‌جویی در زمان و کاهش خطاهای احتمالی می‌شود.

در کل، این توسعه نشان می‌دهد که آینده سیستم‌های مدیریت پایگاه داده به سمت انعطاف‌پذیری و قابلیت‌های چندزبانه پیش می‌رود، و توسعه‌دهندگان اکنون می‌توانند با اطمینان بیشتری، کدهای کاربردی خود را مستقیماً درون پایگاه داده اجرا کنند. این قابلیت جدید، یک قدم مؤثر در بهبود کارایی و قابلیت توسعه سیستم‌های داده‌ای است که نیازمند انعطاف و مقیاس‌پذیری بالا می‌باشند.

#پایگاه_داده #توسعه_نرم‌افزار #کد_نویسی #برنامه‌نویسی

🟣لینک مقاله:
https://github.com/commandprompt/plx


👑 @Database_Academy
🔵 عنوان مقاله
Nobody Has Cracked Agent Memory (12 minute read)

🟢 خلاصه مقاله:
ساخت حافظه به عنوان یک زنجیره‌هوشمند نه تنها فرآیندی پیچیده بلکه اهمیت زیادی دارد که نیازمند طراحی هوشمندانه است. در این رویکرد، ابتدا داده‌ها را در یک انبار داده ذخیره می‌کنیم تا اطلاعات به صورت منسجم و سازمان‌یافته نگهداری شوند. سپس با بهره‌گیری از فناوری‌های مدرن، مانند مدل‌های زبانی بزرگ (LLM)، اشیا و عناصر گراف را از این داده‌ها استخراج می‌کنیم. این مرحله‌، نقش حیاتی در شناسایی الگوها و روابط پنهان در اطلاعات دارد. پس از آن، صحت و اعتبار این اشیا را با روش‌های معتبر تایید کرده، و در نهایت، با حذف موارد تکراری، داده‌ها را تمیز می‌نماییم تا مجموعه‌ای دقیق و قابل اعتماد ایجاد کنیم.

در ادامه، این داده‌های تصفیه‌شده برای پاسخگویی به سؤالات استاندارد و جست‌وجوی عمیق، از طریق سامانه‌ای به نام MCP، در خدمت کاربران قرار می‌گیرند. برای این منظور، از پایگاه داده‌های MongoDB بهره می‌گیریم که توانایی جست‌وجو در متن، بردارها و گراف‌ها را دارا است. اما، برای عملیات‌هایی نظیر پیمایش عمیق در ساختارهای گراف یا اجرای منطق‌های وابسته به گراف، تنها از پایگاه‌های داده‌ گراف استفاده می‌کنیم؛ زیرا این نوع پایگاه‌ها، به ما امکان می‌دهند تا روابط بسیار پیچیده و عمیق را به آسانی کشف و مدیریت کنیم.

در مجموع، این رویکرد، راهی است برای ساخت حافظه‌ای منسجم و قدرتمند، که می‌تواند به عنوان یک سیستم شناختی هوشمند در بسترهای مختلف، عمل کرده و به سوالات پیچیده پاسخ دهد، بدون آن‌که نیاز به راه‌حل‌های ساده و سطحی باشد. چنین سیستمی، هنوز در مراحل توسعه است و هیچ فرد یا سیستمی تا کنون نتوانسته است به طور کامل آن را شکسته یا انکار کند؛ چرا که فناوری و روش‌های کارآمد، همواره در حال پیشرفت است و هر روز امکانات جدیدی به آن افزوده می‌شود.

#هوش_مصنوعی #ذهن_پژوهی #پایگاه‌داده_گراف #مدل_زبان_بزرگ

🟣لینک مقاله:
https://www.decodingai.com/p/how-to-implement-a-unified-memory-from-scratch?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Greysight (Tool)

🟢 خلاصه مقاله:
گرایسایت ابزاری رایگان و منبع باز است که برای نظارت بر هزینه‌های سرویس اسنوفلیک طراحی شده است. این ابزار به صورت رایگان در اختیار کاربران قرار می‌گیرد و بدون نیاز به ذخیره‌سازی اطلاعات مشتریان، مصرف منابع مربوط به انبار داده، هوش مصنوعی و ذخیره‌سازی را رصد می‌کند. هدف اصلی گرایسایت ارائه دیدی شفاف و کاملاً منصفانه درباره هزینه‌های مربوط به فعالیت‌های مختلف در سامانه اسنوفلیک است، تا کاربران بتوانند به راحتی و با اطمینان هزینه‌های خود را کنترل و مدیریت کنند.

این ابزار به ویژه برای سازمان‌هایی که بر بستر اسنوفلیک فعالیت می‌کنند، اهمیت زیادی دارد، زیرا امکان نظارت بر هزینه‌ها را فراهم می‌کند بدون نگرانی درباره حریم خصوصی داده‌ها. از آنجا که گرایسایت منبع باز است، توسعه‌دهندگان و مدیران فناوری اطلاعات می‌توانند آن را بر اساس نیازهای خاص خود سفارشی‌سازی کنند و از قابلیت‌های پیشرفته آن بهره‌مند شوند. در نتیجه، این پروژه نقش مهمی در بهبود مدیریت مالی و بهبود بهره‌وری در محیط‌های مبتنی بر اسنوفلیک ایفا می‌کند.

در نهایت، گرایسایت ابزاری ارزشمند است که با رویکرد شفاف و قابل اعتماد خود، هزینه‌های فنی و عملیاتی در سامانه‌های ابری را بهبود می‌بخشد و کاربران را در تصمیم‌گیری‌های مالی یاری می‌کند.

#مدیریت_هزینه #ابزارهای_منبع_باز #نظارت_بر_هزینه #اسنوفلیک

🟣لینک مقاله:
https://www.greybeam.ai/product/snowflake-observability?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
The 90/90 rule for the dashboard dumpster (3 minute read)

🟢 خلاصه مقاله:
در دنیای تحلیل داده، یکی از چالش‌های رایج، پدید آمدن تعداد زیادی داشبورد است که مدیریت و بهره‌برداری از آن‌ها را دشوار می‌کند. این پدیده، که به آن «پراکنده‌گی داشبورد» گفته می‌شود، هزینه‌های زیادی برای سازمان‌های داده‌محور دارد. یکی از این هزینه‌ها کاهش اعتماد نسبت به داشبوردهای موجود است؛ چرا که اگر کاربران نتوانند اطلاعات مورد نیاز خود را به راحتی بیابند، اعتمادشان کاهش می‌یابد. علاوه بر این، پردازش‌های بی‌اساس در انبار داده‌، که منجر به مصرف بی‌مورد منابع محاسباتی می‌شود، از دیگر مشکلات است. همچنین، داشبوردهای قدیمی و بی‌استفاده، که دیگر کاربری ندارند، به زباله‌های دیجیتال تبدیل می‌شوند و فضا و منابع سازمان را اشغال می‌کنند.

مثالی برای این مشکل، نشان می‌دهد که در یک سازمان، صدها داشبورد ساخته شده است، اما در هر فصل، تنها چند نمونه از آن‌ها مورد استفاده قرار می‌گیرد؛ در نتیجه، حدود ۹۰ درصد از داشبوردها هیچ‌گاه مورد دسترسی قرار نمی‌گیرند. این وضعیت، نه تنها هدررفت منابع است، بلکه کارایی سیستم‌های تحلیل داده را کاهش می‌دهد. برای حل این مشکل، پیشنهاد می‌شود یک قانون ساده و عملی به نام «قاعده ۹۰/۹۰» اجرا شود. بر اساس این قانون، هر داشبورد پس از ۹۰ روز عدم مشاهده، آرشیو می‌شود؛ و اگر پس از ۹۰ روز دیگر هیچ پاسخ یا فعالیتی از سوی کاربران دریافت نشود، آن را حذف می‌کنند.

اجرای این قاعده، نه تنها به کاهش هزینه‌ها و بهبود کارایی کمک می‌کند، بلکه اعتماد کاربران نسبت به داشبوردهای فعال و معتبر را افزایش می‌دهد. با این روش، سازمان‌ها قادر خواهند بود منابع را بهتر مدیریت کنند و تمرکز خود را بر داشبوردهای مهم و پربار قرار دهند، در عین حال فضای دیجیتال خود را تمیز نگه دارند.

#مدیریت_داشبورد #تحلیل_داده #توسعه_سازمانی #بهبود_کارایی

🟣لینک مقاله:
https://betterthanrandom.substack.com/p/the-9090-rule-for-the-dashboard-dumpster?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
The Four Horsemen Behind Thousands of Postgres Outages

🟢 خلاصه مقاله:
دو هفته پیش، به پروژه‌ای به نام pgrust اشاره کردیم؛ این پروژه یک بازنویسی از پایگاه داده پرکاربرد Postgres است که با کمک هوش مصنوعی به زبان Rust توسعه یافته است. اکنون، این پروژه توانسته است تمامی تست‌های رگرسیون مربوط به Postgres را با موفقیت پشت سر بگذارد و به یک نسخه پایدار و بهبود یافته تبدیل شود. در این مقاله، خالق این پروژه درباره بزرگ‌ترین مشکلات و چالش‌هایی که قصد دارد آن‌ها را با بازنویسی جدید حل کند، توضیح می‌دهد.

در آغاز، باید به یکی از مهم‌ترین دلایلی که این پروژه را شکل داد اشاره کنیم: مشکلات مربوط به عملکرد و پایداری پایگاه داده در شرایط بارگذاری سنگین و مدیریت حجم گسترده اطلاعات. خرابی‌ها و قطعی‌هایی که در برخی موارد باعث توقف کامل سیستم می‌شد، همواره یکی از بزرگ‌ترین دردسرهای مدیران سیستم و توسعه‌دهندگان بود. این مسائل، نه تنها باعث اختلال در عملیات روزمره شد، بلکه اعتماد کاربران و شرکت‌ها را نسبت به این فناوری کاهش داد.

خالق پروژه pgrust معتقد است که مشکل اصلی در ساختار قدیمی و محدودیت‌های زبان C، که نسخه اصلی Postgres بر مبنای آن ساخته شده، قرار دارد. استفاده از زبان C، با وجود کارایی بالا، سبب بروز خطاهای حافظه و مشکلات مربوط به مدیریت منابع می‌شد که در نهایت منجر به ناپایداری سیستم می‌شد. او تصمیم گرفت با بازنویسی این سیستم در زبان Rust، نه تنها بهبودهای کارایی و امنیت را هدف قرار دهد، بلکه مشکلات رایج مرتبط با خطاهای حافظه و ناپایداری‌ها را نیز رفع کند.

در کنار این موارد، مشکلات مربوط به مقیاس‌پذیری و مدیریت تراکنش‌ها نیز از دیگر دغدغه‌هایی بود که در مسیر توسعه پروژه وجود داشت. وظایف سنگین و تراکنش‌های هم‌زمان در پایگاه‌های داده قدیمی، باعث کندی پاسخگویی سیستم و افزایش احتمال بروز خطاهای همزمانی می‌شد. راهکارهای جدید در نسخه بازنویسی شده قرار است این محدودیت‌ها را برطرف و امکان مدیریت بیشتر تراکنش‌های هم‌زمان را فراهم کند، که این امر می‌تواند تاثیر مستقیمی بر بهبود عملکرد و کارایی سیستم داشته باشد.

در مجموع، پروژه pgrust نمونه‌ای است از تلاش برای حل مهم‌ترین مشکلات پایگاه داده Postgres، با امید به اینکه نسخه جدید، سیستم پایدارتر، امن‌تر و مقیاس‌پذیرتری را برای کاربران فراهم کند. این تلاش نشان می‌دهد که با نوآوری و بهره‌گیری از فناوری‌های نوین، می‌توان به سمت توسعه سیستم‌هایی پیشرفته‌تر و کارآمدتر حرکت کرد.

#پایگاه_داده #Postgres #توسعه_نرم_افزار #امنیت

🟣لینک مقاله:
https://malisper.me/the-four-horsemen-behind-thousands-of-postgres-outages/


👑 @Database_Academy
🔵 عنوان مقاله
What is ACID on a Data Lake? (14 minute read)

🟢 خلاصه مقاله:
در دنیای داده‌های بزرگ و ذخیره‌سازی اطلاعات، مفهوم ACID نقش حیاتی در حفظ صحت و یکپارچگی داده‌ها ایفا می‌کند. در انبارهای داده‌ مانند هودی، آیس‌برگ و دلتا لیک، این مفاهیم به وسیله افزودن سیستم‌های ثبت‌دستی و عملیات انتشار اتمی به ذخیره‌سازی شی‌ء اضافه شده است. این فناوری‌ها اجازه می‌دهند نوشتن داده‌ها در چندین فایل به صورت همزمان و همه‌جانبه انجام شود، اما نتایج نهایی تنها پس از انجام عملیات انتشار اتمی و ثبت تغییرات در متادیتا دیده می‌شوند. به عبارت دیگر، خوانندگان تنها پس از کامل شدن فرآیند، تصویر ثابتی و مطابق با آخرین وضعیت را مشاهده می‌کنند که تضمین می‌کند داده‌ها در یک وضعیت قابل اعتماد و هم‌راستا باقی می‌مانند.

این تضمین‌ها، هرچند در سطح هر جدول جداگانه اعمال می‌شوند، اما عملیات ثبت‌تغییرات و تراکنش‌ها معمولا در مدت زمان چند ثانیه انجام می‌پذیرند. نکته مهم اینکه، جداسازی تراکنش‌ها (ایزولاسیون) بر پایه شبیه‌سازی نمونه‌های زمانی یا اسنپ‌شات‌ها است، نه اینکه کاملاً بر اساس روش‌های سریال‌سازی کامل باشد. بنابراین، سیستم‌ها امکان مدیریت هم‌زمانی و سازگاری را فراهم می‌کنند بدون اینکه پیچیدگی‌های تام و کامل تراکنش‌های نسل قبلی را متحمل شوند. این رویکرد، راه حلی موثر و کارآمد برای برقراری تعادل میان کارایی و تضمین‌های ACID در محیط‌های مبتنی بر ذخیره‌سازی شیء است.

#دیتا_لِیک #ACID #ذخیره_سازی #تحلیل_داده

🟣لینک مقاله:
https://hudi.apache.org/blog/2026/07/17/what-is-acid-on-a-data-lake/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Building Service Topology at Scale: Architecture, Challenges, and Lessons Learned (20 minute read)

🟢 خلاصه مقاله:
در دنیای فناوری‌های مدرن، ساختن یک ساختار سرویس‌های مقیاس‌پذیر و کارآمد، یکی از مهم‌ترین چالش‌های استراتژیک شرکت‌ها به شمار می‌آید. در این مقاله، به بررسی معماری یکی از پیشرفته‌ترین نمونه‌های این ساختار توسط نتفلیکس می‌پردازیم. این سیستم سه لایه‌ای با بهره‌گیری از گزارش‌های جریان eBPF، معیارهای برنامه‌نویسی و ردیابی توزیعی طراحی شده است تا بتواند عملیات‌های پیچیده در سطح سرویس را به صورت موثر مدیریت کند. این معماری، بخش‌هایی مجزا دارد که وظیفه جمع‌آوری، حل‌وفصل و پردازش داده‌ها را بر عهده دارند و در نهایت یک خط لوله پخش محتوا ایجاد می‌کنند که امکان جمع‌بندی، حل‌وفصل لبه‌های لود بالنسینگ و نگهداری گراف وابستگی را فراهم می‌آورد. این سیستم به گونه‌ای طراحی شده است که بتواند در کم‌ترین زمان ممکن، داده‌های تحلیلی را ارائه دهد.

در بخش بعدی، به حل یکی از بزرگ‌ترین مشکلات این سیستم می‌پردازیم؛ مشکل نوسان بسیار شدید در بار ترافیک. این نوسان که به دلیل تمرکز ترافیک معتبر بر روی سرویس‌های پرکاربرد به وجود می‌آید، می‌تواند عملکرد سیستم را تحت تأثیر قرار دهد و منجر به کاهش کیفیت خدمات شود. راه‌حلی که توسط تیم نتفلیکس اتخاذ شده، شامل توزیع چندمرحله‌ای بار است. این رویکرد، با تقسیم و توزیع چندگانه درخواست‌ها و بارهای ترافیکی، توانسته است توازن مناسب و کارآمدی را در اجرای عملیات‌ها برقرار کند و از فشار ناگهانی و شدید بر منابع جلوگیری کند.

در نهایت، این مطالعه نشان می‌دهد که پاسخ به چالش‌های بزرگ در ساختارهای سرویس، نیازمند هوشمندی، طراحی دقیق و کار گروهی است. تجربه نتفلیکس در توسعه این معماری، آموزه‌های ارزشمندی در زمینه‌های بهبود قابلیت مقیاس‌پذیری، کاهش latenc و مدیریت نوسانات بار ارائه می‌دهد که می‌تواند الهام‌بخش دیگر شرکت‌ها در مسیر توسعه سیستم‌های نرم‌افزاری خود باشد.

#ساختار_سرویس #معماری_سیستم #توسعه_پایدار #مدیریت_بار

🟣لینک مقاله:
https://netflixtechblog.com/building-service-topology-at-scale-architecture-challenges-and-lessons-learned-f4b792f3f0d8?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
How We Refresh Razorpay's Data Warehouse 10x Faster with Graphs and Indexes (11 minute read)

🟢 خلاصه مقاله:
در دنیای مدیریت داده‌ها، سرعت و کارایی همواره عوامل حیاتی برای بهبود عملکرد سیستم‌ها محسوب می‌شوند. شرکت Razorpay با هدف کاهش زمان بروزرسانی مخزن داده‌های خود، تصمیم گرفت راهکارهای نوینی را پیاده‌سازی کند. در نتیجه، توانست زمان بروزرسانی این مخزن را به طرز چشمگیری، دقیقاً ۹۰ درصد کاهش دهد. این پیشرفت عظیم، با جایگزینی اسکن‌های کامل جداول با مسیرهای پیمایش گراف‌های جزئی امکان‌پذیر شد.

راد Razorpay تلاش کرد تا با استفاده از لایه نقره‌ای، تغییرات روزانه را بر اساس کلید اصلی به شکل دقیق و بدون تکرار شناسایی و تفکیک کند. علاوه بر این، ایندکس‌های ثانویه به منظور ذخیره ستون‌های پیوست و اطلاعات بخش‌بندی، از نیاز به اسکن‌های جامع جلوگیری کرد و روند بروزرسانی‌ها را تسریع بخشید. در نهایت، با استفاده از پیمایش گراف‌ها، فقط رکوردهای تغییر یافته مورد پردازش قرار گرفتند، و در حین این فرآیند، وابستگی‌های مرتبط نیز بررسی و تکمیل شدند تا اطلاعات به‌روز و کامل باشند. این رویکردهای نوآورانه در کنار یکدیگر، منجر به بهبود قابل توجه عملکرد سیستم‌های داده‌ای Razorpay شد و نشان داد که ترکیب فناوری‌های نوین می‌تواند کارایی و سرعت را به شکل چشمگیری افزایش دهد.

#مدیریت_داده #پایگاه_داده #تحلیل_داده #فناوری

🟣لینک مقاله:
https://engineering.razorpay.com/how-we-refresh-razorpays-data-warehouse-10x-faster-with-graphs-and-indexes-538abc244703?utm_source=tldrdata


👑 @Database_Academy
Channel name was changed to «Database»
🔵 عنوان مقاله
G-Eval, Explained (5 minute read)

🟢 خلاصه مقاله:
در این مقاله، با مفهوم G-Eval آشنا می‌شویم، روشی نوین برای ارزیابی متن‌های آزاد و باز. در این روش، یک مدل زبانی بزرگ (LLM) فرآیند نمره‌دهی را بر اساس یک استاندارد مشخص انجام می‌دهد و مراحل ارزیابی خود را ضمن فرآیند تفکر زنجیره‌ای (chain-of-thought) تولید می‌نماید. به جای خواندن یک رقم مستقیم و نقطه‌گذاری سریع، این سیستم بر احتمال‌های سطح توکن‌ها برای هر امتیاز، میانگین وزنی محاسبه می‌کند که این امر سبب ثبات بیشتر نمره‌ها نسبت به خروجی‌های نمونه‌برداری شده می‌شود. در واقع، به این شکل، ارزیابی‌ها هم دقیق‌تر و هم قابل اعتمادتر می‌شوند.

یکی از نکات مهم در این روش، استفاده از مدل داور (judge model) است که از خانواده‌ای متفاوت با مدل ارزیابی بهره می‌گیرد. این تنوع در مدل‌های مورد استفاده، به کاهش سوگیری‌های احتمالی کمک می‌کند و نتیجه‌های قابل اعتمادتر تولید می‌نماید. علاوه بر این، تنظیم معیارها یا همان rubrics باید بر اساس نمونه‌های برچسب‌خورده توسط انسان صورت گیرد تا هماهنگی میان ارزیابی‌های ماشین و انسان به حداکثر برسد و نتایج میدانی بهتر و دقیق‌تر شوند.

در نهایت، این روش نشان می‌دهد که چگونه می‌توان ارزیابی متون آزاد را با اطمینان بیشتری انجام داد و از روش‌هایی بهره گرفت که خروجی‌های کم‌نقص و منسجم‌تری را ارائه می‌دهند. استفاده از G-Eval می‌تواند در زمینه‌های مختلفی مانند آموزش، توسعه مدل‌های هوشمند، و ارزیابی کیفیت محتوای تولید شده بسیار مفید باشد.

#هوش_مصنوعی #ارزیابی_متن #مدل_های_زبانی #یادگیری_ماشینی

🟣لینک مقاله:
https://arpitbhayani.me/blogs/g-eval/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
How SQL/PGQ Rewrites to Joins on Postgres 19

🟢 خلاصه مقاله:
در نسخه نوزدهم پایگاه داده پستگرس، شاهد تحولات قابل توجهی در حوزه پشتیبانی از کوئری‌های گراف هستیم. یکی از قابلیت‌های مهم این نسخه، پشتیبانی از کوئری‌های گراف است که امکان تحلیل و پردازش روابط پیچیده بین داده‌ها را راحت‌تر می‌کند. این ویژگی به توسعه‌دهندگان و محققان کمک می‌کند تا ساختارهای داده‌ای پیچیده‌تر را به سادگی مدل‌سازی و استخراج کنند.

در این نسخه، نحوه‌ی ترجمه کوئری‌های گراف به عملیات‌های استاندارد پایگاه داده، به طور زیرکانه‌ای به سمت استفاده از جوین‌های معمولی (join) تغییر یافته است. در اصل، کوئری‌های گراف ابتدا تبدیل به نوعی عملیات‌های جوین می‌شوند که در نهایت اجرای آن‌ها در پایگاه داده‌ی پستگرس معمولی است. این رویکرد نه تنها بازدهی را افزایش می‌دهد بلکه امکان استفاده از بهینه‌سازی‌های سنتی و قدرتمند پستگرس برای عملیات‌های گراف را فراهم می‌کند.

این تغییرات به‌طور مستقیم نشان می‌دهد که چگونه زیرساخت‌های پایگاه داده‌ی مدرن، قابلیت‌های جدید را در قالب زبان‌های کوئری موجود ادغام می‌کنند. نتیجه این است که توسعه‌دهندگان بدون نیاز به ابزارها یا موتورهای گراف جداگانه، می‌توانند از امکانات پیشرفته تحلیل روابط بهره‌مند شوند، در حالی که سیستم بهینه‌سازی و اجرا همچنان بر پایه استراتژی‌های اثبات شده‌ی پستگرس باقی می‌ماند. این پیشرفت، مسیر را برای توسعه ابزارهای پیشرفته‌تر در حوزه‌ی داده‌های گراف باز می‌کند و کارایی و انعطاف‌پذیری را در مدیریت داده‌ها افزایش می‌دهد.

#پستگرس #گراف #کویری #پایگاه_داده

🟣لینک مقاله:
https://www.cybertec-postgresql.com/en/how-sql-pgq-rewrites-to-joins-on-postgresql-19/


👑 @Database_Academy
🔵 عنوان مقاله
Fixing Bad SQL in Postgres with Jimmy Angelakos

🟢 خلاصه مقاله:
در این سخنرانی کوتاه و موجز به مدت ۵٥ دقیقه، جیمی آنجلآکوس به بررسی مشکلات رایج در نوشتن کوئری‌های SQL در پایگاه‌ داده‌های پستگرس می‌پردازد. او بر اشتباهات و الگوهای نادرستی که معمولاً در توسعه و مدیریت پایگاه‌ داده‌ها رخ می‌دهد، تمرکز می‌کند و راهکارهای عملی برای اصلاح آن‌ها ارائه می‌دهد. در این برنامه، شرکت‌کنندگان با نمونه‌های واقعی و نمونه‌خوای عملی، نحوه شناسایی و برطرف کردن این مشکلات را به‌طور مستقیم در محیط‌های زنده با استفاده از ابزار psql مشاهده می‌کنند. این سخنرانی برای توسعه‌دهندگان و مدیران پایگاه‌ داده‌ای که به دنبال بهبود عملکرد و نگهداری بهتر داده‌های خود هستند، بسیار مفید و کاربردی است.

در این جلسه، جیمی آنجلآکوس راهکارهای کاربردی و راهنمایی‌های حرفه‌ای ارائه می‌دهد تا بتوانید کدهای SQL بهتری بنویسید و از مشکلات رایجی که در پروژه‌های عملی رخ می‌دهد، جلوگیری کنید. تماشای این سخنرانی، فرصت مناسبی است برای شناخت الگوهای منفی و یادگیری نحوه رفع آن‌ها در محیط‌های واقعی، به‌صورتی که بتوانید در کوتاه‌ترین زمان، راندمان و کارایی بانک‌های اطلاعاتی خود را به‌طور قابل توجهی افزایش دهید.

#SQL #پستگرس #بهبودکارایی #برنامه‌نویسی

🟣لینک مقاله:
https://www.youtube.com/watch?v=SxIgD1OfU_A


👑 @Database_Academy
🔵 عنوان مقاله
Compliance controls in the wrong place cost more than bad hardware. (Sponsor)

🟢 خلاصه مقاله:
کنترل‌های مربوط به رعایت قوانین در اشتباه‌ترین مکان ممکن قرار گیرند، هزینه‌های فراوانی را به همراه دارند و حتی از خرید سخت‌افزارهای نامناسب هم بیشتر می‌افزایند. در واقع، وقتی کنترل‌های امنیتی در بخش‌های نادرستی از فرآیند قرار می‌گیرند، عملکرد سیستم‌های گرافیکی یا GPU به طرز قابل توجهی کاهش می‌یابد؛ مثلا، بهره‌وری این واحدها ممکن است از ۶۵ درصد به ۴۰ درصد کاهش یابد، بدون اینکه تجهیزات سخت‌افزاری تغییر کرده باشد.

شرکت WhiteFiber تحلیل می‌کند که این اشکال چگونه در لایه‌های مختلف آموزش هوش مصنوعی پنهان می‌شود و چه راهکارهایی برای رفع این مشکل وجود دارد. این مشکل عمدتاً ناشی از قرارگیری نادرست کنترل‌های امنیتی است که در هر بخش از زنجیره آموزش و اجرای مدل‌های هوش مصنوعی می‌تواند تأثیر منفی داشته باشد.

با درک بهتر این موضوع و اصلاح موقعیت این کنترل‌ها، می‌توان بهره‌وری سیستم‌ها را به شکل چشمگیری افزایش داد و هزینه‌های نادرستی را که صرف اقدامات نامناسب می‌شود، کاهش داد. برای جزئیات بیشتر و گفتگو با تیم فنی WhiteFiber، پیشنهاد می‌کنیم نگاهی به تحلیل متخصصان بیندازید و راهکارهای پیشنهادی آن‌ها را بررسی نمایید.

#امنیت #هوش_مصنوعی #بهره‌وری #WhiteFiber

🟣لینک مقاله:
https://www.whitefiber.com/blog/custom-performance-profiles-tuning-colo-infra-regulated-workloads?utm_source=tldr&utm_medium=newsletter&utm_campaign=mofu_regulated_workloads&utm_content=cta-1


👑 @Database_Academy
🔵 عنوان مقاله
@neon/sdk: Neon's New TypeScript Client Library

🟢 خلاصه مقاله:
در دنیای توسعه نرم‌افزار و مدیریت پایگاه‌های داده، ابزارهای قدرتمند و کارآمد نقش مهمی در تسهیل فرآیندهای برنامه‌نویسان دارند. شرکت Neon اخیراً نمونه جدیدی از کتابخانه کلاینت تایپ‌اسکریپت را معرفی کرده است که به کاربران این امکان را می‌دهد به راحتی با پلتفرم PostgreSQL کار کنند. این کتابخانه، به ویژه برای کسانی طراحی شده است که می‌خواهند از ویژگی‌های خاص و پیشرفته‌ی این سیستم بهره‌مند شوند، چه در زمینه مدیریت پروژه‌ها، شاخه‌ها و بانک‌های اطلاعاتی.

با این ابزار جدید، توسعه‌دهندگان می‌توانند به‌سادگی عملیات مرتبط با ساخت، مدیریت و نظارت بر پروژه‌ها و علیه پایگاه‌داده‌ها را انجام دهند. این کتابخانه نه تنها فرآیندهای توسعه را سرعت می‌بخشد، بلکه با امکانات پیشرفته، کنترل دقیق‌تری روی منابع و ساختار داده‌ها فراهم می‌کند. در نتیجه، تیم‌های توسعه‌ای قادر خواهند بود به صورت موثرتری بر پروژه‌های خود نظارت و کنترل داشته باشند و انعطاف‌پذیری بیشتری در مدیریت زیرساخت‌های داده‌ای خود ایجاد کنند.

در نهایت، این قدم نوآورانه‌ی Neon نشانگر تمرکز این شرکت بر توسعه ابزارهای مدرن و کاربرپسند است که به توسعه‌دهندگان کمک می‌کند تا بهره‌وری خود را افزایش دهند و به راحتی از قابلیت‌های باورنکردنی پایگاه داده PostgreSQL بهره‌مند شوند.

#توسعه_نرم‌افزار #پایگاه_داده #پلتفرم_پستگرس #نئون

🟣لینک مقاله:
https://neon.com/blog/neon-sdk


👑 @Database_Academy
🔵 عنوان مقاله
Prefect just bought Dagster, another big Airflow rival — and it's not a data pipeline story (4 minute read)

🟢 خلاصه مقاله:
شرکت Prefect به تازگی اقدام به خرید Dagster کرده است، یکی از بزرگ‌ترین رقبا در حوزه مدیریت جریان‌های داده‌ای، اما موضوع این معامله تنها به داستان ساخت خط لوله‌های داده مربوط نمی‌شود. در واقع، این ادغام نشان‌دهنده استراتژی شرکت Prefect برای تقویت جایگاه خود در فضای عملیات متن‌باز است، بدون اینکه هویت یا برنامه‌های راهبردی‌اش تغییر کند. این اقدام، نشان می‌دهد که Prefect قصد دارد با حفظ نام، قیمت‌گذاری و نقشه راه محصولات، همکاری خود با Dagster را گسترش دهد و تمرکز خود را بر روی بهبود ابزارهای مدیریت و نظارت بر فرآیندهای داده‌ای قرار دهد.

در قالب این معامله، حدود چهل نفر از تیم‌های Dagster به تیم Prefect ملحق خواهند شد. این اتحاد، سبب ترکیب قابلیت‌هایی مانند پیگیری نتایج و مدیریت اجرای فرآیندهای داده‌ای در کنار فناوری‌های قدرتمند Prefect و FastMCP می‌شود. هدف اصلی از این ادغام، تقویت سیستم‌های مدیریت عملیات متن‌باز است تا بتوانند به شکل مؤثرتری وظایف پیچیده و همزمان را کنترل کنند. این استراتژی به شرکت‌ها کمک می‌کند تا با بهره‌گیری از ابزارهای یکپارچه، عملیات داده‌اشان را به صورت بهینه و مطمئن‌تر انجام دهند و در عین حال از فناوری‌های نوین بهره‌مند شوند.

مجموعه این اقدامات نشان‌دهنده تمایل Prefect به سمت تثبیت و توسعه جایگاه خود در بازار مدیریت جریان‌های داده‌ای است و نشان می‌دهد که رویکرد باز و همکاری‌های استراتژیک، کلید موفقیت در این حوزه پررقابت هستند. با این ادغام، چشم‌انداز شرکت به سمت نوآوری‌های بیشتر و ارائه راهکارهای متن‌باز و قوی‌تر برای جامعه داده‌محور حرکت می‌کند.

#مدیریت_دیتا #ادغام_تکنولوژی #بازار_متن_باز #پیشرفت_فناوری

🟣لینک مقاله:
https://thenewstack.io/prefect-acquires-dagster-orchestrator/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
pgBackRest 2.59.0 Released with Postgres 19 Support

🟢 خلاصه مقاله:
نسخه ۲.۵۹.۰ ابزار قدرتمند پشتیبان‌گیری و بازگردانی pgBackRest منتشر شد، نگاهی تازه به پروژه‌ای که پس مدتی سکون دوباره احیا شده است. این نسخه اولین عرضه رسمی پس از وقفه کوتاه در توسعه است و تمرکز آن بر سازگاری با نسخه جدید پایگاه داده‌های پُستگرس ۱۹ است. توسعه‌دهندگان در این نسخه تمرکز زیادی بر آماده‌سازی ابزار برای پشتیبانی کامل از نسخه جدید داشتند، اما در کنار آن، بهبودهای مهمی در عملکرد سرویس‌های ذخیره‌سازی ابری مانند S3 و Azure نیز لحاظ شده است که استفاده راحت‌تر و انعطاف بیشتری را ممکن می‌سازد. این به‌روزرسانی نشان می‌دهد که پروژه با قدرت به مسیر خود ادامه می‌دهد و توانمندی‌های بیشتری برای مدیریت و حفاظت از داده‌ها ارائه می‌دهد.

#پشتیبان_گیری #پستگرس #نسخه_جدید #پایگاه_داده

🟣لینک مقاله:
https://pgbackrest.org/news.html#release-2-59-0


👑 @Database_Academy
🔵 عنوان مقاله
Puffgres: Keep Postgres Entities Synced with Turbopuffer

🟢 خلاصه مقاله:
در دنیای فناوری، ابزارهای متنوعی برای مدیریت و همگام‌سازی داده‌ها وجود دارد که کار توسعه‌دهندگان را بسیار ساده‌تر می‌کند. یکی از این ابزارها، Puffgres نام دارد؛ ابزاری قدرتمند و متن‌باز که وظیفه نگه داشتن موجودیت‌های پایگاه داده پستگرس را همزمان با سرویس Turbopuffer بر عهده دارد. این ابزار اجازه می‌دهد تا داده‌های مربوط به پایگاه‌های پستگرس به صورت همزمان و بدون نقص، در سرویس‌های جستجو مبتنی بر فناوری‌های وکتور و متن کامل، منعکس شود. استفاده از چنین فناوری‌هایی اهمیت زیادی در پروژه‌هایی دارد که نیازمند دقت و سرعت در جستجو و تحلیل داده‌ها هستند، و Puffgres توانسته این نیازها را برآورده کند.

آشنایی با شرکت A24، کارگردان معروف در عرصه تولید و توزیع فیلم، که فیلم‌هایی مانند Backrooms و Uncut Gems را منتشر کرده است، نشان می‌دهد که فناوری‌های نوین چگونه در جهان رسانه و فناوری نیز جهت دارند. اولین محصول منبع‌باز این شرکت، یک ابزار مبتنی بر زبان برنامه‌نویسی Rust است که با بهره‌گیری از رپلیکیشن منطقی (logical replication)، داده‌ها را به صورت همزمان و پایدار در سرویس Turbopuffer منتقل می‌کند. این ابزار به توسعه‌دهندگان و مدیران سیستم کمک می‌کند تا داده‌های پایگاه‌های پستگرسشان به طور جهانی و بدون خطا در سرویس‌های جستجو و تحلیل هوشمند همگام شوند.

در نتیجه، Puffgres یک افزونه کارآمد و قابل اعتماد است که نقش حیاتی در بهبود کارایی سیستم‌های مبتنی بر پستگرس و سرویس‌های جستجوی پیشرفته ایفا می‌کند. این فناوری به ویژه در محیط‌هایی که نیازمند پردازش سریع و دقیق اطلاعات حجیم هستند، بسیار ارزشمند است و امکان بهبود تجربه کاربری نهایی را فراهم می‌آورد. با توجه به رویکرد متن‌باز بودن و قابلیت‌های پیشرفته، این ابزار راه حل مناسبی برای توسعه‌دهندگان و شرکت‌هایی است که به دنبال بهبود کیفیت و سرعت سیستم‌های داده‌محور خود هستند.

#پایگاه‌داده #پستگرس #جستجو #فناوری‌های‌نوین

🟣لینک مقاله:
https://github.com/a24films/puffgres


👑 @Database_Academy
🔵 عنوان مقاله
briefly died and came back to life

🟢 خلاصه مقاله:
در کنار تمرکز اصلی بر نسخه‌ی بعدی پستگرس ۱۹، تیم توسعه‌دهنده توجه زیادی به ارتقای قابلیت‌های این سیستم مدیریت پایگاه داده دارد. هدف اصلی آن‌ها آماده‌سازی کامل برای عرضه‌ی نسخه‌ی جدید است که امکانات و بهبودهای قابل توجهی را به همراه خواهد داشت. در همین حال، افزودن بهبودهایی در سرویس‌های ابری محبوب مانند S3 و Azure نیز بخشی از این تلاش‌ها بوده است، تا کاربران بتوانند از انعطاف‌پذیری و کارایی بیشتر در محیط‌های ابری بهره‌مند شوند.

با وجود تمرکز بر نسخه‌ی ۱۹ پستگرس، توسعه‌دهندگان در حال بهبود و ارتقای ویژگی‌هایی هستند که تجربه کاربری را غنی‌تر و مدیریت داده‌ها را آسان‌تر می‌کنند. این بهبودها شامل امکانات جدید و بهبودهای فنی است که به مدیران و توسعه‌دهندگان کمک می‌کند تا سریع‌تر و موثرتر عملیات خود را انجام دهند. همچنین، اصلاحات در سرویس‌های ابری مانند S3 و Azure، این امکان را فراهم می‌آورند تا انتقال و ذخیره‌سازی داده‌ها در فضای ابری با اطمینان و کارایی بیشتر انجام شود.

در نتیجه، این تلاش‌ها نشان می‌دهند که تیم توسعه‌دهنده در تلاش است تا هم در زمینه‌ی پایگاه‌های داده و هم در حوزه‌ی زیرساخت‌های ابری، پیشرفته‌ترین امکانات را ارائه دهد و کاربران را برای آینده‌ای پر امکانات و کارآمد آماده کند. انتظار می‌رود با عرضه‌ی نسخه‌ی ۱۹، تحولات قابل توجهی در فضای پایگاه‌های داده و زیرساخت‌های ابری مشاهده شود که به بهبود عملیات و راندمان کسب‌وکارها کمک خواهد کرد.

#پستگرس #ابری #ارتقا #توسعه

🟣لینک مقاله:
https://pgbackrest.org/news.html#will-continue


👑 @Database_Academy
🔵 عنوان مقاله
enable/disable tasks

🟢 خلاصه مقاله:
در دنیای مدیریت پایگاه داده‌ها، ابزارها و امکانات متنوعی وجود دارد که به مدیران کمک می‌کنند تا فرآیندها را کنترل و بهبود بخشند. یکی از این امکانات، قابلیت فعال‌سازی و غیرفعالسازی وظایف یا تسک‌ها است که نقش مهمی در افزایش کارایی و امنیت سیستم دارد. این گزینه‌ها امکان می‌دهند تا برنامه‌های تکراری یا مهم به صورت مؤثر کنترل شده و در صورت نیاز به صورت موقت غیرفعال شوند، بدون اینکه لازم باشد کل وظیفه یا برنامه حذف شود. این قابلیت مخصوصاً زمانی کاربرد دارد که نیاز است تنظیماتی سریع و بدون تأثیر بر سایر بخش‌های سیستم انجام شود، مثلاً برای رفع خطاها یا بهبود عملکرد برنامه‌ها.

در سیستم‌های مدیریت پایگاه داده مانند PostgreSQL، این امکانات معمولاً از طریق ابزارهای مدیریتی و اسکریپت‌هایی قابل اجرا هستند که به صورت مستقیم یا از طریق واسط کاربری، امکان کنترل جزئی بر فرآیندهای برنامه‌ریزی شده فراهم می‌کنند. بنابراین، مسئولین سیستم قادر هستند به راحتی وضعیت اجرای وظایف را تغییر داده، در صورت نیاز فعالیت‌های خاص را غیرفعال و یا فعال کنند، و این کار به افزایش انعطاف‌پذیری و کنترل کامل بر سیستم کمک می‌کند. در نتیجه، این ویژگی مهم در بهبود مدیریت عملیاتی و اطمینان از صحت و امنیت اطلاعات تأثیرگذار است.

#پایگاه_داده #مدیریت_وظایف #PostgreSQL #امنیت

🟣لینک مقاله:
https://github.com/cybertec-postgresql/pg_timetable/issues/792


👑 @Database_Academy
🔵 عنوان مقاله
Postgres 19 Compression: From pglz to LZ4

🟢 خلاصه مقاله:
در نسخه ۱۹ پستگرس، روش فشرده‌سازی داده‌های بزرگ تحت عنوان TOAST تغییر کرده است. در نسخه‌های قبلی، پیش‌فرض این عملیات بر پایه فناوری pglz بود که مدت‌ها برای فشرده‌سازی داده‌های حجیم مورد استفاده قرار می‌گرفت. اما در نسخه جدید، این روند به سمت فشرده‌سازی با استفاده از LZ4 تغییر یافته است؛ روشی سریع‌تر و کارآمدتر که از نسخه ۱۴ پشتیبانی می‌شود. این تغییر اهمیت زیادی دارد، زیرا سرعت و کارایی پایگاه‌های داده در مدیریت حجم عظیم داده‌ها را قابل توجه‌تر می‌کند.

کریستوفر در مقاله به تاریخچه این فناوری‌ها پرداخته و نکات جالبی را درباره فرآیند تصمیم‌گیری برای فشرده‌سازی بخش‌های مختلف داده‌ها، مخصوصاً داده‌هایی که نیاز به TOAST دارند، بیان کرده است. او توضیح می‌دهد که چگونه سیستم تشخیص می‌دهد چه داده‌هایی نیازمند فشرده‌سازی هستند و چه داده‌هایی بهتر است بدون تغییر باقی بمانند. همچنین، نگاهی به نحوه فشرده‌سازی کلیدهای بزرگ در ایندکس‌ها دارد و نشان می‌دهد که چگونه این فرآیند می‌تواند تأثیر چشمگیری بر کارایی بانک اطلاعاتی داشته باشد.

تغییرات در فناوری فشرده‌سازی این امکان را فراهم می‌آورد تا بانک‌های اطلاعاتی در پردازش داده‌های بزرگ، عملیاتی سریع‌تر و مؤثرتر انجام دهند، به خصوص در مواردی که حجم داده‌ها به شدت افزایش یافته است. این تحول نشان می‌دهد که توسعه‌دهندگان پستگرس همواره در حال بهبود و ارتقای فناوری‌های پایه‌ای برای پاسخگویی بهتر به نیازهای روزافزون کاربران هستند.

#پستگرس #فشرده‌سازی #LZ4 #پایگاه_داده

🟣لینک مقاله:
https://www.crunchydata.com/blog/postgres-19-compression-from-pglz-to-lz4


👑 @Database_Academy