882 subscribers
44 photos
3 videos
1 file
1.38K links
🕸 Database Academy

حمایت مالی:
https://www.coffeete.ir/mrbardia72

ادمین:
@mrbardia72
Download Telegram
Forwarded from Software Engineer
امکان تغییر آدرس ایمیل 📧

اگر این قابلیت برای حسابت فعال شده باشد، می‌توانی آدرس @gmail.com خودت را بدون ساختن حساب جدید تغییر بدهی. این قابلیت به‌صورت تدریجی برای کاربران منتشر شده و ممکن است هنوز برای همه فعال نباشد. (Google Help)

روش اول (کامپیوتر - پیشنهاد گوگل) 💻🔍

وارد حساب گوگلت شو:
Google Account
از منوی سمت چپ روی Personal info (اطلاعات شخصی) کلیک کن.
بخش Contact info را باز کن.
روی Email کلیک کن.
گزینه Google Account email را انتخاب کن.
اگر گزینه Change Google Account email یا تغییر آدرس ایمیل گوگل را می‌بینی:
روی آن کلیک کن.
نام جدید دلخواهت را وارد کن.
اگر آزاد باشد، ادامه بده.
کد تأیید یا مراحل امنیتی را انجام بده. 🔒

بعد از تأیید:
ایمیل جدید، آدرس اصلی حسابت می‌شود.
ایمیل قبلی به‌عنوان Alternate Email (آدرس جایگزین) باقی می‌ماند.
ایمیل‌هایی که به آدرس قدیمی ارسال شوند نیز همچنان به همان Inbox می‌رسند. (Google Help)

اگر این گزینه را نمی‌بینی 🚫
اگر در مرحله ۶ گزینه Change Google Account email وجود ندارد، یعنی هنوز این قابلیت برای حسابت فعال نشده است. گوگل آن را به‌صورت مرحله‌ای منتشر می‌کند و ممکن است چند هفته یا چند ماه دیگر برای حسابت فعال شود. (Google Help)

قبل از تغییر این نکات را بدان 📝👀
همه ایمیل‌ها، فایل‌های Drive، عکس‌های Photos و اطلاعات حسابت حفظ می‌شوند. 💾
می‌توانی با ایمیل قدیمی و جدید وارد حسابت شوی. 🔑
برخی تنظیمات دستگاه یا برنامه‌ها ممکن است نیاز به ورود مجدد داشته باشند.
فقط هر ۱۲ ماه یک‌بار می‌توانی آدرس را تغییر دهی و تعداد تغییرها نیز محدود است. (Google Help)
🔵 عنوان مقاله
Rainfrog 0.4: A Database Management TUI for Postgres

🟢 خلاصه مقاله:
در دنیای مدیریت پایگاه‌های داده، ابزارهای کارآمد نقش بسزایی در بهبود کارایی و سهولت فرآیندهای کاری ایفا می‌کنند. یکی از این ابزارها، Rainfrog 0.4 است که یک واسط کاربری مبتنی بر ترمینال برای مدیریت پایگاه‌های داده PostgreSQL محسوب می‌شود. این برنامه طراحی شده است تا جایگزینی بهتر و منسجم‌تر برای ابزارهای سنتی مانند psql باشد، با ویژگی‌هایی که کار با پایگاه داده‌ها را ساده‌تر و لذت‌بخش‌تر می‌کند.

Rainfrog در مقایسه با psql، یک ساختار منظم‌تر و کاربرپسندتر دارد، و به کاربران امکان می‌دهد تا با ناوبری به سبک ویم در میان کوئری‌ها، تاریخچه، اسکیم‌ها و دیگر بخش‌های پایگاه داده حرکت کنند. این ویژگی‌ها، قابلیت‌های استفاده را افزایش داده و فرآیند مدیریت داده‌ها را سریع‌تر و کاربردی‌تر می‌سازد.

در واقع، این نرم‌افزار با تمرکز بر سهولت کار و امکانات پیشرفته، تجربه کاربر را به سطح جدیدی می‌برد. طراحی منسجم و قابلیت‌های جابجایی سریع بین بخش‌ها، آن را برای توسعه‌دهندگان و مدیران پایگاه داده بسیار مناسب می‌سازد. در نسخه اولیه، امکانات پایه‌ای ارائه شده است که می‌توان در آینده انتظار افزودن ویژگی‌های بیشتری را داشت، و این مسیر نویدبخش آینده‌ای بهتر در مدیریت پایگاه داده‌های PostgreSQL است.

در نهایت، Rainfrog 0.4 با ترکیب کارآمدی و سادگی، ابزاری ارزشمند برای کسانی است که به دنبال یک رابط ترمینال قدرتمند و کاربرپسند برای مدیریت داده‌های خود هستند.

#مدیریت_پایگاه_داده #PostgreSQL #ابزارهای_ترمینال #Rainfrog

🟣لینک مقاله:
https://github.com/achristmascarl/rainfrog


👑 @Database_Academy
فراتر از یک دیتابیس تراکنشی: بررسی قابلیت‌های HTAP، جستجوی برداری و اتصال مستقیم به Iceberg در AliSQL
سال‌هاست که سیستم‌های داده را بر اساس یک قانون نانوشته می‌سازیم: جداسازی دیتابیس‌های عملیاتی (OLTP) از موتورهای تحلیلی (OLAP).
همگام نگه‌داشتن این دو محیط، به معنای درگیری با پایپ‌لاین‌های پیچیده ETL، کانکتورهای شکننده CDC و بحث‌های همیشگی «تازگی داده‌ها» (Data Freshness) است. این در واقع هزینه‌ای بود که برای پایداری سیستم می‌پرداختیم؛ اما چه می‌شد اگر می‌توانستیم با چند تصمیم معماری هوشمندانه، این مرزها را پاک کنیم؟ آن هم بدون تغییرات گسترده در کدها و با حفظ پایداری همیشگی سیستم؟
این دقیقاً همان تغییری است که تیم دیتابیس ابری علی‌بابا با معرفی نسخه متن‌باز AliSQL 8.0.44-2 (انشعاب بهینه‌شده MySQL نسخه ۸) ایجاد کرده است. فرمولی برنده از ترکیب پایداری MySQL، سرعت خیره‌کننده DuckDB و قابلیت‌های پیشرفته هوش مصنوعی.

این یک ایده آزمایشگاهی نیست؛ این معماری طی یک دهه برای زنده ماندن در هرج‌ومرج ترافیکی رویداد جمعه سیاه آب‌دیده شده و امروز روی بیش از ۱۰۰۰ نود پروداکشن در حال اجراست. نتیجه؟ تا ۷۰٪ پرفورمنس بهتر و ۹۵.۲٪ کاهش زمان ریکاوری (Crash Recovery) نسبت به MySQL کامیونیتی.

اگر درگیر طراحی سیستم‌های داده‌محور هستید و دنبال یک پلتفرم جامع و مقیاس‌پذیر هستید و یا به دنبال بهبود MySQL خود هستید، این ۴ تغییر زیربنایی در AliSQL قطعا توجه شما را جلب خواهد کرد:
۱. موتور تحلیلی بومی DuckDB (یکپارچگی HTAP)
دیتابیس AliSQL حالا DuckDB را به عنوان یک Storage Engine در کنار InnoDB به رسمیت می‌شناسد. این یعنی کوئری‌های تحلیلی ستونی تا ۲۰۰ برابر سریع‌تر اجرا می‌شوند. نکته جذاب؟ نیازی به درایور جدید یا تغییر Connection String نیست؛ برنامه‌های شما همچنان با پروتکل استاندارد MySQL ارتباط برقرار می‌کنند.

۲. جستجوی برداری بومی برای عصر AI
ورک‌لودهای مدرن نیازمند جستجوی معنایی هستند. این نسخه از نوع داده VECTOR (تا ۱۶,۳۸۳ بعد) همراه با ایندکس‌های HNSW پشتیبانی می‌کند. با این قابلیت، می‌توانید الگوهای RAG، موتورهای پیشنهادگر و جستجوی معنایی را مستقیماً داخل سیستم OLTP خود اجرا کنید.

۳. نوشتن مستقیم روی Apache Iceberg (پلی به سوی Lakehouse)
اینجا همان نقطه عطف ماجراست! از طریق پلاگین DuckDB Iceberg، دیتابیس دیتای تراکنشی را مستقیماً روی جداول Iceberg (درون S3) می‌نویسد.
نتیجه؟ حذف کامل پایپ‌لاین‌های CDC. دیتا به محض Commit شدن، توسط موتورهایی مثل Spark، Flink و Trino قابل کوئری گرفتن است. دیتابیس عملیاتی شما دیگر فقط «منبع بالادستی» دیتا لیک نیست، بلکه تبدیل به بخشی از خود دیتا لیک شده است.

۴. بهینه‌سازی‌های عمیق و Native Flashback
امکان کوئری زدن به دیتای گذشته با AS OF TIMESTAMP و بهینه‌سازی‌های سطح پایین Binlog که باعث کاهش شدید I/O اضافی و تاخیر در Commit تراکنش‌های بزرگ شده است.

تصویر بزرگ‌تر: عصر Lakebase
هرچند مفهوم “Lakebase” اخیراً توسط بازیگرانی مثل Databricks مطرح شده، اما معماری‌ای که AliSQL فراهم کرده، دقیقاً به همان الگوی یکپارچه OLTP + Lakehouse می‌رسد. این نشان‌دهنده یک همگرایی جدی در صنعت است؛ صنعتی که قاطعانه به سمت پاک کردن مرز بین تراکنش‌ها و تحلیل‌ها حرکت می‌کند.
این بازطراحی اساسی نشان می‌دهد که معماری‌های HTAP و همگرایی OLTP و Lakehouseها جدی‌تر از همیشه در حال توسعه هستند.

https://github.com/alibaba/AliSQL

@ | <Mojtaba Banaie/>
🔵 عنوان مقاله
the part of Postgres they hate the most

🟢 خلاصه مقاله:
در میان سیستم‌های مدیریت پایگاه داده، بخش‌هایی از پوسگرس که کاربران بیشترین نارضایتی را دارند، معمولاً مربوط به عملکرد و به‌کارگیری منابع است. این موضوع با نتایج بنچمارک‌ها و آزمایش‌های مختلف تایید می‌شود و کسانی که تجربه کار با این سیستم‌ها را دارند، به خوبی می‌دانند که چقدر این قسمت‌ها ممکن است باعث کندی و تأخیر در اجرای درخواست‌ها شوند. نارضایتی‌ها معمولاً حول همین بخش‌ها می‌چرخد، چرا که بسیاری معتقدند بهبود در این قسمت‌ها می‌تواند تاثیر قابل توجهی بر کارایی نهایی سیستم داشته باشد.

در حالی که بسیاری بر روی این نقاط ضعف تمرکز می‌کنند، سوال مهم‌تر این است: در عوض، سایر سیستم‌های بانک اطلاعاتی نظیر اوراکل، ایننو دی‌بی، اس‌کیوال سرور، مونگو دی‌بی و دی‌تی‌دی چه راهکارهایی در پیش گرفته‌اند؟ و این راهکارها چه هزینه‌هایی را در بر دارند؟ هر یک از این پلتفرم‌ها راهکارهای متفاوتی برای مقابله با مشکلات عملکرد ارائه می‌دهند. برای نمونه، اوراکل و اس‌کیوال سرور امکانات بهینه‌سازی پیشرفته، سیستم‌های کشینگ خاص و معماری‌های توزیع شده را به کار می‌گیرند که البته با هزینه‌های مالی و پیچیدگی فنی بالایی همراه است.

به طور کلی، هر فناوری، چه در قالب open-source مانند پوسگرس و چه در قالب نرم‌افزارهای اختصاصی و تجاری، به نوعی باید تعادل بین کارایی، هزینه و پیچیدگی را برقرار کند. در نتیجه، انتخاب بهترین راهکار بستگی به نیازهای خاص سازمان، منابع مالی و قابلیت‌های فنی آن دارد. در نهایت، درک دقیق از هزینه‌ها و مزایای هر گزینه می‌تواند تصمیم‌گیری هوشمندانه‌تری را برای تیم‌های توسعه و مدیران سیستم رقم بزند، تا بتوانند بهترین گزینه را برای رفع مشکلات مقیاس‌پذیری و عملکردی انتخاب کنند.

#پایگاه_داده #بازنگری_عملکرد #سیستم‌های_مدیریت_دیتا #پیشرفت‌های_ فناوری

🟣لینک مقاله:
https://www.cs.cmu.edu/~pavlo/blog/2023/04/the-part-of-postgresql-we-hate-the-most.html


👑 @Database_Academy
Forwarded from Gopher Academy
اصطلاح one-shot ramp-up
بسته به زمینه (نرم‌افزار، DevOps، AI یا سخت‌افزار) کمی متفاوت است، اما مفهوم کلی آن این است:
راه‌اندازی یا افزایش ظرفیت در یک مرحله و به‌صورت یکباره، بدون افزایش تدریجی.
معنی واژه‌ها
One-shot =
یک‌باره، در یک مرحله، بدون تکرار
Ramp-up =
افزایش تدریجی ظرفیت، سرعت، بار یا عملکرد تا رسیدن به سطح موردنظر
وقتی این دو کنار هم قرار می‌گیرند، منظور این است که به‌جای افزایش تدریجی، سیستم مستقیماً به ظرفیت نهایی یا موردنظر می‌رسد.

مثال در توسعه نرم‌افزار
فرض کنید یک سرویس باید ۱۰۰۰ Worker اجرا کند.
درواقعه Ramp-up یعنی تدریجی

ثانیه 1 → 100 Worker
ثانیه 2 → 200 Worker
ثانیه 3 → 300 Worker
ثانیه 10 → 1000 Worker

One-shot ramp-up

ثانیه 1 → 1000 Worker
همه Workerها یک‌باره ایجاد می‌شوند.

مثال در تست بار (Load Testing)
در ابزارهایی مانند k6 یا JMeter:
Ramp-up
یعنی تعداد کاربران مجازی به‌تدریج افزایش پیدا کند.

One-shot ramp-up
یعنی تمام کاربران مجازی هم‌زمان شروع به ارسال درخواست کنند.
مثلاً:

1000 Virtual Users
Normal Ramp-up:
0 → 1000 در مدت 5 دقیقه
One-shot Ramp-up:
0 → 1000 در کمتر از یک ثانیه

مثال در Kubernetes
فرض کنید Deployment شما باید ۵۰ Pod داشته باشد.

اRamp-up معمولی:
ا Podها به‌تدریج ساخته می‌شوند.

One-shot ramp-up: Scheduler
تلاش می‌کند هر ۵۰ Pod را تقریباً هم‌زمان ایجاد کند (البته با توجه به محدودیت‌های کلاستر).
مزایا
رسیدن سریع به ظرفیت کامل
مناسب برای تست فشار (Stress Testing)
کاهش زمان راه‌اندازی

معایب
افزایش ناگهانی مصرف CPU و RAM
احتمال ایجاد Thundering Herd Problem (هجوم هم‌زمان تعداد زیادی درخواست یا پردازش)
افزایش احتمال Timeout یا فشار روی دیتابیس و سرویس‌های وابسته

جمع‌بندی
این One-shot ramp-up یعنی سیستم، کاربران، Workerها یا منابع در یک مرحله و تقریباً هم‌زمان به ظرفیت هدف برسند، نه اینکه به‌صورت تدریجی افزایش پیدا کنند. این اصطلاح معمولاً در زمینه‌های Load Testing، سیستم‌های توزیع‌شده، Kubernetes، سرویس‌های ابری و پردازش موازی استفاده می‌شود.
یکی از خبرهای جذاب این روزا منتشر شدن PGSimCity بود؛ پروژه‌ای که مفاهیم داخلی PostgreSQL رو به یک شهر سه‌بعدی تعاملی تبدیل کرده تا یادگیری اجزا داخلی شهودی‌تر و ساده‌تر بشه.

اگر دوست دارین بدونین Postgresql دقیقا چطور کار میکنه از دستش ندین.

https://nikolays.github.io/PGSimCity/

@ | <Fateme/>
1
Forwarded from Persian Post
کتاب «اپل در چین: تسخیر بزرگ‌ترین شرکت جهان»

(Apple in China: The Capture of the World's Greatest Company)

اثری جذاب و خواندنی از پاتریک مک‌گی است.

این کتاب به بررسی وابستگی عمیق شرکت اپل به نیروی کار و زیرساخت‌های صنعتی چین می‌پردازد و نشان می‌دهد که چگونه اپل با برون‌سپاری تولید آیفون به چین، به بزرگ‌ترین شرکت فناوری جهان تبدیل شد. همچنین به این موضوع اشاره دارد که این وابستگی متقابل چگونه به پکن قدرت زیادی بخشیده است، به طوری که اگر دولت چین بخواهد، می‌تواند حیات تولید آیفون را یک‌شبه با چالش جدی مواجه کند.

https://xn--r1a.website/+Bp8JeTpQoiUwMjVk
🔵 عنوان مقاله
Smevals - a Small Eval Suite for Evaluating Models, Prompts, and Harnesses (9 minute read)

🟢 خلاصه مقاله:
اسمیوالز، مجموعه‌ای کوچک و کاربردی برای ارزیابی مدل‌ها، پویاها و ابزارهای مختلف در حوزه هوش مصنوعی است که کار با آن بسیار آسان و سریع است. این ابزار، یک خط فرمان سبک و کارآمد بر پایه پایتون است که امکان اجرای ارزیابی‌های تخصصی مرتبط با وظایف مختلف را بر روی چندین مدل فراهم می‌کند. هدف اصلی این مجموعه، پیدا کردن اقتصادی‌ترین مدل‌هایی است که از نظر کیفیت در سطح مورد انتظار قرار دارند.

در استفاده از اسمیوالز، ابتدا وظایف مورد نظر خود را تعریف می‌کنید؛ سپس با نوشتن فایل‌های YAML حاوی ارزیاب‌های اختصاصی و اسکریپت‌های بررسی سفارشی، ارزیابی‌ها را می‌نویسید و آن‌ها را بر روی مجموعه‌ای از تنظیمات مدل‌ها اجرا می‌کنید. نتایج نمره‌گذاری شده در قالب یک داشبورد محلی یا یک سایت استاتیک نمایش داده می‌شوند تا بتوانید به راحتی و در کم‌ترین زمان، مدل‌هایی را که بهترین عملکرد را دارند، شناسایی و مقایسه کنید.

این ابزار، به ویژه برای توسعه‌دهندگان و محققانی که نیاز دارند سریع و به صورت موثری کیفیت مدل‌های مختلف را ارزیابی کنند، بسیار مفید است. رابط کاربری ساده و قابلیت‌های قابل تنظیم آن، فرآیند آزمایش و انتخاب مدل‌ها را به مراتب آسان‌تر می‌سازد و کمک می‌کند تا در هزینه‌ها و زمان صرفه‌جویی بیشتری صورت گیرد.

#هوش_مصنوعی #ارزیابی_مدل #پایتون #توسعه_هوش

🟣لینک مقاله:
https://primeradiant.com/blog/2026/smevals.html?utm_source=tldrdata


👑 @Database_Academy
2
🔵 عنوان مقاله
Crowdsourced taxonomy verification: A feedback-driven framework for refining knowledge graph relationships via online search interactions (6 minute read)

🟢 خلاصه مقاله:
در فرآیند توسعه سامانه‌های دانش‌مدار، یکی از چالش‌های مهم، اطمینان از صحت و سقم روابط بین موجودیت‌ها در نقشه‌های دانش (Knowledge Graph) است. در این حوزه، رویکردهای سنتی معمولاً مبتنی بر تحلیل‌های دستوری یا منابع ثابت هستند که ممکن است نتوانند تغییرات و واقعیات روزمره را به خوبی منعکس کنند. به همین دلیل، اخیراً رویکرد نوینی به نام "تایپوگرافی مبتنی بر جمع سپاری و بازخورد" ابداع شده که با بهره‌گیری از رفتارهای جستجو در وب، امکان ارزیابی و اصلاح روابط موجود در نقشه‌های دانش را فراهم می‌آورد.

در این چارچوب جدید، روابط فرضی بین موجودیت‌ها—مانند روابط پدری، فرزندی یا هم‌خون—به عنوان فرضیه‌هایی در نظر گرفته می‌شوند که باید صحت آن‌ها با توجه به تعاملات کاربران در فرآیندهای جستجو تایید یا رد شود. بدین صورت، پیشنهادهای اولیه بر پایه تحلیل‌های آماری و الگوریتم‌های هوشمند ارائه می‌گردد و سپس با جمع‌آوری داده‌های واقعی کاربران مانند کلیک‌ها، مدت زمان گذاشته شده بر صفحات، اسکرول‌ها و نرخ تبدیل، امتیازهای اعتمادی ساخته می‌شود. این امتیازها نشان می‌دهند که چه میزان رابطه‌ای در نقشه دانش معتبر است و کدام روابط باید تقویت یا حذف شوند.

این رویکرد نه تنها قابلیت اصلاح و به‌روزرسانی سریع‌تر نقشه‌های دانش را فراهم می‌کند، بلکه با تکیه بر بازخوردهای مستقیم کاربران، به تدریج به سمت ساختاری دقیق‌تر و منعکس‌کننده‌تر واقعیت حرکت می‌کند. در نتیجه، این سیستم مبتنی بر جمع سپاری، امکان توسعه سیستم‌های هوشمند و قابل اعتمادتر در حوزه‌های متعددی را فراهم می‌آورد و بهبود مستمر در صحت روابط بین داده‌ها و مفاهیم را تضمین می‌کند.

#نقشه_دانش #بازخورد_کاربر #هوش_مصنوعی #تحلیل_داده

🟣لینک مقاله:
https://engineering.grab.com/crowdsourced-taxonomy-verification?utm_source=tldrdata


👑 @Database_Academy
3
🔵 عنوان مقاله
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model (12 minute read)

🟢 خلاصه مقاله:
در طول شش ماه گذشته، شرکت Meta توانسته است عملکرد مدل پایه‌ی مربوط به تبلیغات خود را به طرز شگفت‌انگیزی بهبود ببخشد. این شرکت با بهره‌گیری از مجموعه‌ای از فناوری‌های نوآورانه، موفق شده است مدل پیشنهادی تبلیغات خود را چهار برابر بزرگ‌تر کند و در نتیجه، کارایی آموزش آن را دو برابر افزایش دهد. این تغییرات در کارایی، از جمله افزایش بهره‌وری در فرآیند آموزش مدل‌های بزرگ زبانی (LLMs)، نقش بسزایی ایفا می‌کنند و Meta را در رقابت‌های جهانی پیشروتر کرده‌اند.

برای دستیابی به این نتایج چشمگیر، Meta پنج تکنیک کلیدی را به کار گرفته است. نخست، استفاده از مکانیزم توجه سریع و انعطاف‌پذیر (جگد فلش اتنشن) که می‌کوشد تا هدررفت ناشی از قسمت‌های padding را حذف کند و فضای بیشتری را برای عملیات مفید فراهم آورد. دوم، ایجاد هسته‌ی یکنواخت توجه که با سرعت ۲ تا ۳.۵ برابری، عملیات محاسباتی را به صورت موثرتری انجام می‌دهد. سوم، آموزش با استفاده از دقت MXFP8، که بهره‌وری را در مدل‌سازی افزایش می‌دهد و زمان لازم برای آموزش را کاهش می‌دهد. چهارم، فناوری ارتباط جمعی بدون سی‌ام (SM-free) که توانایی جمع‌آوری داده‌ها را بدون نیاز به منابع اضافی، نزدیک به ۲۳ واحد SM (واحدهای محاسباتی) آزاد می‌کند. و در نهایت، تکنیکی به نام جابه‌جایی تعادل بار، که باعث افزایش ۴ درصدی کارایی می‌شود بدون اینکه هزینه‌ای برای ارتباط درون سیستم داشته باشد.

این پیشرفت‌ها نشان می‌دهند که با ترکیب خلاقانه فناوری‌های نوین، می‌توان مدل‌های هوشمند را بسیار بهینه‌تر و کارآمدتر ساخت و در عین حال، زمان و منابع مورد نیاز برای آموزش آن‌ها را کاهش داد. این موفقیت‌ها مسیر را برای توسعه فناوری‌های تبلیغاتی و مدل‌سازی زبان طبیعی در آینده هموارتر می‌کنند و Meta را در صدر رقابت‌های فناوری قرار می‌دهد.

#هوش_مصنوعی #یادگیری_عمیق #مدل_زبانی #تکنولوژی‌‌های_نوین

🟣لینک مقاله:
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
How DoorDash Built a Centralized Gateway for AI Agent-Tool Access (13 minute read)

🟢 خلاصه مقاله:
در دنیای فناوری امروز، نقش هوش مصنوعی و ابزارهای مبتنی بر آن در بهبود عملیات‌های تجاری بسیار حیاتی است. شرکت DoorDash با درک نیاز به یک سامانه مرکزی برای مدیریت دسترسی‌های هوشمند، تصمیم گرفت یک درگاه مرکزی برای ارتباط بین عامل‌های هوشمند و ابزارهای MCP ایجاد کند. این درگاه که به صورت متمرکز طراحی شده است، امکان دسترسی کنترل‌شده و امن به ابزارهای مورد نیاز را برای عوامل هوشمند فراهم می‌کند، و فرآیند مدیریت هویت، مجوزها، اعتبارنامه‌ها، فیلتر‌گذاری، نظارت و محدودیت سرعت را بر عهده می‌گیرد.

این سیستم توانسته است هم‌اکنون از بیش از ۲۰۰ سرور MCP پشتیبانی کرده و میلیون‌ها درخواست هفتگی را مدیریت کند، در حالی که سطح امنیت، اعتمادپذیری و کنترل کلی عملیات به شکل قابل توجهی بهبود یافته است. با نصب این درگاه مرکزی، شرکت DoorDash توانسته اطمینان حاصل کند که دسترسی‌های هوشمند به صورت مؤثر و امن صورت می‌پذیرد، و در عین حال فرآیندها ساده‌تر و مدیریت‌پذیرتر شوند. نتیجه نهایی، ارتقاء سطح امنیت و کارایی در سیستم‌های داخلی است که اهمیت زیادی در پشتیبانی از عملیات‌های روزمره و حفظ رضایت مشتری دارد.

#هوش_مصنوعی #امنیت_سایبری #مدیریت_دسترسی #تکنولوژی

🟣لینک مقاله:
https://careersatdoordash.com/blog/how-doordash-built-a-centralized-gateway-for-ai-agent-tool-access/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Waiting for Postgres 19: SQL Property Graph Queries (SQL/PGQ)

🟢 خلاصه مقاله:
در دنیای پایگاه‌های داده، سوال بسیار رایجی مطرح می‌شود: چه مزیتی دارد که از قابلیت‌های خاص کوئری‌نویسی گراف در SQL، مانند پرس‌وجوی‌های گراف‌خصی (SQL/PGQ)، نسبت به روش‌های سنتی مانند استفاده از JOINهای معمول بهره‌مند شویم؟ اگر تاکنون در این باره فکر کرده‌اید که چرا باید از امکانات ویژه گراف‌های ویژگی در SQL استفاده کنید، تنها نیستید. بسیاری از توسعه‌دهندگان و مدیران پایگاه‌داده‌ها کنجکاوند بدانند که این فناوری چه تفاوتی با روش‌های سنتی دارد و چه مزایایی می‌تواند برای آن‌ها فراهم کند.

در واقع، افزوده شدن قابلیت‌های گراف‌پایه در SQL، امکان ذخیره و پرس‌وجوی داده‌های پیچیده و شبکه‌مانند را با سهولت بیشتری فراهم می‌کند. این ویژگی‌ها به ویژه در مسائلی کاربرد دارند که ساختارهای داده آن‌ها به صورت سلسله‌مراتب یا شبکه‌های متصل هستند، جایی که کوئری‌های سنتی ممکن است نیاز به چندین عملیات JOIN و زیرپرس‌وجوهای پیچیده داشته باشند. با بهره‌گیری از پرس‌وجوی‌های گراف در SQL، می‌توان روابط پیچیده بین داده‌ها را به شکلی طبیعی‌تر و کارآمدتر مدل‌سازی و جست‌وجو کرد، امری که در آینده نزدیک و با انتشار نسخه 19 پایگاه‌داده PostgreSQL، بیشتر شاهد آن خواهیم بود.

در نتیجه، انتظار می‌رود که توسعه‌دهندگان بتوانند در پروژه‌های خود، دسترسی سریع‌تر و دقیق‌تر به داده‌های مرتبط و شبکه‌ای داشته باشند و بتوانند به شکل مؤثرتری سوالات پیچیده مربوط به روابط را پاسخ دهند. این تغییرات، علاوه بر بهبود کارایی، امکانات جدیدی برای تحلیل‌های پیشرفته و بینش‌های عمیق‌تر در داده‌ها فراهم می‌کند. در انتظار نسخه جدید PostgreSQL می‌مانیم تا ببینیم چگونه این قابلیت‌ها، دنیای مدیریت و تحلیل داده را متحول خواهند ساخت.

#پایگاه‌داده #PostgreSQL #گراف #تحلیل‌داده

🟣لینک مقاله:
https://www.depesz.com/2026/07/31/waiting-for-postgresql-19-sql-property-graph-queries-sql-pgq/


👑 @Database_Academy
🔵 عنوان مقاله
Bringing DuckLake to DataFusion (4 minute read)

🟢 خلاصه مقاله:
در این مقاله کوتاه، به معرفی پروژه DuckLake برای DataFusion می‌پردازیم که اکنون به عنوان یک سامانه‌ی بک‌اند کاتالوگ قابل اعتماد و متن باز، آماده بهره‌برداری در محیط‌های تولید شده است. این سامانه امکان مدیریت متادیتای تراکنشی، گرفتن تصویرهای لحظه‌ای (اسنپ‌شات) و مدیریت طرح‌های جدول‌های پارکت در فضای ذخیره‌سازی ابری را برای کاربران فراهم می‌کند. طراحی DuckLake به گونه‌ای است که از چندین نوع بک‌اند کاتالوگ رابطه‌‌ای و کاتالوگ‌های منطقی پشتیبانی می‌کند، و بدین ترتیب میلیون‌ها پایگاه داده‌ی موقت و ایزوله شده را برای عامل‌های هوش مصنوعی بدون نیاز به تکرار زیرساخت‌ها، امکان‌پذیر می‌سازد.

این سیستم با آزمایش‌های مقیاس‌پذیری و بنچمارک‌های TPC-H بر روی ۲۲ پرسش و سه اندازه متفاوت از داده‌ها، نشان داده است که هیچگونه هزینه‌ اضافی در مقایسه با اجرای مستقیم پرس‌وجو بر روی داده‌ها، ندارد. نتیجه این است که DuckLake نه تنها یک پیاده‌سازی پایدار و کارآمد است، بلکه توسعه‌پذیری و انعطاف‌پذیری بالا در مواجهه با نیازهای مختلف هوش مصنوعی و داده‌کاوی را فراهم می‌کند و می‌تواند به طور مؤثر در محیط‌های صنعتی و تحقیقاتی مورد استفاده قرار گیرد.

#دیتافیوژن #دینامیکداده #هوش مصنوعی #مدیریتداده

🟣لینک مقاله:
https://ducklake.select/2026/07/29/bringing-ducklake-to-datafusion/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
LLMs for Relevance: Automating High-Quality Product Relevance Labeling in Flipkart Search (10 minute read)

🟢 خلاصه مقاله:
در دنیای تجارت الکترونیک، ارائه نتایج جستجوی مرتبط و با کیفیت نقش بسیار مهمی در رضایت مشتریان دارد. شرکت فلیپکارت با توجه به حجم بالای محصولات و جستجوهای روزانه، نیازمند روشی هوشمندانه و کارآمد برای تعیین ارتباط میان محصولات و عنوان‌های جستجو است. در نتیجه، تیم توسعه این شرکت از فناوری‌های پیشرفته هوش مصنوعی و یادگیری ماشین بهره گرفته است تا فرآیند برچسب‌گذاری مرتبط بودن محصولات با جستجوها را خودکار کند. این روش نه تنها باعث صرفه‌جویی در زمان و هزینه می‌شود، بلکه دقت و کیفیت نتایج را نیز بهبود می‌بخشد.

در مرحله اول، مدل ارزیابی مرتبط بودن محصولات (Relevance Labeling Model) در فلیپکارت بر اساس روشی به نام "یادگیری تقویتی با نمونه‌گیری‌های آزادشده" (Supervised Fine-Tuning یا SFT) آموزش می‌بیند. این مدل از میلیون‌ها نمونه متعادل شامل کوئری و محصول و همچنین فرآیندهای استنتاجی احتمالی، برای یادگیری الگوهای مربوط بودن استفاده می‌کند. هدف از این مرحله، ایجاد یک معیار اولیه و قابل اعتماد برای سنجش ارتباط محصولات با درخواست‌های کاربران است. پس از آن، تیم توسعه با استفاده از رویکردی به نام "هماهنگی در مدل‌های تقویتی" (GRPO) بر پایه یک مدل پاداش با ابعاد 8 میلیارد، فرآیند ارزیابی و اصلاح مدل را انجام می‌دهد. این مدل پاداش به صورت همزمان کیفیت توضیحات و صحت برچسب‌ها را ارزیابی می‌کند، تا اطمینان حاصل شود که مدل نه تنها مرتبط بودن را تشخیص می‌دهد، بلکه توضیحات منطقی و قابل قبول نیز ارائه می‌دهد.

نتیجه نهایی، گزارش ارزیابی مرتبط بودن نمره NDCG است که به صورت خودکار تولید می‌شود. این گزارش با نمونه‌های دستی و انسانی مقایسه شده و تفاوتی کمتر از 1 درصد دارد. مهم‌تر اینکه، این فرآیند خودکار هزینه‌ای حدود 30 درصد کمتر از ارزیابی‌های دستی دارد و در عین حال دقت و اعتمادپذیری همچنان حفظ شده است. این پیشرفت‌ها نشان می‌دهد که استفاده از فناوری‌های هوشمند در بهبود فرآیندهای کسب‌وکار، می‌تواند تاثیر چشمگیری در کاهش هزینه‌ها و ارتقاء کیفیت خدمات داشته باشد.

در نتیجه، بهره‌گیری از مدل‌های زبان بزرگ و فناوری‌های نوین در حوزه ارزیابی کیفیت محصولات، فرصت‌های بی‌نظیری را برای شرکت‌های تجارت الکترونیک فراهم می‌کند تا بتوانند تجربه مصرف‌کننده را بهبود بخشند و روند تصمیم‌گیری در فرآیند جستجو را هوشمندانه‌تر و کارآمدتر سازند.

#هوش_مصنوعی #یادگیری_ماشین #فناوری_پیشرفته #تجارت_الکترونیک

🟣لینک مقاله:
https://blog.flipkart.tech/llms-for-relevance-automating-high-quality-product-relevance-labeling-in-flipkart-search-ddd5ca50b584?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
COUNT(DISTINCT) Too Slow? A Guide to Fast Approximations

🟢 خلاصه مقاله:
در دنیای پایگاه‌های داده، عملیات شمارش تعداد رکوردهای منحصر به فرد یکی از نیازهای رایج است که ممکن است با حجم بالای داده‌ها، به صورت سنتی و مستقیم سرعت پایین‌تری داشته باشد. در این مقاله، به بررسی روش‌های مختلف برای انجام این عملیات با کارایی بالا می‌پردازیم، از جمله ابزارهایی مانند TABLESAMPLE، ساختارهای هیویت یا HLL و نیز کتابخانه‌های پیشرفته مانند Apache DataSketches.

در طی این راهنما، نگاهی دقیق و عملی به قدرت‌های تقریبی و نمونه‌گیری در سیستم‌های مبتنی بر PostgreSQL خواهیم داشت. هدف ارائه راهکارهای سریع‌تر در سناریوهایی است که نیاز به تخمین سریع تعداد رکوردهای یکتا وجود دارد، به خصوص در جداول بسیار بزرگ، مانند جدولی با ده میلیون رکورد که در آزمایش‌ها مورد ارزیابی قرار گرفت. این روش‌ها مزایا و معایب خود را دارند و در کنار مقایسه عملکردی، ویژگی‌های هر کدام را بررسی می‌کنیم تا بتوانید بهترین ابزار را بر اساس نیازهای خاص پروژه خود انتخاب کنید.

گام‌های مختلف این راهنما، شما را با روش‌های تقریبی آشنا می‌کند و نشان می‌دهد چگونه می‌توانید بدون نیاز به شمارش دقیق، نتایجی قابل اعتماد و سریع بدست آورید که به تصمیم‌گیری‌های شما کمک کند و به طور قابل توجهی زمان انجام عملیات را کاهش دهد.

#پایگاه_داده #بزرگ_داده #تقریبی #پستگرس

🟣لینک مقاله:
https://www.snowflake.com/en/blog/engineering/postgres-count-distinct-approximation/


👑 @Database_Academy
🔵 عنوان مقاله
Asynchronous I/O in DuckDB: Work, Thread, Work (12 minute read)

🟢 خلاصه مقاله:
در داک‌دی‌بی، یکی از به‌روزرسانی‌های مهم، افزودن ورودی و خروجی غیرهم‌زمان (asychronous I/O) است. هدف اصلی از این تغییر، این است که نخ‌های کاری که وظیفه خواندن فایل‌های پارکت و CSV بر بستر S3 را دارند، دیگر در حین عملیات مسدود نشوند و در نتیجه عملیات‌های کاربردی همزمان و کارآمدتری را تجربه کنند.

در طراحی جدید، بخش‌بندی بین عملیات‌های غیرهم‌زمان و استخرهای نخ‌های کاری به گونه‌ای صورت گرفته است که هر کدام مستقل عمل می‌کنند. علاوه بر این، ویژگی‌های پیش‌خوانی (read-ahead) و مدیریت حافظه (memory governance) به سیستم افزوده شده است تا کارایی و کنترل بر عملیات‌های داده‌ها به صورت بهتری صورت گیرد. نتیجه این به‌روزرسانی‌ها، بهبودهای چشم‌گیری در عملکرد است؛ مثلا، زمان اجرای پرس‌وجوی TPC-H Q6 روی داده‌های ۲۲ گیگابایتی در قالب فایل پارکت، کاهش قابل توجهی از ۸.۲۳ ثانیه به ۲.۸۴ ثانیه پیدا کرد. همچنین، زمان اسکن کردن فایل‌های CSV بزرگ تقریباً بیست برابر سریع‌تر شد، که نشان‌دهنده افزایش چشم‌گیر کارایی در پردازش داده‌های حجیم است. این تغییرات، توانسته است موجب بهبود قابل توجه عملکرد سیستم در مواجهه با حجم بالای داده‌ها در بستر ابر و فضاهای ذخیره‌سازی ابری شوند.

#دکتابی #ورودی_خروجی #پایگاه_داده #بهبود_عملکرد

🟣لینک مقاله:
https://duckdb.org/2026/07/31/asynchronous-io.html?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
PGSimCity (Tool)

🟢 خلاصه مقاله:
اسنادی که درباره PGSimCity صحبت می‌کند، یک شبیه‌ساز آموزشی تعاملی است که نحوه عملکرد پایگاه داده‌های PostgreSQL را به شکل یک شهر سه‌بعدی نمایش می‌دهد. این ابزار قدرتمند به کاربران امکان می‌دهد تا با تنظیم میزان بار کاری و شبیه‌سازی سناریوهای مختلف، نحوه واکنش سیستم‌های داخلی PostgreSQL را مشاهده کنند.

در این محیط، می‌توان رویدادهایی مانند طوفان‌های checkpoint، ویران‌شدن کش، بلوکه شدن‌های خودکار، تجمع قفل‌ها و تأخیر در تکرارپذیری داده‌ها را فعال کرد تا وضعیت سیستم و تأثیر آن بر کارایی پایگاه داده به درستی دیده شود. این تجربه آموزشی به توسعه‌دهندگان و مدیران سیستم کمک می‌کند تا بهتر درک کنند که چگونه سیستم‌های داخلی PostgreSQL در مقابل فشارهای مختلف واکنش نشان می‌دهند و چه راهکارهایی برای بهبود کارایی و پایداری آن وجود دارد.

این ابزار، با ترسیم تصویری واقعی و بصری از رفتار داخلی پایگاه داده، یک فرصت بی‌نظیر برای آموزش و آزمون است. دانش‌پذیران می‌توانند بدون نگرانی از تأثیرات منفی بر سیستم‌های زنده، روندهای مختلف را تست و تحلیل کنند و بر مبنای آن استراتژی‌های بهبود عملکرد تدوین نمایند.

#پایگاه‌داده #پستگرسکوال #شبیه‌سازی #آموزش

🟣لینک مقاله:
https://nikolays.github.io/PGSimCity/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
The Mean Means Nothing (9 minute read)

🟢 خلاصه مقاله:
در یک مطالعه اخیر، مشخص شد که اجرای سرویس‌های وب با تاخیر نشان می‌دهد که میانگین زمان پاسخ‌دهی در بازه زمانی مورد بررسی، ۹ درصد افزایش یافته است. در حالی که در همان داده‌ها، میانه یا مقدار وسط پاسخ‌ها، کاهش قابل توجهی معادل ۴۶ درصد را تجربه کرده است. همچنین، شاخص p99 یا نود و نهمین درصد، با افزایش چشمگیر ۱۱۹ درصد روبه‌رو شده است. این تفاوت‌ها نشان می‌دهد که تکیه بر تنها یک شاخص آماری می‌تواند تصویری نادرست از وضعیت واقعی ارائه دهد، زیرا این دسته‌بندی‌ها ممکن است توزیع داده‌ها را مخفی کند و نشان‌دهنده همزمان بودن حالت‌های مختلف باشد.

برای درک بهتر این پدیده، تحلیل‌های تکمیلی مانند نمودارهای چگالی، توزیع تجمعی، شاخص‌های شیفت و نقشه‌های شیب‌دار مورد استفاده قرار گرفتند. این ابزارها کمک کردند تا الگوهای توزیع_RESPONSE به شکل دقیق‌تری مشاهده و تحلیل شوند. نتیجه هریک از این روش‌ها نشان داد که اندازه پاسخ‌ها یا همان حجم پاسخ‌های دریافت‌شده، علت اصلی تفاوت‌ها و رفتارهای غیرمنتظره در داده‌ها است. در نهایت، این تحلیل‌ها نشان دادند که تمرکز روی یک شاخص واحد مانند میانگین، ممکن است کلیت وضعیت را نادیده گرفته و تصویری نادرست از عملکرد سیستم ارائه کند.

در نتیجه، تحلیل جامع و چند وجهی داده‌ها اهمیت زیادی دارد و تنها اتکا به یک معیار باعث فهم ناقص و گمراه‌کننده در مسائل مربوط به عملکرد سرویس‌های وب می‌شود. این مطالعه بر اهمیت استفاده از ابزارهای تحلیلی متنوع تاکید دارد که می‌توانند جزئیات مهم را که در نگاه اول دیده نمی‌شوند، آشکار سازند.

#تجزیه_و_تحلیل #سرویس_وب #توزیع_داده‌ها #بهبود_عملکرد

🟣لینک مقاله:
https://fzakaria.com/2026/07/27/the-mean-means-nothing?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Prototype on a laptop, scale to 16 billion rows: one Polars query (14 minute read)

🟢 خلاصه مقاله:
در فرایند توسعه و آزمایش، تیم‌ها می‌توانند با استفاده از پروتوتایپ‌سازی در لپ‌تاپ، نمونه‌ داده‌های نماینده را بررسی و آزمایش کنند. این کار به آنان امکان می‌دهد تا در مرحله اولیه، با حجم کوچک‌تری از داده‌ها، الگوها و روندها را شناسایی و بهبود دهند. پس از تکمیل مراحل توسعه، همان کوئری‌های LazyFrame می‌توانند به سادگی در بستر ابری روی ۱۶ میلیارد ردیف داده اجرا شوند، بدون نیاز به بازنویسی یا تغییر در منطق پردازش. این قابلیت، صرفه‌جویی قابل توجهی در زمان و تلاش را فراهم می‌کند و تفاوتی نمی‌گذارد که داده‌ها کوچک باشد یا عظیم، همگی با همان کدهای برتر قابل اجرا هستند.

پروتکل توسعه داده‌های خام Polymarket در قالب فایل‌های کوچک Parquet در سرویس S3 ذخیره می‌شود. این پیش‌پردازش به سیستم امکان می‌دهد تا داده‌ها را به صورت خلاصه و دسته‌بندی شده درآورد و حجم قابل‌مقایسه‌ای از اطلاعات برای تجزیه و تحلیل‌های سریع آماده کند. این رویکرد، باعث می‌شود داشبوردهای تعاملی مبتنی بر Plotly Dash بتوانند همیشه سریع و پاسخگو باقی بمانند، بدون نیاز به اسکن کامل مجموعه داده‌ها در هر بار درخواست. نتیجه نهایی، همزمانی میان توسعه محلی و اجرای در مقیاس بزرگ است که سرعت و کارایی را تضمین می‌کند، در حالی که کاربر نهایی تجربه‌ای بی‌نظیر کسب می‌کند.

در مجموع، این امکانات نشان می‌دهد که چگونه فناوری‌های نوین مانند Polars و Uniting با زیرساخت‌های ابری، تحولی در روند تجزیه و تحلیل داده‌ها ایجاد کرده‌اند. تیم‌ها اکنون می‌توانند با آرامش خاطر، پروژه‌های بزرگ را با همان سرعت و انعطاف‌پذیری نمونه‌های کوچک، مدیریت و اجرا کنند و بهره‌وری خود را به طور چشمگیری افزایش دهند.

#تحلیل_داده #ابزارهای_پیشرفته #پایگاه_داده #هوش_مصنوعی

🟣لینک مقاله:
https://pola.rs/posts/market-data-to-plotly-enterprise-dashboard/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Encoding or Compression: Why not both? (9 minute read)

🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات، مفهوم «کدگذاری» و «فشرده‌سازی» نقش مهمی در بهینه‌سازی عملکرد سیستم‌ها دارند. کدگذاری، فناوری‌ای است که امکان اجرای پرس‌وجوهای تحلیلی را سریع‌تر و موثرتر می‌کند، در حالی که فشرده‌سازی عمدتاً برای کاهش حجم داده‌های ذخیره‌سازی به کار می‌رود. این دو تکنیک در عین تفاوت در کاربردشان، می‌توانند مکمل یکدیگر باشند و استفاده همزمان از هر دو، کارایی سیستم‌های اطلاعاتی را به طور قابل توجهی بهبود بخشد.

در فرآیندهای کدگذاری، روش‌هایی مانند کدگذاری دیکشنری و قالب مرجع (frame-of-reference) به منظور سرعت بخشیدن به مقایسه‌ها و عملیات SIMD طراحی شده‌اند. این فناوری‌ها امکان مقایسه سریع، حذف داده‌های غیر ضروری و بهینه‌سازی عملیات محاسباتی را فراهم می‌آورند. به عنوان نمونه، نتایج به‌دست آمده از سیستم CedarDB نشان می‌دهد که اولین قدم همواره باید کدگذاری داده‌ها باشد، و تنها زمانی که صرفه‌جویی در فضای دیسک قابل توجه باشد، افزودن تکنولوژی‌هایی مانند zstd منطقی است.

بنابراین، استراتژی ایده‌آل در مدیریت داده‌ها ممکن است استفاده همزمان از هر دو روش باشد؛ ابتدا داده‌ها را کدگذاری کنیم تا عملیات پردازشی سریع‌تر انجام شود و در صورت نیاز، آن‌ها را با فشرده‌سازی مناسب، برای صرفه‌جویی در فضای ذخیره‌سازی، کاهش دهیم. این رویکرد انعطاف‌پذیر و اقتصادی، به سازمان‌ها کمک می‌کند تا بهترین بهره‌برداری را از منابع خود داشته باشند و عملکرد سیستم‌های داده‌ای خود را ارتقاء دهند.

#فشرده‌سازی #کدگذاری #مدیریت_داده #بهینه‌سازی

🟣لینک مقاله:
https://cedardb.com/blog/encoding_vs_compression/?utm_source=tldrdata


👑 @Database_Academy