885 subscribers
45 photos
3 videos
1 file
1.43K links
🕸 Database Academy

حمایت مالی:
https://www.coffeete.ir/mrbardia72

ادمین:
@mrbardia72
Download Telegram
🔵 عنوان مقاله
We turned off Pub/Sub and nobody noticed (17 minute read)

🟢 خلاصه مقاله:
تیم Incident.io با هدف ارتقاء سطح اطمینان‌پذیری سیستم‌های خود، تصمیم گرفتند سرویس Pub/Sub گوگل را غیرفعال کنند. این اقدام در حالی صورت گرفت که تمامی اعضای تیم و کاربران متوجه تغییر نشدند، چرا که این پروسه به گونه‌ای طراحی شده بود که بدون توقف یا اختلال در کارکرد سیستم انجام شود.

برای رسیدن به این هدف، تیم اقدام به جایگزینی Pub/Sub با ناتس (NATS) كرد و سپس یک تعادل‌بار فعال-فعال (Active-Active Load Balancer) پیاده‌سازی کردند. این تعادل‌بار به صورت خودکار پیام‌ها را بین هر دو ساب‌سیستم توزیع می‌کرد، به گونه‌ای که در صورت بروز هرگونه مشکل در یک بخش، دیگری به طور پیوسته وظیفه را بر عهده داشت و سیستم عملکرد بدون مشکل خود را حفظ می‌کرد.

در مراحل آزمایش، تیم تمام سرویس Pub/Sub را به طور کامل غیرفعال کرد و عملکرد سیستم را زیر نظر گرفت تا اطمینان حاصل کند که هیچ پیام از دست نمی‌رود و هیچ تأثیر منفی بر تجربه کاربری ندارد. نتایج این آزمایش‌ها بسیار رضایت‌بخش بود؛ هیچ پیام گم نشده، خطای ناپیدا و هیچ پیامد منفی برای کاربران مشاهده نشد.

این راهکار نشان داد که با طراحی مناسب و استفاده از فناوری‌های نوین، می‌توان سیستم‌های حساس و مهم را بدون توقف بهبود بخشید و از بروز علائم نقطه ضعف در زیرساخت‌های حیاتی جلوگیری کرد.

#پاسخگویی_پایدار #مدیریت_پرسنل #تسریع_توسعه #تکنولوژی_نواوری

🟣لینک مقاله:
https://incident.io/blog/we-turned-off-pub-sub-and-nobody-noticed?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Simplifying data and product integrations with a data abstraction layer (8 minute read)

🟢 خلاصه مقاله:
در دنیای پرسرعت امروزی، یکپارچه‌سازی داده‌ها و محصولات یکی از چالش‌های مهم شرکت‌ها است. Uber توانسته است با بهره‌گیری از یک لایه انتزاع داده (Data Abstraction Layer) راه‌حلی کارآمد و انعطاف‌پذیر ارائه دهد که فرآیندهای مربوط به ادغام داده‌ها را بسیار ساده‌تر و سریع‌تر می‌کند. این فناوری، اتصال میان محصولات و داده‌های مختلف را از قید و بند تغییرات در جداول فیزیکی، ساختارهای اطلاعاتی و زیرساخت‌های پشتیبانی آزاد می‌سازد و امکان توسعه و به‌روزرسانی سریع‌تر سیستم‌ها را فراهم می‌آورد.

در این روش، لایه انتزاع داده‌ها شامل جداول منطقی است که به صورت مجازی ایجاد شده و به کمک API خاص FetchData، قادر است درخواست‌های متعدد را به طور همزمان و کارآمد از منابع مختلف مانند جداول لحظه‌ای و روزانه، مخازن OLAP، دیتاستور، داک‌استور و هایو پردازش کند. این ساختار، سوای اینکه نیاز به تغییرات مکرر در ساختارهای فیزیکی باشد، امکان جمع‌آوری و تحلیل داده‌های متنوع را فراهم می‌آورد. به عنوان مثال، داده‌های مربوط به گزارش‌گری تبلیغاتی، که پیش‌تر هفته‌ها زمان می‌برد، اکنون در مدت زمان کمتر از دو روز قابل دستیابی است، که تاثیر قابل توجهی بر کارایی و سرعت تصمیم‌گیری‌های استراتژیک دارد.

در مجموع، این رویکرد نه تنها فرآیندهای داده‌ای را تسهیل می‌کند، بلکه باعث افزایش دقت، کاهش خطاها و بهبود کارایی عملیاتی می‌شود. Uber با بهره‌گیری از لایه انتزاع داده، آینده‌ای پر از نوآوری و پاسخگویی سریع به نیازهای بازار را ترسیم کرده است که می‌تواند الگوی موفقی برای دیگر شرکت‌ها در حوزه فناوری و داده باشد.

#مدیریت_داده #یکپارچه_سازی_داده #تحلیل_در_زمان_واقعی #فناوری

🟣لینک مقاله:
https://www.uber.com/us/en/blog/data-abstraction-layer/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
I spent 10 hours vibe-coding a tool to visualize any Parquet file's internals (2 minute read)

🟢 خلاصه مقاله:
در دوی ساعت گذشته، من به مدت ۱۰ ساعت صرف برنامه‌نویسی و توسعه ابزاری در مرورگر کردم که قادر است ساختار داخلی هر فایل پارکت را به وضوح نشان دهد. این ابزار کوچک با استفاده از زبان برنامه‌نویسی Rust و کتابخانه‌ی arrow-rs طراحی شده است و وظیفه آن تحلیل و نمایش جزئیات فایل‌های پارکت است که معمولاً پنهان می‌مانند.

این ابزار قادر است بخش‌های مختلف فایل، مانند گروه‌های ردیفی، تکه‌های ستون‌ها، صفحات، اسکیم‌ها، کدگذاری‌ها، فیلترهای بلوم، اندازه‌ها، و آمار حداقل و حداکثر را به صورت گرافیکی و قابل فهم نمایش دهد. به این ترتیب، توسعه‌دهندگان، دانش‌اموزان و محققان می‌توانند با استفاده از این ابزار، درک بهتری نسبت به جزئیات فایل‌های ستونی پیدا کنند که نقش مهمی در بهبود فرآیندهای تحلیل داده و اشکال‌زدایی ایفا می‌کند.

این ابزار نه تنها برای آموزش مفید است بلکه در فرآیندهای اشکال‌زدایی و بهینه‌سازی فایل‌های پارکت، کمک قابل توجهی می‌کند. در واقع، این پروژه نشان می‌دهد چطور می‌توان با بهره‌گیری از فناوری‌های مدرن و زبان‌های برنامه‌نویسی قدرتمند، ابزارهای کارآمدی ساخته و دانش فنی خود را توسعه داد.

#تحلیل_فایل_پارتک #برنامه‌نویسی #دیتا_فناوری #ابزارهای_دیجیتال

🟣لینک مقاله:
https://vutr.substack.com/p/i-spent-10-hours-vibe-coding-a-tool?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Postgres 19: How Our Advice Has Changed Since We Wrote It (16 minute read)

🟢 خلاصه مقاله:
در نسخه‌ی جدید پستگرس ۱۹، تغییرات عمده‌ای صورت نگرفته است، بلکه بیشتر بر تقویت روش‌های اثبات‌شده گذشته تمرکز شده است. این نسخه با توسعه فناوری I/O غیرهمزمان و افزودن قابلیت‌های خودکار در مقیاس‌پذیری، عملکرد سیستم‌های پایگاه داده را بهبود می‌بخشد. علاوه‌بر این، امکاناتی مانند نسخه‌پذیری قوی‌تر عملیات COPY، استفاده پیش‌فرض از فشرده‌سازی LZ4، بهبود در سیستم‌های ایندکس‌گذاری و مدیریت راحت‌تر بخش‌بندی‌ها، از جمله ویژگی‌های برجسته آن هستند. نکات کلیدی در طراحی و نگهداری پایگاه داده هنوز هم همان اصول اولیه باقی‌مانده است: بهره‌گیری از دستور COPY برای بارگذاری داده‌های انبوه، مدل‌سازی داده‌های پرترافیک به صورت ساختاری، انتخاب هوشمندانه ایندکس‌ها و استفاده از بخش‌بندی بیشتر برای مدیریت چرخه عمر داده‌ها. این تحولات، کمک می‌کنند تا توسعه‌دهندگان و مدیران پایگاه داده بتوانند بهتر و کارآمدتر روی پروژه‌های خود کار کنند، بدون اینکه نیاز به تغییر بنیادین در استراتژی‌های خود باشد.

#پستگرس #پایگاه_داده #مدیریت_داده #توسعه_نرم‌افزار

🟣لینک مقاله:
https://www.crunchydata.com/blog/postgres-19-how-our-advice-has-changed-since-we-wrote-it?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
We will ship the first Polars 2.0 release candidate next week (1 minute read)

🟢 خلاصه مقاله:
ما هفته آینده اولین نسخه آزمایشی رسمی از نرم‌افزار Polars 2.0 را منتشر خواهیم کرد. این نسخه که به عنوان "کاندیدا" شناخته می‌شود، مرحله‌ای مهم در فرآیند توسعه است، زیرا نشانگر آمادگی این نسخه برای عرضه نهایی است و فرصت خوبی است برای کاربران و توسعه‌دهندگان تا بازخوردهای خود را ارائه دهند و مشکلات احتمالی را شناسایی کنند.

نسخه 2.0 از Polars در حال حاضر در مراحل نهایی قرار دارد و تیم توسعه کاملاً بر روی اصلاح نقاط ضعف و بهبود عملکرد آن تمرکز کرده است. این نسخه شامل ویژگی‌های جدید و بهبودهای قابل توجهی است که هدفشان بهبود کارایی و سهولت استفاده است. انتظار می‌رود با انتشار این نسخه، کاربران تجربه کاربری بهتر و ابزارهای قدرتمندتری در اختیار داشته باشند، که این امر می‌تواند تاثیر قابل توجهی در پروژه‌های داده‌کاوی و آنالیزهای حجیم داشته باشد.

با نزدیک شدن به تاریخ انتشار، تیم توسعه فعالانه در حال جمع‌آوری بازخوردها و رفع خطاهای احتمالی است تا نسخه نهایی با بهترین کیفیت ممکن ارائه شود. این مرحله اهمیت ویژه‌ای دارد، چرا که نتیجه نهایی باید تمام نیازها و انتظارات کاربران را برآورده کند و تجربه کاری رضایت‌بخش را فراهم آورد.

پیش‌بینی می‌شود با عرضه نسخه آزمایشی، جامعه کاربری و توسعه‌دهندگان به همکاری بیشتر تشویق شوند و نظرات ارزشمندی درباره نهایی‌سازی ویژگی‌ها ارائه دهند. این تعامل مستقیم کمک می‌کند تا Polars 2.0 نه تنها یک به‌روزرسانی کوچک بلکه یک تغییر اساسی در امکانات و کارایی باشد.

منتظر باشید، چرا که هفته آینده با انتشار این نسخه آزمایشی، تحولات جدید در انتظار شماست و بهبودهای چشمگیر در انتظار پروژه‌های داده‌کاوی شما قرار دارد.

#پولارس #نسخه۲٫۰ #داده‌کاوی #توسعه

🟣لینک مقاله:
https://threadreaderapp.com/thread/2089338347286093851.html?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Spark Tips. Partition Tuning (12 minute read)

🟢 خلاصه مقاله:
در تنظیم اندازه‌ بخش‌های اسپارک، هدف اصلی بهینه‌سازی بهره‌وری و پایداری سیستم است. باید تلاش کنیم تعداد بخش‌ها به قدری باشد که بتوانیم از تمام هسته‌های موجود بهره‌برداری کنیم، بدون اینکه وظایف بسیار کوچک ایجاد کنیم که زمان پردازش را افزایش می‌دهد. بهتر است عملیات فیلتر را در مراحل اولیه انجام دهیم تا حجم داده‌هایی که باید منتقل و پردازش شوند کاهش یابد. همچنین، نباید بر داده‌های غیرضروری shuffle انجام دهیم و در مواقعی که ساختار فعلی داده‌ها مناسب نیست، مجدداً بخش‌بندی داده‌ها را برای بهتر شدن عملیات‌های join یا نوشتن انجام دهیم.

در راهنمای عملی، نکاتی مانند قابلیت خودکار بهینه‌سازی کیفیت اطلاعات (AQE)، مشکلات ناشی از توزیع نابرابر داده‌ها (Skew)، مشکلات مربوط به spilling و استفاده از نقاط کنترل (checkpoint barriers) مورد بحث قرار می‌گیرند. علاوه بر این، توازن میان فایل‌های کوچک و بزرگ نیز اهمیت دارد و نیاز است تا با توجه به نوع داده‌ها و عملیات، تنظیمات بهینه را اعمال کنیم. رعایت این موارد به بهبود عملکرد و کاهش مشکلات سیستم کمک می‌کند و به ما اجازه می‌دهد تا منابع را بهتر مدیریت کنیم.

#اسپارک #بهینه‌سازی #پایداریداده #توزیع داده‌ها

🟣لینک مقاله:
https://luminousmen.substack.com/p/spark-tips-partition-tuning?utm_source=tldrdata


👑 @Database_Academy
Forwarded from Job
💼 به دنبال استخدام برنامه‌نویس هستید؟ یا به دنبال فرصت شغلی مناسب می‌گردید؟

🟢 کارفرمایان:
اگر به دنبال جذب برنامه‌نویس هستید، آگهی استخدام خود را برای ما ارسال کنید تا منتشر شود.

🟢 کارجویان:
اگر به دنبال فرصت شغلی هستید، رزومه خود را برای ما ارسال کنید تا در صورت وجود موقعیت مناسب، به شرکت‌ها و کارفرمایان معرفی شوید. 🚀

👤 ادمین:
@mrbardia72

📄 لطفاً موارد زیر را به همراه فایل PDF رزومه ارسال کنید:

نام و نام خانوادگی (اجباری)
سابقه کار (اجباری)
محل سکونت (اجباری)
امکان نقل مکان برای کار (اجباری)
🔹 لینک LinkedIn (اختیاری)
🔹 لینک GitHub (اختیاری)
چند روز پیش ی پست گذاشتم راجع به DuckDB و اینکه میشه دیتای با حجم چند ۱۰ گیگ را راحت روی یک لپتاپ لود کرد و استفاده کرد. الان نیاز داشتم چندین گیگابایت دیگه هم بهش دیتا اضافه کنم. کل تعداد رکوردها رسید ۲۷۰,۱۶۰,۰۱۱ میلیون رکورد. و فایل دیتابیس شد ۱۴.۵ گیگ. ولی سرعت همچنان فوق العاده بالاست. دموی پایین:
ارزونترین پلن Snowflake ماهی حدود ۱۰۰۰ دلار بود. خلاصه اینکه از این DuckDB و حتا sqlite (بسته به کاربردی که نیاز دارید) غافل نشید.

@<Mehdi Allahyari/>
وقتی جدول دیتابیس میلیاردها سطر داره، چطور فقط همون تکه‌ای رو بخونیم که به کارمون میاد؟


دیتابیس که بزرگ میشه، فقط ایندکس کافی نیست. گاهی باید خودِ جدول رو تکه‌تکه کنیم تا موتور بتونه بخش‌های نامربوط رو کلاً نادیده بگیره. به این می‌گن پارتیشن‌بندی.

توی این صفحه، چهار روش اصلی پارتیشن‌بندی RANGE، LIST، HASH و KEY رو بررسی کردم و تفاوت Partitioning با Sharding رو توضیح دادم.

همچنین با یک مثال، الگوی Sliding Window رو بررسی کردم که چطور میشه بدون انجام DELETE های سنگین، داده‌های قدیمی رو آرشیو کرد. در نهایت هم تفاوت پیاده‌سازی این مفاهیم در SQL Server و MySQL رو بررسی کردم.

اگه براتون مفید بود، خوشحال میشم یه ستاره بهش بدین.

https://alireza-haeri.github.io/BackendDeepDives/DataPartitioning.html

@| <AliReza Haeri/>
🙏2
🔵 عنوان مقاله
Semi-Structured Data in Apache Iceberg: Meet the Variant Type (3 minute read)

🟢 خلاصه مقاله:
در نسخه سوم Apache Iceberg، نوع جدیدی به نام «نوع متغیر» یا «Variant» معرفی شد که برای مدیریت داده‌های نیمه‌ساختاری طراحی شده است. این نوع به کاربران اجازه می‌دهد رکوردهای شبیه به JSON، که ممکن است به سرعت تغییر کنند، در یک ستون واحد ذخیره شوند و در عین حال نوع‌های اصلی مانند تایم‌استمپ‌ها، اعداد اعشاری، و مقادیر باینری حفظ شوند.

این نوع مبتنی بر کدگذاری باینری پارکت است و با اکثر سیستم‌های پردازش داده مانند Spark و Flink سازگار است. از طریق SQL در Spark، می‌توانید به راحتی این نوع داده‌ها را با تابع variant_get فراخوانی و مورد استفاده قرار دهید. این قابلیت، انعطاف‌پذیری و کارایی در مدیریت داده‌های نیمه‌ساختاری را به جداسازی و تحلیل داده‌ها بیشتر کرده است.

در نتیجه، معرفی نوع «متغیر» در Iceberg، راهکاری مدرن و عملی برای کار با داده‌های ناهمگون و دینامیک است که هم سازگاری با ابزارهای محبوب را فراهم می‌کند و هم امکان استخراج و تحلیل داده‌های پیچیده‌تر را برای توسعه‌دهندگان و تحلیل‌گران داده آسان‌تر می‌سازد.

#داده_نیمه‌ساختاری #ApacheIceberg #پایگاه_داده #تحلیل_داده

🟣لینک مقاله:
https://iceberg.apache.org/blog/variant-in-apache-iceberg/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
(Re)Building a FAQ System for DataTalks.Club (12 minute read)

🟢 خلاصه مقاله:
در دنیای امروز، پاسخگویی سریع و دقیق به سوالات کاربران اهمیت زیادی دارد، به همین دلیل شرکت DataTalks.Club تصمیم گرفت سیستم پرسش و پاسخ خود را مجدداً بازطراحی کند. در این پروژه، تیم توسعه بر ساخت یک ربات FAQ مبتنی بر منابع متنوع تمرکز کرد. این منابع شامل مشکلات و دستورالعمل‌های مختص به پروژه در GitHub، بحث‌های موجود در Slack، و واژگان و گفتگوی‌های ضبط شده در ویدئوهای YouTube بودند. هدف از این کار ایجاد یک پایگاه داده غنی و قابل اعتماد بود که بتواند پاسخ‌های صحیح و به‌موقع را در اختیار کاربران قرار دهد.

در این فرآیند، تیم تلاش کرد تا طراحی سیستم به گونه‌ای باشد که بدون نیاز به ساخت سرورهای مستقل، به راحتی در محیط‌های Serverless مانند AWS Lambda اجرا شود. این رویکرد نه تنها هزینه‌ها را کاهش می‌دهد بلکه نگهداری و توسعه را نیز ساده‌تر می‌کند. با این حال، برای اطمینان از کیفیت پاسخ‌ها، توجه خاصی به برچسب‌گذاری مناسب، مدیریت دسته‌های بررسی، و مکاشفه‌های هزینه‌بر مربوط به صحت پاسخ‌ها در نظر گرفته شد. به ویژه، بررسی دقیق مواردی که ممکن است منجر به رد نادرست یا بسته شدن زودهنگام گفتگوها شوند، اهمیت زیادی داشت.

در نتیجه، این پروژه یادآوری مهمی است که کیفیت سیستم‌های پاسخگویی مبتنی بر اطلاعات باید از همان ابتدا با نگهداری منظم و دقیق داده‌ها تضمین شود. اگر داده‌ها خام و ناپایدار باشند، حتی بهترین الگوریتم‌ها هم نمی‌توانند جواب‌های مفید و مطمئن ارائه دهند. بنابراین، تمرکز بر مدیریت و بروزرسانی مداوم منبع داده‌ها، کلید موفقیت در توسعه سیستم‌های یادگیری و بازیابی اطلاعات است.

#هوش_مصنوعی #سیستم‌های_پاسخگو #یادگیری_ماشین #توسعه_پایگاه_داده

🟣لینک مقاله:
https://alexeyondata.substack.com/p/rebuilding-a-faq-system-for-datatalksclub?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Zero-sum by design: 10 years of Uber's payments platform (8 minute read)

🟢 خلاصه مقاله:
در دهه اخیر، پلتفرم پرداخت‌های اوبر، Gulfstream، به عنوان یکی از مهم‌ترین و پرکاربردترین زیرساخت‌های مالی این شرکت تبدیل شده است. این سیستم در حال حاضر توانایی پشتیبانی از بیش از ۲۱۷ میلیارد دلار در معاملات ناخالص سالانه را دارد که تقریباً دو برابر ارزش جابجایی‌های مالی در خود پلتفرم است. این رقم نشان‌دهنده کاربرد گسترده و اهمیت فوق‌العاده سیستم در عملیات‌های روزمره اوبر است. علاوه بر این، با بهره‌گیری از فناوری‌های پیشرفته، مجموعه‌ای از تعادل‌های حساب‌ررسی برای بیش از ۱.۲ میلیارد حساب فعال در پلتفرم مدیریت می‌شود، که نیاز به دقت و امنیت بالا در ثبت و جابجایی مالی دارد.

در طراحی این سیستم، از سفارشات مالی با ذات ثابت و بدون تغییر، بهره‌برداری می‌شود که بر اساس مفهوم حسابداری دوطرفه ساخته شده است. این رویکرد اطمینان می‌دهد که هر تراکنش، به صورت کاملاً شفاف و قابل رهگیری ثبت می‌شود و در صورت نیاز، می‌توان تاریخچه کامل تمامی جابجایی‌ها را بررسی کرد. همچنین، داده‌ها در بانک اطلاعاتی DynamoDB نگهداری می‌شوند که امکان دسترسی سریع و مقیاس‌پذیری بالا را فراهم می‌کند.

برای انتقال داده‌ها و مدیریت فرآیندهای در لحظه، از فناوری Kafka بهره گرفته شده است که جریان‌های داده‌ای را به صورت پیوسته و کارا مدیریت می‌کند. سیستم Cadence نیز نقش مهمی در تنظیم فرآیندهای هم‌زمان و هماهنگ ایفا می‌کند، که در عملیات‌هایی مانند تایید تراکنش و هماهنگی اطلاعات، موثر است. در کنار این موارد، این پلتفرم از رابط‌های عمومی و چندمنظوره برای ابزارهای پرداخت بهره می‌برد؛ این امر اجازه می‌دهد خطوط جدید کسب‌وکار به سرعت و با کم‌ترین تغییرات در هسته سیستم راه‌اندازی شوند، و انعطاف‌پذیری بالایی در توسعه و انطباق با نیازهای آینده فراهم گردد.

در مجموع، اوبر با طراحی منحصربه‌فرد و استفاده از فناوری‌های نوین، بستر مطمئنی برای انجام تراکنش‌های مالی گسترده و قابل اطمینان ساخته است که توانسته بخش عمده‌ای از نیازهای مالی خود را به شکلی امن و مؤثر برآورده سازد.

#پرداخت #فناوری #تراکنش_مالی #اوبر

🟣لینک مقاله:
https://www.uber.com/us/en/blog/ubers-payments-platform/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Automatic Apache Kafka migrations with Orbit (17 minute read)

🟢 خلاصه مقاله:
در دنیای امروز، مدیریت انتقال داده‌ها و ارتقاء زیرساخت‌های فناوری اطلاعات اهمیت زیادی دارد. یکی از چالش‌های بزرگ در این زمینه، مهاجرت امن و بدون خطا به سیستم‌های جدید است که نیازمند برنامه‌ریزی دقیق و نظارت دائم است. WarpStream با ارائه ابزار Orbit، فرآیند مهاجرت به Apache Kafka را به شکل خودکار و هوشمندانه طراحی کرده است، به طوری که تیم‌های فنی می‌توانند انتقال کلسترها را با سرعت بیشتری انجام دهند بدون اینکه به طور ضمنی باعث اختلال در عملکرد تولیدکنندگان، مصرف‌کنندگان، یا تنظیمات Offset و ترتیب پیام‌ها شوند. این سیستم با فراهم آوردن چک‌های پیشرفته، اطمینان حاصل می‌کند که تمامی جوانب مهم در حین مهاجرت رعایت شده و در نتیجه فرآیند انتقال بی‌درنگ و مطمئن انجام می‌شود.

در نتیجه، استفاده از Orbit نه تنها به کاهش زمان مورد نیاز برای مهاجرت کمک می‌کند، بلکه خطر خطاهای انسانی و ناپایداری سیستم را نیز کاهش می‌دهد، و در نهایت، کاربران از یک انتقال نرم و بی‌وقفه بهره‌مند می‌شوند. این راهکار، ترکیبی از اتوماسیون و اطمینان‌پذیری است که به تیم‌های فناوری اطلاعات اجازه می‌دهد بدون نگرانی از خرابی‌های ناشی از انتقال، تمرکز بیشتری بر روی توسعه و بهبود استراتژی‌های خود داشته باشند.

#مهاجرت_خودکار #ApacheKafka #مدیریت_پایگاه_داده #امنیت_سیستم

🟣لینک مقاله:
https://www.warpstream.com/blog/orbit-kafka-auto-migration?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
How we knew COVID was over (and what our models had to unlearn) (11 minute read)

🟢 خلاصه مقاله:
وقتی شیوع کرونا پشت سر گذاشته شد، تیم پیش‌بینی Airbnb باید به سرعت با تغییرات جدید سازگار شود و ساختارهای کسب‌وکار را مجدد ارزیابی کند. این فرآیند تنها به معنای آموزش مجدد مدل‌ها نبود، بلکه نیاز داشتند تفاوت‌های اساسی و تغییرات ساختاری را از نوسانات جزئی جدا کنند. در دوران اوج کووید، الگوهای تقاضا به شدت دچار نوسان شده بودند، اما پس از گذشت این دوره، تشخیص این که چه تغییراتی واقعی و پایدار هستند و چه صرفاً موقتی هستند، ضروری بود. تیم به جای صرفاً بروزرسانی بی‌وقفه مدل‌ها، تصمیم گرفتند که در مورد مدل‌های خود تجدید نظر کنند و گزینه‌هایی مانند بازتعیین پارامترها، اصلاح ساختار مدل یا نگه‌داشتن وضعیت موجود را ارزیابی کنند. این استراتژی‌ها اجازه داد که مدل‌های عملیاتی شرکت در مواجهه با تغییرات اساسی بهتر عمل کنند و عملکرد قابل اعتماد خود را حفظ کنند.

در نتیجه، Airbnb توانست مدلی عملیاتی برای پیش‌بینی‌های بلندمدت و در عین حال مقاوم در برابر تغییرات ساختاری توسعه دهد. این مدل توانست در مواجهه با تغییرات ناگهانی و دوره‌ای، عملکرد موثری داشته باشد و اقتصاد شرکت را در زمان‌های بحرانی حفظ کند. رویکرد این تیم نمونه‌ای ارزشمند است که نشان می‌دهد تلاش برای تفکیک نوسانات زمانی کوتاه از تغییرات ساختاری، کلید اصلی در نگهداری و به‌روزرسانی مدل‌های پیش‌بینی در دوره‌های تغییر است.

#مدل_سازی #پیش‌بینی #تغییرات_ساختاری #هوش_مصنوعی

🟣لینک مقاله:
https://airbnb.tech/ai-ml/how-we-knew-covid-was-over-and-what-our-models-had-to-unlearn/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Using Models to Create Models of New York City (20 minute read)

🟢 خلاصه مقاله:
در این مقاله، پتر سوبوت با بهره‌گیری از بیش از هزار تصویر، تکنولوژی Claude و روش Gaussian Splatting، توانست مدلی سه‌بعدی از آسمان‌خراش‌ها و چشم‌انداز نئون‌های شهر نیویورک بسازد. این پروژه عظیم شامل اجرای بیش از ۷۴ زیرنقشه و حدود ۲۸۰ آزمایش مختلف بود که نشان داد هوش مصنوعی قادر است بخش قابل توجهی از فرآیند فنی ساختن مدل‌های دقیق را بر عهده گیرد. با این حال، هنوز در بخش‌هایی مانند قضاوت بصری، پردازش داده‌های نامنظم و تعیین زمانی که نتیجه واقعا رضایت‌بخش است، با چالش‌هایی مواجه است.

پتر سوبوت برای این پروژه، با استفاده از فناوری‌های پیشرفته و الگوریتم‌های هوشمند، توانسته است یک نمونه اولیه از شهر نیویورک بسازد که در آن جزئیات و ابعاد شهری به شکل واقعی و قابل تنظیم بازسازی شده‌اند. اما علی‌رغم پیشرفت‌های قابل توجه، این فناوری هنوز نیازمند انسانی است تا بتواند زیبایی، هماهنگی و اصالت بصری را در نتایج تشخیص دهد و تصمیم‌گیری کند.

در مجموع، این پروژه نشان می‌دهد که هوش مصنوعی در کنار فناوری‌های نوین می‌تواند ابزار قدرتمندی برای مدل‌سازی و بازسازی فضاهای شهری باشد، اما هنوز نیاز دارد که بخش‌هایی از قبیل سلیقه human و تطابق با واقعیت‌های پیچیده، توسط انسان‌ها نظارت و هدایت شود. آینده این حوزه به همکاری متعادل میان فناوری و هنر وابسته است، جایی که هر دو با هم، شهرهای خیالی و واقعی را به بهترین شکل شکل می‌دهند.

#مدلسازی_3بعدی #هوش_مصنوعی #نیویورک #تکنولوژی

🟣لینک مقاله:
https://petersobot.com/blog/using-models-to-create-models-of-new-york-city/?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
A tale of two Flink autoscalers (7 minute read)

🟢 خلاصه مقاله:
در دنیای مدیریت اجرایی برنامه‌های داده‌ای، سیستم‌های خودکار اسکیلینگ نقش حیاتی دارند، و در این عرصه، Netflix تصمیم گرفته است تا بیش از ۳۰ هزار وظیفه‌ فراگیرش را از سیستم‌های داخلی خود که به صورت سفارشی توسعه یافته بودند به سمت سیستم اسکیلینگ اتوماتیک مبتنی بر پروژه Apache Flink سوق دهد. این تغییر استراتژیک نشان دهنده اهمیت بهره‌گیری از فناوری‌های متن‌باز و ابزارهای تخصصی در تحقق بهینگی و بهره‌وری بیشتر در مدیریت منابع است.

سیستم قدیمی که Netflix استفاده می‌کرد، بر اساس شاخص‌های میزان مصرف منابع در داخل هر کلاستر، کل کلاستر را به طور کامل در صورت نیاز اسکیل می‌کرد. این روش توانسته بود تا ۲۵ تا ۴۵ درصد در مصرف منابع صرفه‌جویی کند، اما در کنار این مزیت، همچنان معایبی هم داشت. به عنوان نمونه، این سیستم قادر نبود سطح عملیات خاص و وضعیت داخلی اپراتورها را در نظر بگیرد، بنابراین در مدیریت بهتر و دقیق‌تر منابع محدودیت‌هایی داشت. همچنین، نقص در جمع‌آوری داده‌های telemetry و کمبود در ارائه دید جامع، منجر به کاهش کارایی کامل آن می‌شد و باعث می‌شد نتواند به بهترین شکل نیازهای در حال تغییر سیستم‌های اجرایی را برآورده کند.

در مقابل، نسخه جدید اسکیلر متن‌باز Apache Flink، بر مبنای تحلیل وضعیت هر وظیفه به صورت جداگانه عمل می‌کند. این سیستم قادر است تا بر رفتارهای داخلی هر وظیفه بر پایه داده‌های زمان واقعی نظارت کرده و تصمیم‌گیری‌های هوشمندانه‌تری انجام دهد. نتیجه این رویکرد، صرفه‌جویی قابل توجه در مصرف منابع است؛ به طوری که برای یکی از تیم‌ها، این سیستم به طور سالانه ۵۸ درصد در هزینه‌های محاسباتی صرفه‌جویی ایجاد کرده است. این دستاورد نشان‌دهنده اهمیت و تاثیر فناوری‌های متن‌باز در بهبود کارایی سیستم‌های بزرگ مقیاس است.

در نهایت، این تحولات نشان می‌دهند که انتقال به سیستم‌های متن‌باز و هوشمند، نه تنها از نظر صرفه‌جویی اقتصادی بلکه از منظر بهبود عملکرد و کنترل دقیق‌تر منابع، گامی مثبت و ضروری در مسیر توسعه فناوری‌های داده‌محور است.

#هوشمندسازی #فناوری_متن_باز #صرفه‌جویی_درمنابع #پیشرفت_تکنولوژی

🟣لینک مقاله:
https://netflixtechblog.com/a-tale-of-two-flink-autoscalers-e9f6a1b1492b?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
TrueFoundry open-sources TrueForge, an enterprise AI agent harness (8 minute read)

🟢 خلاصه مقاله:
در عرصه توسعه هوش مصنوعی، ابزارهای قدرتمند و کارآمد نقش کلیدی در بهبود فرآیندها و کاهش هزینه‌ها دارند. یکی از این ابزارها، TrueForge است که توسط TrueFoundry ارائه شده و در قالب یک «هِرانس» (نماینده خودکار) قابل میزبانی است. این ابزار با هدف کاهش هزینه‌های مربوط به انجام وظایف، امکاناتی مانند فشرده‌سازی اطلاعات، بارگذاری تأخیری اسکیم‌های ابزار (tool-schema)، ایجاد زیرنمایندگان (subagents) و اجرای sandbox به عنوان یک ابزار عملیاتی را ارائه می‌دهد. این ویژگی‌ها به تیم‌های داده‌ای کمک می‌کند تا به صورت بهینه‌تر وظایف خود را مدیریت و انجام دهند.

در عمل، TrueForge به تیم‌های داده و توسعه این امکان را می‌دهد که بدون وابستگی کامل به یک مدل خاص، فرآیندهای اورکستراسیون را کنترل کنند. این یعنی، تیم‌ها می‌توانند به راحتی بین مدل‌ها جابه‌جا شده و تنظیمات امنیتی، دسترسی‌ها و نظارت‌ها را مستقل از انتخاب مدل مدیریت کنند. ویژگی‌هایی مانند تنظیمات هویت، کنترل دسترسی و نظارت بر فعالیت‌ها، در کنار مدیریت بودجه، به این ابزار قدرتی بی‌نظیر می‌بخشد که خصوصاً برای تیم‌هایی که در حال آزمایش و توسعه مدل‌های عمومی یا خصوصی هستند، بسیار مفید است.

در نهایت، Open-sourcing بودن TrueForge نشان می‌دهد که این پروژه در دسترس عموم قرار گرفته است و توسعه‌دهندگان می‌توانند آن را برای نیازهای خاص خود سفارشی و بهبود بخشند. این حرکت، زمینه‌ساز همکاری‌های بیشتر در اکوسیستم هوش مصنوعی شده و به تیم‌های داده کمک می‌کند تا با بهره‌گیری از فناوری‌های متن‌باز، راهکارهای ایمن، موثرتری برای مدیریت و اجرای عملیات هوشمند داشته باشند.

#هوش_مصنوعی #توسعه_هوشمند #ابزارهای_هوش_مصنوعی #فناوری_باز

🟣لینک مقاله:
https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
Not every problem needs an AI agent (5 minute read)

🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات، بسیاری تصور می‌کنند که هر مشکل پیچیده‌ای باید با کمک هوش مصنوعی حل شود. اما واقعیت این است که سیستم‌های هوش مصنوعی تولیدی زمانی بهترین عملکرد را دارند که هر بخش از سیستم، وظایف خود را با تناسب مناسب و بهینه انجام دهد. برای مثال، سیستم‌های پیشنهاددهی، مدیریت محتوا، جستجوهای بزرگ دیتابیسی و فرآیندهای شروع سرد (cold start) نیازمند ترکیبی هوشمندانه از منطق قطعی، یادگیری ماشین کلاسیک، لایه‌های معنایی و تکنولوژی‌های مبتنی بر مدل‌های زبانی بزرگ (LLMs) هستند. استفاده از هر کدام از این ابزارها بسته به نیاز، باید به شکل متعادل و هوشمندانه صورت گیرد، چرا که بهره‌وری بهتر در نتیجه، در این تعادل نهفته است.

در این میان، بهترین الگو غالباً رویکرد ترکیبی است: ما می‌توانیم از عوامل هوشمند برای استنتاج و استدلال بهره‌مند شویم، ولی در عین حال، منطق تجاری، معیارهای ارزیابی، مسیریابی داده‌ها و محدودیت‌های ایمنی، بهتر است در قالب منطق قطعی و قابل پیش‌بینی باقی بمانند. این رویکرد، مزیت‌های هر دو حوزه را با هم تلفیق می‌کند و سیستم را هم چالش‌برانگیز و پیچیده نمی‌سازد و هم از خطاهای احتمالی کاسته می‌شود.

در نتیجه، بهترین استراتژی در توسعه سیستم‌های هوشمند، ترکیبی هوشمندانه و متوازن است که در آن از قدرت استنتاجی هوش مصنوعی بهره‌مند می‌شویم، ولی در عین حال، اصول و قوانینی که باید همواره ثابت و قابل اعتماد باقی بمانند، در قالب منطق قطعی حفظ می‌شوند. این تعادل، باعث می‌شود که سیستم‌های ما هم قدرتمند، هم قابل کنترل و هم امن باشند، و در کنار این، بهره‌وری و کارایی بیشتری داشته باشند.

#هوش_مصنوعی #سیستم_یکپارچه #یادگیری_ماشین #تکنولوژی

🟣لینک مقاله:
https://www.cio.com/article/4210687/not-every-problem-needs-an-ai-agent.html?utm_source=tldrdata


👑 @Database_Academy
🔵 عنوان مقاله
DuckDB v2.0: Your database deserves a better parser (9 minute read)

🟢 خلاصه مقاله:
نسخه جدید DuckDB، یعنی نسخه ۲.۰، تغییرات بزرگی در ساختار پارسر SQL این پایگاه داده ایجاد کرده است. در این نسخه، به جای استفاده از پارسر مبتنی بر PostgreSQL که در نسخه‌های قبلی به کار می‌رفت، از یک پارسر مبتنی بر فناوری PEG (Parsing Expression Grammar) استفاده شده است. این تغییر مهم باعث می‌شود که فرآیند تفسیر دستورات SQL سریع‌تر و مطمئن‌تر انجام شود، زیرا این نوع پارسر مشکلاتی مانند تعارض‌های مربوط به ابزار Bison را برطرف می‌کند و از پس‌زمینه‌های ناخواسته در حین پردازش ورودی‌های نادرست جلوگیری می‌کند.

با این تحول، سیستم دیگر در مواجهه با ورودی‌های خراب یا دستورات نادرست دچار مشکل نمی‌شود و قابلیت افزودن قوانین جدید در زمان اجرا را نیز دارد. این امر امکان توسعه و افزودن نحو (Syntax) جدید بدون نیاز به بازنویسی کامل پارسر SQL را فراهم می‌کند، که در نسخه‌های قبلی ممکن بود منجر به اصلاحات پیچیده و زمان‌بر شود. نتیجه نهایی، برتری در قدرت، انعطاف‌پذیری و ثبات DuckDB است که توجه هر توسعه‌دهنده و کاربر پایگاه داده را جلب می‌کند.

در مجموع، این به‌روزرسانی نشان می‌دهد که تیم توسعه DuckDB با استفاده از فناوری‌های نوین، قصد دارد بهبودهای چشمگیری در تجربه کاربری و قابلیت‌های فنی ارایه دهد و جایگاهی قوی‌تر در عرصه پایگاه‌های داده داشته باشد.

#DuckDB #پایگاه_داده #توسعه_نرم‌افزار #پارساز

🟣لینک مقاله:
https://duckdb.org/2026/08/20/duckdb-20-peg-parser.html?utm_source=tldrdata


👑 @Database_Academy