🔵 عنوان مقاله
Simplifying data and product integrations with a data abstraction layer (8 minute read)
🟢 خلاصه مقاله:
در دنیای پرسرعت امروزی، یکپارچهسازی دادهها و محصولات یکی از چالشهای مهم شرکتها است. Uber توانسته است با بهرهگیری از یک لایه انتزاع داده (Data Abstraction Layer) راهحلی کارآمد و انعطافپذیر ارائه دهد که فرآیندهای مربوط به ادغام دادهها را بسیار سادهتر و سریعتر میکند. این فناوری، اتصال میان محصولات و دادههای مختلف را از قید و بند تغییرات در جداول فیزیکی، ساختارهای اطلاعاتی و زیرساختهای پشتیبانی آزاد میسازد و امکان توسعه و بهروزرسانی سریعتر سیستمها را فراهم میآورد.
در این روش، لایه انتزاع دادهها شامل جداول منطقی است که به صورت مجازی ایجاد شده و به کمک API خاص FetchData، قادر است درخواستهای متعدد را به طور همزمان و کارآمد از منابع مختلف مانند جداول لحظهای و روزانه، مخازن OLAP، دیتاستور، داکاستور و هایو پردازش کند. این ساختار، سوای اینکه نیاز به تغییرات مکرر در ساختارهای فیزیکی باشد، امکان جمعآوری و تحلیل دادههای متنوع را فراهم میآورد. به عنوان مثال، دادههای مربوط به گزارشگری تبلیغاتی، که پیشتر هفتهها زمان میبرد، اکنون در مدت زمان کمتر از دو روز قابل دستیابی است، که تاثیر قابل توجهی بر کارایی و سرعت تصمیمگیریهای استراتژیک دارد.
در مجموع، این رویکرد نه تنها فرآیندهای دادهای را تسهیل میکند، بلکه باعث افزایش دقت، کاهش خطاها و بهبود کارایی عملیاتی میشود. Uber با بهرهگیری از لایه انتزاع داده، آیندهای پر از نوآوری و پاسخگویی سریع به نیازهای بازار را ترسیم کرده است که میتواند الگوی موفقی برای دیگر شرکتها در حوزه فناوری و داده باشد.
#مدیریت_داده #یکپارچه_سازی_داده #تحلیل_در_زمان_واقعی #فناوری
🟣لینک مقاله:
https://www.uber.com/us/en/blog/data-abstraction-layer/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Simplifying data and product integrations with a data abstraction layer (8 minute read)
🟢 خلاصه مقاله:
در دنیای پرسرعت امروزی، یکپارچهسازی دادهها و محصولات یکی از چالشهای مهم شرکتها است. Uber توانسته است با بهرهگیری از یک لایه انتزاع داده (Data Abstraction Layer) راهحلی کارآمد و انعطافپذیر ارائه دهد که فرآیندهای مربوط به ادغام دادهها را بسیار سادهتر و سریعتر میکند. این فناوری، اتصال میان محصولات و دادههای مختلف را از قید و بند تغییرات در جداول فیزیکی، ساختارهای اطلاعاتی و زیرساختهای پشتیبانی آزاد میسازد و امکان توسعه و بهروزرسانی سریعتر سیستمها را فراهم میآورد.
در این روش، لایه انتزاع دادهها شامل جداول منطقی است که به صورت مجازی ایجاد شده و به کمک API خاص FetchData، قادر است درخواستهای متعدد را به طور همزمان و کارآمد از منابع مختلف مانند جداول لحظهای و روزانه، مخازن OLAP، دیتاستور، داکاستور و هایو پردازش کند. این ساختار، سوای اینکه نیاز به تغییرات مکرر در ساختارهای فیزیکی باشد، امکان جمعآوری و تحلیل دادههای متنوع را فراهم میآورد. به عنوان مثال، دادههای مربوط به گزارشگری تبلیغاتی، که پیشتر هفتهها زمان میبرد، اکنون در مدت زمان کمتر از دو روز قابل دستیابی است، که تاثیر قابل توجهی بر کارایی و سرعت تصمیمگیریهای استراتژیک دارد.
در مجموع، این رویکرد نه تنها فرآیندهای دادهای را تسهیل میکند، بلکه باعث افزایش دقت، کاهش خطاها و بهبود کارایی عملیاتی میشود. Uber با بهرهگیری از لایه انتزاع داده، آیندهای پر از نوآوری و پاسخگویی سریع به نیازهای بازار را ترسیم کرده است که میتواند الگوی موفقی برای دیگر شرکتها در حوزه فناوری و داده باشد.
#مدیریت_داده #یکپارچه_سازی_داده #تحلیل_در_زمان_واقعی #فناوری
🟣لینک مقاله:
https://www.uber.com/us/en/blog/data-abstraction-layer/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Uber
Simplifying Data and Product Integrations with a Data Abstraction Layer
Accessing data doesn’t have to be so hard! Discover how Uber supports simple yet powerful reporting experiences on top of complex data sets in this blog about building a data abstraction layer.
🔵 عنوان مقاله
I spent 10 hours vibe-coding a tool to visualize any Parquet file's internals (2 minute read)
🟢 خلاصه مقاله:
در دوی ساعت گذشته، من به مدت ۱۰ ساعت صرف برنامهنویسی و توسعه ابزاری در مرورگر کردم که قادر است ساختار داخلی هر فایل پارکت را به وضوح نشان دهد. این ابزار کوچک با استفاده از زبان برنامهنویسی Rust و کتابخانهی arrow-rs طراحی شده است و وظیفه آن تحلیل و نمایش جزئیات فایلهای پارکت است که معمولاً پنهان میمانند.
این ابزار قادر است بخشهای مختلف فایل، مانند گروههای ردیفی، تکههای ستونها، صفحات، اسکیمها، کدگذاریها، فیلترهای بلوم، اندازهها، و آمار حداقل و حداکثر را به صورت گرافیکی و قابل فهم نمایش دهد. به این ترتیب، توسعهدهندگان، دانشاموزان و محققان میتوانند با استفاده از این ابزار، درک بهتری نسبت به جزئیات فایلهای ستونی پیدا کنند که نقش مهمی در بهبود فرآیندهای تحلیل داده و اشکالزدایی ایفا میکند.
این ابزار نه تنها برای آموزش مفید است بلکه در فرآیندهای اشکالزدایی و بهینهسازی فایلهای پارکت، کمک قابل توجهی میکند. در واقع، این پروژه نشان میدهد چطور میتوان با بهرهگیری از فناوریهای مدرن و زبانهای برنامهنویسی قدرتمند، ابزارهای کارآمدی ساخته و دانش فنی خود را توسعه داد.
#تحلیل_فایل_پارتک #برنامهنویسی #دیتا_فناوری #ابزارهای_دیجیتال
🟣لینک مقاله:
https://vutr.substack.com/p/i-spent-10-hours-vibe-coding-a-tool?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
I spent 10 hours vibe-coding a tool to visualize any Parquet file's internals (2 minute read)
🟢 خلاصه مقاله:
در دوی ساعت گذشته، من به مدت ۱۰ ساعت صرف برنامهنویسی و توسعه ابزاری در مرورگر کردم که قادر است ساختار داخلی هر فایل پارکت را به وضوح نشان دهد. این ابزار کوچک با استفاده از زبان برنامهنویسی Rust و کتابخانهی arrow-rs طراحی شده است و وظیفه آن تحلیل و نمایش جزئیات فایلهای پارکت است که معمولاً پنهان میمانند.
این ابزار قادر است بخشهای مختلف فایل، مانند گروههای ردیفی، تکههای ستونها، صفحات، اسکیمها، کدگذاریها، فیلترهای بلوم، اندازهها، و آمار حداقل و حداکثر را به صورت گرافیکی و قابل فهم نمایش دهد. به این ترتیب، توسعهدهندگان، دانشاموزان و محققان میتوانند با استفاده از این ابزار، درک بهتری نسبت به جزئیات فایلهای ستونی پیدا کنند که نقش مهمی در بهبود فرآیندهای تحلیل داده و اشکالزدایی ایفا میکند.
این ابزار نه تنها برای آموزش مفید است بلکه در فرآیندهای اشکالزدایی و بهینهسازی فایلهای پارکت، کمک قابل توجهی میکند. در واقع، این پروژه نشان میدهد چطور میتوان با بهرهگیری از فناوریهای مدرن و زبانهای برنامهنویسی قدرتمند، ابزارهای کارآمدی ساخته و دانش فنی خود را توسعه داد.
#تحلیل_فایل_پارتک #برنامهنویسی #دیتا_فناوری #ابزارهای_دیجیتال
🟣لینک مقاله:
https://vutr.substack.com/p/i-spent-10-hours-vibe-coding-a-tool?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Substack
I spent 10 hours vibe-coding a tool to visualize any Parquet file’s internals
Petquar, watch the 20s demo below
🔵 عنوان مقاله
Postgres 19: How Our Advice Has Changed Since We Wrote It (16 minute read)
🟢 خلاصه مقاله:
در نسخهی جدید پستگرس ۱۹، تغییرات عمدهای صورت نگرفته است، بلکه بیشتر بر تقویت روشهای اثباتشده گذشته تمرکز شده است. این نسخه با توسعه فناوری I/O غیرهمزمان و افزودن قابلیتهای خودکار در مقیاسپذیری، عملکرد سیستمهای پایگاه داده را بهبود میبخشد. علاوهبر این، امکاناتی مانند نسخهپذیری قویتر عملیات COPY، استفاده پیشفرض از فشردهسازی LZ4، بهبود در سیستمهای ایندکسگذاری و مدیریت راحتتر بخشبندیها، از جمله ویژگیهای برجسته آن هستند. نکات کلیدی در طراحی و نگهداری پایگاه داده هنوز هم همان اصول اولیه باقیمانده است: بهرهگیری از دستور COPY برای بارگذاری دادههای انبوه، مدلسازی دادههای پرترافیک به صورت ساختاری، انتخاب هوشمندانه ایندکسها و استفاده از بخشبندی بیشتر برای مدیریت چرخه عمر دادهها. این تحولات، کمک میکنند تا توسعهدهندگان و مدیران پایگاه داده بتوانند بهتر و کارآمدتر روی پروژههای خود کار کنند، بدون اینکه نیاز به تغییر بنیادین در استراتژیهای خود باشد.
#پستگرس #پایگاه_داده #مدیریت_داده #توسعه_نرمافزار
🟣لینک مقاله:
https://www.crunchydata.com/blog/postgres-19-how-our-advice-has-changed-since-we-wrote-it?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Postgres 19: How Our Advice Has Changed Since We Wrote It (16 minute read)
🟢 خلاصه مقاله:
در نسخهی جدید پستگرس ۱۹، تغییرات عمدهای صورت نگرفته است، بلکه بیشتر بر تقویت روشهای اثباتشده گذشته تمرکز شده است. این نسخه با توسعه فناوری I/O غیرهمزمان و افزودن قابلیتهای خودکار در مقیاسپذیری، عملکرد سیستمهای پایگاه داده را بهبود میبخشد. علاوهبر این، امکاناتی مانند نسخهپذیری قویتر عملیات COPY، استفاده پیشفرض از فشردهسازی LZ4، بهبود در سیستمهای ایندکسگذاری و مدیریت راحتتر بخشبندیها، از جمله ویژگیهای برجسته آن هستند. نکات کلیدی در طراحی و نگهداری پایگاه داده هنوز هم همان اصول اولیه باقیمانده است: بهرهگیری از دستور COPY برای بارگذاری دادههای انبوه، مدلسازی دادههای پرترافیک به صورت ساختاری، انتخاب هوشمندانه ایندکسها و استفاده از بخشبندی بیشتر برای مدیریت چرخه عمر دادهها. این تحولات، کمک میکنند تا توسعهدهندگان و مدیران پایگاه داده بتوانند بهتر و کارآمدتر روی پروژههای خود کار کنند، بدون اینکه نیاز به تغییر بنیادین در استراتژیهای خود باشد.
#پستگرس #پایگاه_داده #مدیریت_داده #توسعه_نرمافزار
🟣لینک مقاله:
https://www.crunchydata.com/blog/postgres-19-how-our-advice-has-changed-since-we-wrote-it?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Crunchy Data
Postgres 19: How Our Advice Has Changed Since We Wrote It | Crunchy Data Blog
Revisiting Crunchy posts on COPY, TOAST, BRIN, covering indexes, and partitioning: what we said then, which Postgres versions changed the story, and what we recommend on Postgres 19.
🔵 عنوان مقاله
We will ship the first Polars 2.0 release candidate next week (1 minute read)
🟢 خلاصه مقاله:
ما هفته آینده اولین نسخه آزمایشی رسمی از نرمافزار Polars 2.0 را منتشر خواهیم کرد. این نسخه که به عنوان "کاندیدا" شناخته میشود، مرحلهای مهم در فرآیند توسعه است، زیرا نشانگر آمادگی این نسخه برای عرضه نهایی است و فرصت خوبی است برای کاربران و توسعهدهندگان تا بازخوردهای خود را ارائه دهند و مشکلات احتمالی را شناسایی کنند.
نسخه 2.0 از Polars در حال حاضر در مراحل نهایی قرار دارد و تیم توسعه کاملاً بر روی اصلاح نقاط ضعف و بهبود عملکرد آن تمرکز کرده است. این نسخه شامل ویژگیهای جدید و بهبودهای قابل توجهی است که هدفشان بهبود کارایی و سهولت استفاده است. انتظار میرود با انتشار این نسخه، کاربران تجربه کاربری بهتر و ابزارهای قدرتمندتری در اختیار داشته باشند، که این امر میتواند تاثیر قابل توجهی در پروژههای دادهکاوی و آنالیزهای حجیم داشته باشد.
با نزدیک شدن به تاریخ انتشار، تیم توسعه فعالانه در حال جمعآوری بازخوردها و رفع خطاهای احتمالی است تا نسخه نهایی با بهترین کیفیت ممکن ارائه شود. این مرحله اهمیت ویژهای دارد، چرا که نتیجه نهایی باید تمام نیازها و انتظارات کاربران را برآورده کند و تجربه کاری رضایتبخش را فراهم آورد.
پیشبینی میشود با عرضه نسخه آزمایشی، جامعه کاربری و توسعهدهندگان به همکاری بیشتر تشویق شوند و نظرات ارزشمندی درباره نهاییسازی ویژگیها ارائه دهند. این تعامل مستقیم کمک میکند تا Polars 2.0 نه تنها یک بهروزرسانی کوچک بلکه یک تغییر اساسی در امکانات و کارایی باشد.
منتظر باشید، چرا که هفته آینده با انتشار این نسخه آزمایشی، تحولات جدید در انتظار شماست و بهبودهای چشمگیر در انتظار پروژههای دادهکاوی شما قرار دارد.
#پولارس #نسخه۲٫۰ #دادهکاوی #توسعه
🟣لینک مقاله:
https://threadreaderapp.com/thread/2089338347286093851.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
We will ship the first Polars 2.0 release candidate next week (1 minute read)
🟢 خلاصه مقاله:
ما هفته آینده اولین نسخه آزمایشی رسمی از نرمافزار Polars 2.0 را منتشر خواهیم کرد. این نسخه که به عنوان "کاندیدا" شناخته میشود، مرحلهای مهم در فرآیند توسعه است، زیرا نشانگر آمادگی این نسخه برای عرضه نهایی است و فرصت خوبی است برای کاربران و توسعهدهندگان تا بازخوردهای خود را ارائه دهند و مشکلات احتمالی را شناسایی کنند.
نسخه 2.0 از Polars در حال حاضر در مراحل نهایی قرار دارد و تیم توسعه کاملاً بر روی اصلاح نقاط ضعف و بهبود عملکرد آن تمرکز کرده است. این نسخه شامل ویژگیهای جدید و بهبودهای قابل توجهی است که هدفشان بهبود کارایی و سهولت استفاده است. انتظار میرود با انتشار این نسخه، کاربران تجربه کاربری بهتر و ابزارهای قدرتمندتری در اختیار داشته باشند، که این امر میتواند تاثیر قابل توجهی در پروژههای دادهکاوی و آنالیزهای حجیم داشته باشد.
با نزدیک شدن به تاریخ انتشار، تیم توسعه فعالانه در حال جمعآوری بازخوردها و رفع خطاهای احتمالی است تا نسخه نهایی با بهترین کیفیت ممکن ارائه شود. این مرحله اهمیت ویژهای دارد، چرا که نتیجه نهایی باید تمام نیازها و انتظارات کاربران را برآورده کند و تجربه کاری رضایتبخش را فراهم آورد.
پیشبینی میشود با عرضه نسخه آزمایشی، جامعه کاربری و توسعهدهندگان به همکاری بیشتر تشویق شوند و نظرات ارزشمندی درباره نهاییسازی ویژگیها ارائه دهند. این تعامل مستقیم کمک میکند تا Polars 2.0 نه تنها یک بهروزرسانی کوچک بلکه یک تغییر اساسی در امکانات و کارایی باشد.
منتظر باشید، چرا که هفته آینده با انتشار این نسخه آزمایشی، تحولات جدید در انتظار شماست و بهبودهای چشمگیر در انتظار پروژههای دادهکاوی شما قرار دارد.
#پولارس #نسخه۲٫۰ #دادهکاوی #توسعه
🟣لینک مقاله:
https://threadreaderapp.com/thread/2089338347286093851.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Threadreaderapp
Thread by @RitchieVink on Thread Reader App
@RitchieVink: We will ship the first Polars 2.0 release candidate next week. Polars 2.0 will be great for casual Polars users as it will default to the streaming engine, meaning your code will be faster without...…
🔵 عنوان مقاله
Spark Tips. Partition Tuning (12 minute read)
🟢 خلاصه مقاله:
در تنظیم اندازه بخشهای اسپارک، هدف اصلی بهینهسازی بهرهوری و پایداری سیستم است. باید تلاش کنیم تعداد بخشها به قدری باشد که بتوانیم از تمام هستههای موجود بهرهبرداری کنیم، بدون اینکه وظایف بسیار کوچک ایجاد کنیم که زمان پردازش را افزایش میدهد. بهتر است عملیات فیلتر را در مراحل اولیه انجام دهیم تا حجم دادههایی که باید منتقل و پردازش شوند کاهش یابد. همچنین، نباید بر دادههای غیرضروری shuffle انجام دهیم و در مواقعی که ساختار فعلی دادهها مناسب نیست، مجدداً بخشبندی دادهها را برای بهتر شدن عملیاتهای join یا نوشتن انجام دهیم.
در راهنمای عملی، نکاتی مانند قابلیت خودکار بهینهسازی کیفیت اطلاعات (AQE)، مشکلات ناشی از توزیع نابرابر دادهها (Skew)، مشکلات مربوط به spilling و استفاده از نقاط کنترل (checkpoint barriers) مورد بحث قرار میگیرند. علاوه بر این، توازن میان فایلهای کوچک و بزرگ نیز اهمیت دارد و نیاز است تا با توجه به نوع دادهها و عملیات، تنظیمات بهینه را اعمال کنیم. رعایت این موارد به بهبود عملکرد و کاهش مشکلات سیستم کمک میکند و به ما اجازه میدهد تا منابع را بهتر مدیریت کنیم.
#اسپارک #بهینهسازی #پایداریداده #توزیع دادهها
🟣لینک مقاله:
https://luminousmen.substack.com/p/spark-tips-partition-tuning?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Spark Tips. Partition Tuning (12 minute read)
🟢 خلاصه مقاله:
در تنظیم اندازه بخشهای اسپارک، هدف اصلی بهینهسازی بهرهوری و پایداری سیستم است. باید تلاش کنیم تعداد بخشها به قدری باشد که بتوانیم از تمام هستههای موجود بهرهبرداری کنیم، بدون اینکه وظایف بسیار کوچک ایجاد کنیم که زمان پردازش را افزایش میدهد. بهتر است عملیات فیلتر را در مراحل اولیه انجام دهیم تا حجم دادههایی که باید منتقل و پردازش شوند کاهش یابد. همچنین، نباید بر دادههای غیرضروری shuffle انجام دهیم و در مواقعی که ساختار فعلی دادهها مناسب نیست، مجدداً بخشبندی دادهها را برای بهتر شدن عملیاتهای join یا نوشتن انجام دهیم.
در راهنمای عملی، نکاتی مانند قابلیت خودکار بهینهسازی کیفیت اطلاعات (AQE)، مشکلات ناشی از توزیع نابرابر دادهها (Skew)، مشکلات مربوط به spilling و استفاده از نقاط کنترل (checkpoint barriers) مورد بحث قرار میگیرند. علاوه بر این، توازن میان فایلهای کوچک و بزرگ نیز اهمیت دارد و نیاز است تا با توجه به نوع دادهها و عملیات، تنظیمات بهینه را اعمال کنیم. رعایت این موارد به بهبود عملکرد و کاهش مشکلات سیستم کمک میکند و به ما اجازه میدهد تا منابع را بهتر مدیریت کنیم.
#اسپارک #بهینهسازی #پایداریداده #توزیع دادهها
🟣لینک مقاله:
https://luminousmen.substack.com/p/spark-tips-partition-tuning?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Substack
Spark Tips. Partition Tuning
Your cluster is fully utilized... by one task
Forwarded from Job
💼 به دنبال استخدام برنامهنویس هستید؟ یا به دنبال فرصت شغلی مناسب میگردید؟
🟢 کارفرمایان:
اگر به دنبال جذب برنامهنویس هستید، آگهی استخدام خود را برای ما ارسال کنید تا منتشر شود.
🟢 کارجویان:
اگر به دنبال فرصت شغلی هستید، رزومه خود را برای ما ارسال کنید تا در صورت وجود موقعیت مناسب، به شرکتها و کارفرمایان معرفی شوید. 🚀
👤 ادمین:
@mrbardia72
📄 لطفاً موارد زیر را به همراه فایل PDF رزومه ارسال کنید:
✅ نام و نام خانوادگی (اجباری)
✅ سابقه کار (اجباری)
✅ محل سکونت (اجباری)
✅ امکان نقل مکان برای کار (اجباری)
🔹 لینک LinkedIn (اختیاری)
🔹 لینک GitHub (اختیاری)
🟢 کارفرمایان:
اگر به دنبال جذب برنامهنویس هستید، آگهی استخدام خود را برای ما ارسال کنید تا منتشر شود.
🟢 کارجویان:
اگر به دنبال فرصت شغلی هستید، رزومه خود را برای ما ارسال کنید تا در صورت وجود موقعیت مناسب، به شرکتها و کارفرمایان معرفی شوید. 🚀
👤 ادمین:
@mrbardia72
📄 لطفاً موارد زیر را به همراه فایل PDF رزومه ارسال کنید:
✅ نام و نام خانوادگی (اجباری)
✅ سابقه کار (اجباری)
✅ محل سکونت (اجباری)
✅ امکان نقل مکان برای کار (اجباری)
🔹 لینک LinkedIn (اختیاری)
🔹 لینک GitHub (اختیاری)
چند روز پیش ی پست گذاشتم راجع به DuckDB و اینکه میشه دیتای با حجم چند ۱۰ گیگ را راحت روی یک لپتاپ لود کرد و استفاده کرد. الان نیاز داشتم چندین گیگابایت دیگه هم بهش دیتا اضافه کنم. کل تعداد رکوردها رسید ۲۷۰,۱۶۰,۰۱۱ میلیون رکورد. و فایل دیتابیس شد ۱۴.۵ گیگ. ولی سرعت همچنان فوق العاده بالاست. دموی پایین:
ارزونترین پلن Snowflake ماهی حدود ۱۰۰۰ دلار بود. خلاصه اینکه از این DuckDB و حتا sqlite (بسته به کاربردی که نیاز دارید) غافل نشید.
@<Mehdi Allahyari/>
ارزونترین پلن Snowflake ماهی حدود ۱۰۰۰ دلار بود. خلاصه اینکه از این DuckDB و حتا sqlite (بسته به کاربردی که نیاز دارید) غافل نشید.
@<Mehdi Allahyari/>
وقتی جدول دیتابیس میلیاردها سطر داره، چطور فقط همون تکهای رو بخونیم که به کارمون میاد؟
دیتابیس که بزرگ میشه، فقط ایندکس کافی نیست. گاهی باید خودِ جدول رو تکهتکه کنیم تا موتور بتونه بخشهای نامربوط رو کلاً نادیده بگیره. به این میگن پارتیشنبندی.
توی این صفحه، چهار روش اصلی پارتیشنبندی RANGE، LIST، HASH و KEY رو بررسی کردم و تفاوت Partitioning با Sharding رو توضیح دادم.
همچنین با یک مثال، الگوی Sliding Window رو بررسی کردم که چطور میشه بدون انجام DELETE های سنگین، دادههای قدیمی رو آرشیو کرد. در نهایت هم تفاوت پیادهسازی این مفاهیم در SQL Server و MySQL رو بررسی کردم.
اگه براتون مفید بود، خوشحال میشم یه ستاره بهش بدین.
https://alireza-haeri.github.io/BackendDeepDives/DataPartitioning.html
@| <AliReza Haeri/>
دیتابیس که بزرگ میشه، فقط ایندکس کافی نیست. گاهی باید خودِ جدول رو تکهتکه کنیم تا موتور بتونه بخشهای نامربوط رو کلاً نادیده بگیره. به این میگن پارتیشنبندی.
توی این صفحه، چهار روش اصلی پارتیشنبندی RANGE، LIST، HASH و KEY رو بررسی کردم و تفاوت Partitioning با Sharding رو توضیح دادم.
همچنین با یک مثال، الگوی Sliding Window رو بررسی کردم که چطور میشه بدون انجام DELETE های سنگین، دادههای قدیمی رو آرشیو کرد. در نهایت هم تفاوت پیادهسازی این مفاهیم در SQL Server و MySQL رو بررسی کردم.
اگه براتون مفید بود، خوشحال میشم یه ستاره بهش بدین.
https://alireza-haeri.github.io/BackendDeepDives/DataPartitioning.html
@| <AliReza Haeri/>
🙏2
🔵 عنوان مقاله
Semi-Structured Data in Apache Iceberg: Meet the Variant Type (3 minute read)
🟢 خلاصه مقاله:
در نسخه سوم Apache Iceberg، نوع جدیدی به نام «نوع متغیر» یا «Variant» معرفی شد که برای مدیریت دادههای نیمهساختاری طراحی شده است. این نوع به کاربران اجازه میدهد رکوردهای شبیه به JSON، که ممکن است به سرعت تغییر کنند، در یک ستون واحد ذخیره شوند و در عین حال نوعهای اصلی مانند تایماستمپها، اعداد اعشاری، و مقادیر باینری حفظ شوند.
این نوع مبتنی بر کدگذاری باینری پارکت است و با اکثر سیستمهای پردازش داده مانند Spark و Flink سازگار است. از طریق SQL در Spark، میتوانید به راحتی این نوع دادهها را با تابع variant_get فراخوانی و مورد استفاده قرار دهید. این قابلیت، انعطافپذیری و کارایی در مدیریت دادههای نیمهساختاری را به جداسازی و تحلیل دادهها بیشتر کرده است.
در نتیجه، معرفی نوع «متغیر» در Iceberg، راهکاری مدرن و عملی برای کار با دادههای ناهمگون و دینامیک است که هم سازگاری با ابزارهای محبوب را فراهم میکند و هم امکان استخراج و تحلیل دادههای پیچیدهتر را برای توسعهدهندگان و تحلیلگران داده آسانتر میسازد.
#داده_نیمهساختاری #ApacheIceberg #پایگاه_داده #تحلیل_داده
🟣لینک مقاله:
https://iceberg.apache.org/blog/variant-in-apache-iceberg/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Semi-Structured Data in Apache Iceberg: Meet the Variant Type (3 minute read)
🟢 خلاصه مقاله:
در نسخه سوم Apache Iceberg، نوع جدیدی به نام «نوع متغیر» یا «Variant» معرفی شد که برای مدیریت دادههای نیمهساختاری طراحی شده است. این نوع به کاربران اجازه میدهد رکوردهای شبیه به JSON، که ممکن است به سرعت تغییر کنند، در یک ستون واحد ذخیره شوند و در عین حال نوعهای اصلی مانند تایماستمپها، اعداد اعشاری، و مقادیر باینری حفظ شوند.
این نوع مبتنی بر کدگذاری باینری پارکت است و با اکثر سیستمهای پردازش داده مانند Spark و Flink سازگار است. از طریق SQL در Spark، میتوانید به راحتی این نوع دادهها را با تابع variant_get فراخوانی و مورد استفاده قرار دهید. این قابلیت، انعطافپذیری و کارایی در مدیریت دادههای نیمهساختاری را به جداسازی و تحلیل دادهها بیشتر کرده است.
در نتیجه، معرفی نوع «متغیر» در Iceberg، راهکاری مدرن و عملی برای کار با دادههای ناهمگون و دینامیک است که هم سازگاری با ابزارهای محبوب را فراهم میکند و هم امکان استخراج و تحلیل دادههای پیچیدهتر را برای توسعهدهندگان و تحلیلگران داده آسانتر میسازد.
#داده_نیمهساختاری #ApacheIceberg #پایگاه_داده #تحلیل_داده
🟣لینک مقاله:
https://iceberg.apache.org/blog/variant-in-apache-iceberg/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
(Re)Building a FAQ System for DataTalks.Club (12 minute read)
🟢 خلاصه مقاله:
در دنیای امروز، پاسخگویی سریع و دقیق به سوالات کاربران اهمیت زیادی دارد، به همین دلیل شرکت DataTalks.Club تصمیم گرفت سیستم پرسش و پاسخ خود را مجدداً بازطراحی کند. در این پروژه، تیم توسعه بر ساخت یک ربات FAQ مبتنی بر منابع متنوع تمرکز کرد. این منابع شامل مشکلات و دستورالعملهای مختص به پروژه در GitHub، بحثهای موجود در Slack، و واژگان و گفتگویهای ضبط شده در ویدئوهای YouTube بودند. هدف از این کار ایجاد یک پایگاه داده غنی و قابل اعتماد بود که بتواند پاسخهای صحیح و بهموقع را در اختیار کاربران قرار دهد.
در این فرآیند، تیم تلاش کرد تا طراحی سیستم به گونهای باشد که بدون نیاز به ساخت سرورهای مستقل، به راحتی در محیطهای Serverless مانند AWS Lambda اجرا شود. این رویکرد نه تنها هزینهها را کاهش میدهد بلکه نگهداری و توسعه را نیز سادهتر میکند. با این حال، برای اطمینان از کیفیت پاسخها، توجه خاصی به برچسبگذاری مناسب، مدیریت دستههای بررسی، و مکاشفههای هزینهبر مربوط به صحت پاسخها در نظر گرفته شد. به ویژه، بررسی دقیق مواردی که ممکن است منجر به رد نادرست یا بسته شدن زودهنگام گفتگوها شوند، اهمیت زیادی داشت.
در نتیجه، این پروژه یادآوری مهمی است که کیفیت سیستمهای پاسخگویی مبتنی بر اطلاعات باید از همان ابتدا با نگهداری منظم و دقیق دادهها تضمین شود. اگر دادهها خام و ناپایدار باشند، حتی بهترین الگوریتمها هم نمیتوانند جوابهای مفید و مطمئن ارائه دهند. بنابراین، تمرکز بر مدیریت و بروزرسانی مداوم منبع دادهها، کلید موفقیت در توسعه سیستمهای یادگیری و بازیابی اطلاعات است.
#هوش_مصنوعی #سیستمهای_پاسخگو #یادگیری_ماشین #توسعه_پایگاه_داده
🟣لینک مقاله:
https://alexeyondata.substack.com/p/rebuilding-a-faq-system-for-datatalksclub?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
(Re)Building a FAQ System for DataTalks.Club (12 minute read)
🟢 خلاصه مقاله:
در دنیای امروز، پاسخگویی سریع و دقیق به سوالات کاربران اهمیت زیادی دارد، به همین دلیل شرکت DataTalks.Club تصمیم گرفت سیستم پرسش و پاسخ خود را مجدداً بازطراحی کند. در این پروژه، تیم توسعه بر ساخت یک ربات FAQ مبتنی بر منابع متنوع تمرکز کرد. این منابع شامل مشکلات و دستورالعملهای مختص به پروژه در GitHub، بحثهای موجود در Slack، و واژگان و گفتگویهای ضبط شده در ویدئوهای YouTube بودند. هدف از این کار ایجاد یک پایگاه داده غنی و قابل اعتماد بود که بتواند پاسخهای صحیح و بهموقع را در اختیار کاربران قرار دهد.
در این فرآیند، تیم تلاش کرد تا طراحی سیستم به گونهای باشد که بدون نیاز به ساخت سرورهای مستقل، به راحتی در محیطهای Serverless مانند AWS Lambda اجرا شود. این رویکرد نه تنها هزینهها را کاهش میدهد بلکه نگهداری و توسعه را نیز سادهتر میکند. با این حال، برای اطمینان از کیفیت پاسخها، توجه خاصی به برچسبگذاری مناسب، مدیریت دستههای بررسی، و مکاشفههای هزینهبر مربوط به صحت پاسخها در نظر گرفته شد. به ویژه، بررسی دقیق مواردی که ممکن است منجر به رد نادرست یا بسته شدن زودهنگام گفتگوها شوند، اهمیت زیادی داشت.
در نتیجه، این پروژه یادآوری مهمی است که کیفیت سیستمهای پاسخگویی مبتنی بر اطلاعات باید از همان ابتدا با نگهداری منظم و دقیق دادهها تضمین شود. اگر دادهها خام و ناپایدار باشند، حتی بهترین الگوریتمها هم نمیتوانند جوابهای مفید و مطمئن ارائه دهند. بنابراین، تمرکز بر مدیریت و بروزرسانی مداوم منبع دادهها، کلید موفقیت در توسعه سیستمهای یادگیری و بازیابی اطلاعات است.
#هوش_مصنوعی #سیستمهای_پاسخگو #یادگیری_ماشین #توسعه_پایگاه_داده
🟣لینک مقاله:
https://alexeyondata.substack.com/p/rebuilding-a-faq-system-for-datatalksclub?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Aishippingblog
(Re)Building a FAQ System for DataTalks.Club
Serving 100k+ Learners with a Serverless FAQ Assistant
🔵 عنوان مقاله
Zero-sum by design: 10 years of Uber's payments platform (8 minute read)
🟢 خلاصه مقاله:
در دهه اخیر، پلتفرم پرداختهای اوبر، Gulfstream، به عنوان یکی از مهمترین و پرکاربردترین زیرساختهای مالی این شرکت تبدیل شده است. این سیستم در حال حاضر توانایی پشتیبانی از بیش از ۲۱۷ میلیارد دلار در معاملات ناخالص سالانه را دارد که تقریباً دو برابر ارزش جابجاییهای مالی در خود پلتفرم است. این رقم نشاندهنده کاربرد گسترده و اهمیت فوقالعاده سیستم در عملیاتهای روزمره اوبر است. علاوه بر این، با بهرهگیری از فناوریهای پیشرفته، مجموعهای از تعادلهای حسابررسی برای بیش از ۱.۲ میلیارد حساب فعال در پلتفرم مدیریت میشود، که نیاز به دقت و امنیت بالا در ثبت و جابجایی مالی دارد.
در طراحی این سیستم، از سفارشات مالی با ذات ثابت و بدون تغییر، بهرهبرداری میشود که بر اساس مفهوم حسابداری دوطرفه ساخته شده است. این رویکرد اطمینان میدهد که هر تراکنش، به صورت کاملاً شفاف و قابل رهگیری ثبت میشود و در صورت نیاز، میتوان تاریخچه کامل تمامی جابجاییها را بررسی کرد. همچنین، دادهها در بانک اطلاعاتی DynamoDB نگهداری میشوند که امکان دسترسی سریع و مقیاسپذیری بالا را فراهم میکند.
برای انتقال دادهها و مدیریت فرآیندهای در لحظه، از فناوری Kafka بهره گرفته شده است که جریانهای دادهای را به صورت پیوسته و کارا مدیریت میکند. سیستم Cadence نیز نقش مهمی در تنظیم فرآیندهای همزمان و هماهنگ ایفا میکند، که در عملیاتهایی مانند تایید تراکنش و هماهنگی اطلاعات، موثر است. در کنار این موارد، این پلتفرم از رابطهای عمومی و چندمنظوره برای ابزارهای پرداخت بهره میبرد؛ این امر اجازه میدهد خطوط جدید کسبوکار به سرعت و با کمترین تغییرات در هسته سیستم راهاندازی شوند، و انعطافپذیری بالایی در توسعه و انطباق با نیازهای آینده فراهم گردد.
در مجموع، اوبر با طراحی منحصربهفرد و استفاده از فناوریهای نوین، بستر مطمئنی برای انجام تراکنشهای مالی گسترده و قابل اطمینان ساخته است که توانسته بخش عمدهای از نیازهای مالی خود را به شکلی امن و مؤثر برآورده سازد.
#پرداخت #فناوری #تراکنش_مالی #اوبر
🟣لینک مقاله:
https://www.uber.com/us/en/blog/ubers-payments-platform/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Zero-sum by design: 10 years of Uber's payments platform (8 minute read)
🟢 خلاصه مقاله:
در دهه اخیر، پلتفرم پرداختهای اوبر، Gulfstream، به عنوان یکی از مهمترین و پرکاربردترین زیرساختهای مالی این شرکت تبدیل شده است. این سیستم در حال حاضر توانایی پشتیبانی از بیش از ۲۱۷ میلیارد دلار در معاملات ناخالص سالانه را دارد که تقریباً دو برابر ارزش جابجاییهای مالی در خود پلتفرم است. این رقم نشاندهنده کاربرد گسترده و اهمیت فوقالعاده سیستم در عملیاتهای روزمره اوبر است. علاوه بر این، با بهرهگیری از فناوریهای پیشرفته، مجموعهای از تعادلهای حسابررسی برای بیش از ۱.۲ میلیارد حساب فعال در پلتفرم مدیریت میشود، که نیاز به دقت و امنیت بالا در ثبت و جابجایی مالی دارد.
در طراحی این سیستم، از سفارشات مالی با ذات ثابت و بدون تغییر، بهرهبرداری میشود که بر اساس مفهوم حسابداری دوطرفه ساخته شده است. این رویکرد اطمینان میدهد که هر تراکنش، به صورت کاملاً شفاف و قابل رهگیری ثبت میشود و در صورت نیاز، میتوان تاریخچه کامل تمامی جابجاییها را بررسی کرد. همچنین، دادهها در بانک اطلاعاتی DynamoDB نگهداری میشوند که امکان دسترسی سریع و مقیاسپذیری بالا را فراهم میکند.
برای انتقال دادهها و مدیریت فرآیندهای در لحظه، از فناوری Kafka بهره گرفته شده است که جریانهای دادهای را به صورت پیوسته و کارا مدیریت میکند. سیستم Cadence نیز نقش مهمی در تنظیم فرآیندهای همزمان و هماهنگ ایفا میکند، که در عملیاتهایی مانند تایید تراکنش و هماهنگی اطلاعات، موثر است. در کنار این موارد، این پلتفرم از رابطهای عمومی و چندمنظوره برای ابزارهای پرداخت بهره میبرد؛ این امر اجازه میدهد خطوط جدید کسبوکار به سرعت و با کمترین تغییرات در هسته سیستم راهاندازی شوند، و انعطافپذیری بالایی در توسعه و انطباق با نیازهای آینده فراهم گردد.
در مجموع، اوبر با طراحی منحصربهفرد و استفاده از فناوریهای نوین، بستر مطمئنی برای انجام تراکنشهای مالی گسترده و قابل اطمینان ساخته است که توانسته بخش عمدهای از نیازهای مالی خود را به شکلی امن و مؤثر برآورده سازد.
#پرداخت #فناوری #تراکنش_مالی #اوبر
🟣لینک مقاله:
https://www.uber.com/us/en/blog/ubers-payments-platform/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Automatic Apache Kafka migrations with Orbit (17 minute read)
🟢 خلاصه مقاله:
در دنیای امروز، مدیریت انتقال دادهها و ارتقاء زیرساختهای فناوری اطلاعات اهمیت زیادی دارد. یکی از چالشهای بزرگ در این زمینه، مهاجرت امن و بدون خطا به سیستمهای جدید است که نیازمند برنامهریزی دقیق و نظارت دائم است. WarpStream با ارائه ابزار Orbit، فرآیند مهاجرت به Apache Kafka را به شکل خودکار و هوشمندانه طراحی کرده است، به طوری که تیمهای فنی میتوانند انتقال کلسترها را با سرعت بیشتری انجام دهند بدون اینکه به طور ضمنی باعث اختلال در عملکرد تولیدکنندگان، مصرفکنندگان، یا تنظیمات Offset و ترتیب پیامها شوند. این سیستم با فراهم آوردن چکهای پیشرفته، اطمینان حاصل میکند که تمامی جوانب مهم در حین مهاجرت رعایت شده و در نتیجه فرآیند انتقال بیدرنگ و مطمئن انجام میشود.
در نتیجه، استفاده از Orbit نه تنها به کاهش زمان مورد نیاز برای مهاجرت کمک میکند، بلکه خطر خطاهای انسانی و ناپایداری سیستم را نیز کاهش میدهد، و در نهایت، کاربران از یک انتقال نرم و بیوقفه بهرهمند میشوند. این راهکار، ترکیبی از اتوماسیون و اطمینانپذیری است که به تیمهای فناوری اطلاعات اجازه میدهد بدون نگرانی از خرابیهای ناشی از انتقال، تمرکز بیشتری بر روی توسعه و بهبود استراتژیهای خود داشته باشند.
#مهاجرت_خودکار #ApacheKafka #مدیریت_پایگاه_داده #امنیت_سیستم
🟣لینک مقاله:
https://www.warpstream.com/blog/orbit-kafka-auto-migration?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Automatic Apache Kafka migrations with Orbit (17 minute read)
🟢 خلاصه مقاله:
در دنیای امروز، مدیریت انتقال دادهها و ارتقاء زیرساختهای فناوری اطلاعات اهمیت زیادی دارد. یکی از چالشهای بزرگ در این زمینه، مهاجرت امن و بدون خطا به سیستمهای جدید است که نیازمند برنامهریزی دقیق و نظارت دائم است. WarpStream با ارائه ابزار Orbit، فرآیند مهاجرت به Apache Kafka را به شکل خودکار و هوشمندانه طراحی کرده است، به طوری که تیمهای فنی میتوانند انتقال کلسترها را با سرعت بیشتری انجام دهند بدون اینکه به طور ضمنی باعث اختلال در عملکرد تولیدکنندگان، مصرفکنندگان، یا تنظیمات Offset و ترتیب پیامها شوند. این سیستم با فراهم آوردن چکهای پیشرفته، اطمینان حاصل میکند که تمامی جوانب مهم در حین مهاجرت رعایت شده و در نتیجه فرآیند انتقال بیدرنگ و مطمئن انجام میشود.
در نتیجه، استفاده از Orbit نه تنها به کاهش زمان مورد نیاز برای مهاجرت کمک میکند، بلکه خطر خطاهای انسانی و ناپایداری سیستم را نیز کاهش میدهد، و در نهایت، کاربران از یک انتقال نرم و بیوقفه بهرهمند میشوند. این راهکار، ترکیبی از اتوماسیون و اطمینانپذیری است که به تیمهای فناوری اطلاعات اجازه میدهد بدون نگرانی از خرابیهای ناشی از انتقال، تمرکز بیشتری بر روی توسعه و بهبود استراتژیهای خود داشته باشند.
#مهاجرت_خودکار #ApacheKafka #مدیریت_پایگاه_داده #امنیت_سیستم
🟣لینک مقاله:
https://www.warpstream.com/blog/orbit-kafka-auto-migration?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Warpstream
Move Fast And Don’t Break Things: Automatic Apache Kafka® Migrations With Orbit
No maintenance window, no restarts, no big-bang cutover. Orbit Auto Migration moves Kafka producers to WarpStream one topic at a time.
🔵 عنوان مقاله
How we knew COVID was over (and what our models had to unlearn) (11 minute read)
🟢 خلاصه مقاله:
وقتی شیوع کرونا پشت سر گذاشته شد، تیم پیشبینی Airbnb باید به سرعت با تغییرات جدید سازگار شود و ساختارهای کسبوکار را مجدد ارزیابی کند. این فرآیند تنها به معنای آموزش مجدد مدلها نبود، بلکه نیاز داشتند تفاوتهای اساسی و تغییرات ساختاری را از نوسانات جزئی جدا کنند. در دوران اوج کووید، الگوهای تقاضا به شدت دچار نوسان شده بودند، اما پس از گذشت این دوره، تشخیص این که چه تغییراتی واقعی و پایدار هستند و چه صرفاً موقتی هستند، ضروری بود. تیم به جای صرفاً بروزرسانی بیوقفه مدلها، تصمیم گرفتند که در مورد مدلهای خود تجدید نظر کنند و گزینههایی مانند بازتعیین پارامترها، اصلاح ساختار مدل یا نگهداشتن وضعیت موجود را ارزیابی کنند. این استراتژیها اجازه داد که مدلهای عملیاتی شرکت در مواجهه با تغییرات اساسی بهتر عمل کنند و عملکرد قابل اعتماد خود را حفظ کنند.
در نتیجه، Airbnb توانست مدلی عملیاتی برای پیشبینیهای بلندمدت و در عین حال مقاوم در برابر تغییرات ساختاری توسعه دهد. این مدل توانست در مواجهه با تغییرات ناگهانی و دورهای، عملکرد موثری داشته باشد و اقتصاد شرکت را در زمانهای بحرانی حفظ کند. رویکرد این تیم نمونهای ارزشمند است که نشان میدهد تلاش برای تفکیک نوسانات زمانی کوتاه از تغییرات ساختاری، کلید اصلی در نگهداری و بهروزرسانی مدلهای پیشبینی در دورههای تغییر است.
#مدل_سازی #پیشبینی #تغییرات_ساختاری #هوش_مصنوعی
🟣لینک مقاله:
https://airbnb.tech/ai-ml/how-we-knew-covid-was-over-and-what-our-models-had-to-unlearn/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
How we knew COVID was over (and what our models had to unlearn) (11 minute read)
🟢 خلاصه مقاله:
وقتی شیوع کرونا پشت سر گذاشته شد، تیم پیشبینی Airbnb باید به سرعت با تغییرات جدید سازگار شود و ساختارهای کسبوکار را مجدد ارزیابی کند. این فرآیند تنها به معنای آموزش مجدد مدلها نبود، بلکه نیاز داشتند تفاوتهای اساسی و تغییرات ساختاری را از نوسانات جزئی جدا کنند. در دوران اوج کووید، الگوهای تقاضا به شدت دچار نوسان شده بودند، اما پس از گذشت این دوره، تشخیص این که چه تغییراتی واقعی و پایدار هستند و چه صرفاً موقتی هستند، ضروری بود. تیم به جای صرفاً بروزرسانی بیوقفه مدلها، تصمیم گرفتند که در مورد مدلهای خود تجدید نظر کنند و گزینههایی مانند بازتعیین پارامترها، اصلاح ساختار مدل یا نگهداشتن وضعیت موجود را ارزیابی کنند. این استراتژیها اجازه داد که مدلهای عملیاتی شرکت در مواجهه با تغییرات اساسی بهتر عمل کنند و عملکرد قابل اعتماد خود را حفظ کنند.
در نتیجه، Airbnb توانست مدلی عملیاتی برای پیشبینیهای بلندمدت و در عین حال مقاوم در برابر تغییرات ساختاری توسعه دهد. این مدل توانست در مواجهه با تغییرات ناگهانی و دورهای، عملکرد موثری داشته باشد و اقتصاد شرکت را در زمانهای بحرانی حفظ کند. رویکرد این تیم نمونهای ارزشمند است که نشان میدهد تلاش برای تفکیک نوسانات زمانی کوتاه از تغییرات ساختاری، کلید اصلی در نگهداری و بهروزرسانی مدلهای پیشبینی در دورههای تغییر است.
#مدل_سازی #پیشبینی #تغییرات_ساختاری #هوش_مصنوعی
🟣لینک مقاله:
https://airbnb.tech/ai-ml/how-we-knew-covid-was-over-and-what-our-models-had-to-unlearn/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Using Models to Create Models of New York City (20 minute read)
🟢 خلاصه مقاله:
در این مقاله، پتر سوبوت با بهرهگیری از بیش از هزار تصویر، تکنولوژی Claude و روش Gaussian Splatting، توانست مدلی سهبعدی از آسمانخراشها و چشمانداز نئونهای شهر نیویورک بسازد. این پروژه عظیم شامل اجرای بیش از ۷۴ زیرنقشه و حدود ۲۸۰ آزمایش مختلف بود که نشان داد هوش مصنوعی قادر است بخش قابل توجهی از فرآیند فنی ساختن مدلهای دقیق را بر عهده گیرد. با این حال، هنوز در بخشهایی مانند قضاوت بصری، پردازش دادههای نامنظم و تعیین زمانی که نتیجه واقعا رضایتبخش است، با چالشهایی مواجه است.
پتر سوبوت برای این پروژه، با استفاده از فناوریهای پیشرفته و الگوریتمهای هوشمند، توانسته است یک نمونه اولیه از شهر نیویورک بسازد که در آن جزئیات و ابعاد شهری به شکل واقعی و قابل تنظیم بازسازی شدهاند. اما علیرغم پیشرفتهای قابل توجه، این فناوری هنوز نیازمند انسانی است تا بتواند زیبایی، هماهنگی و اصالت بصری را در نتایج تشخیص دهد و تصمیمگیری کند.
در مجموع، این پروژه نشان میدهد که هوش مصنوعی در کنار فناوریهای نوین میتواند ابزار قدرتمندی برای مدلسازی و بازسازی فضاهای شهری باشد، اما هنوز نیاز دارد که بخشهایی از قبیل سلیقه human و تطابق با واقعیتهای پیچیده، توسط انسانها نظارت و هدایت شود. آینده این حوزه به همکاری متعادل میان فناوری و هنر وابسته است، جایی که هر دو با هم، شهرهای خیالی و واقعی را به بهترین شکل شکل میدهند.
#مدلسازی_3بعدی #هوش_مصنوعی #نیویورک #تکنولوژی
🟣لینک مقاله:
https://petersobot.com/blog/using-models-to-create-models-of-new-york-city/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Using Models to Create Models of New York City (20 minute read)
🟢 خلاصه مقاله:
در این مقاله، پتر سوبوت با بهرهگیری از بیش از هزار تصویر، تکنولوژی Claude و روش Gaussian Splatting، توانست مدلی سهبعدی از آسمانخراشها و چشمانداز نئونهای شهر نیویورک بسازد. این پروژه عظیم شامل اجرای بیش از ۷۴ زیرنقشه و حدود ۲۸۰ آزمایش مختلف بود که نشان داد هوش مصنوعی قادر است بخش قابل توجهی از فرآیند فنی ساختن مدلهای دقیق را بر عهده گیرد. با این حال، هنوز در بخشهایی مانند قضاوت بصری، پردازش دادههای نامنظم و تعیین زمانی که نتیجه واقعا رضایتبخش است، با چالشهایی مواجه است.
پتر سوبوت برای این پروژه، با استفاده از فناوریهای پیشرفته و الگوریتمهای هوشمند، توانسته است یک نمونه اولیه از شهر نیویورک بسازد که در آن جزئیات و ابعاد شهری به شکل واقعی و قابل تنظیم بازسازی شدهاند. اما علیرغم پیشرفتهای قابل توجه، این فناوری هنوز نیازمند انسانی است تا بتواند زیبایی، هماهنگی و اصالت بصری را در نتایج تشخیص دهد و تصمیمگیری کند.
در مجموع، این پروژه نشان میدهد که هوش مصنوعی در کنار فناوریهای نوین میتواند ابزار قدرتمندی برای مدلسازی و بازسازی فضاهای شهری باشد، اما هنوز نیاز دارد که بخشهایی از قبیل سلیقه human و تطابق با واقعیتهای پیچیده، توسط انسانها نظارت و هدایت شود. آینده این حوزه به همکاری متعادل میان فناوری و هنر وابسته است، جایی که هر دو با هم، شهرهای خیالی و واقعی را به بهترین شکل شکل میدهند.
#مدلسازی_3بعدی #هوش_مصنوعی #نیویورک #تکنولوژی
🟣لینک مقاله:
https://petersobot.com/blog/using-models-to-create-models-of-new-york-city/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Peter Sobot's Blog
Using Models to Create Models of New York City
I've been a photographer for most of my life. My personal photo library contains, at time of writing, 134,000 photos going back more than 30 years. I like capturing the moment.
🔵 عنوان مقاله
A tale of two Flink autoscalers (7 minute read)
🟢 خلاصه مقاله:
در دنیای مدیریت اجرایی برنامههای دادهای، سیستمهای خودکار اسکیلینگ نقش حیاتی دارند، و در این عرصه، Netflix تصمیم گرفته است تا بیش از ۳۰ هزار وظیفه فراگیرش را از سیستمهای داخلی خود که به صورت سفارشی توسعه یافته بودند به سمت سیستم اسکیلینگ اتوماتیک مبتنی بر پروژه Apache Flink سوق دهد. این تغییر استراتژیک نشان دهنده اهمیت بهرهگیری از فناوریهای متنباز و ابزارهای تخصصی در تحقق بهینگی و بهرهوری بیشتر در مدیریت منابع است.
سیستم قدیمی که Netflix استفاده میکرد، بر اساس شاخصهای میزان مصرف منابع در داخل هر کلاستر، کل کلاستر را به طور کامل در صورت نیاز اسکیل میکرد. این روش توانسته بود تا ۲۵ تا ۴۵ درصد در مصرف منابع صرفهجویی کند، اما در کنار این مزیت، همچنان معایبی هم داشت. به عنوان نمونه، این سیستم قادر نبود سطح عملیات خاص و وضعیت داخلی اپراتورها را در نظر بگیرد، بنابراین در مدیریت بهتر و دقیقتر منابع محدودیتهایی داشت. همچنین، نقص در جمعآوری دادههای telemetry و کمبود در ارائه دید جامع، منجر به کاهش کارایی کامل آن میشد و باعث میشد نتواند به بهترین شکل نیازهای در حال تغییر سیستمهای اجرایی را برآورده کند.
در مقابل، نسخه جدید اسکیلر متنباز Apache Flink، بر مبنای تحلیل وضعیت هر وظیفه به صورت جداگانه عمل میکند. این سیستم قادر است تا بر رفتارهای داخلی هر وظیفه بر پایه دادههای زمان واقعی نظارت کرده و تصمیمگیریهای هوشمندانهتری انجام دهد. نتیجه این رویکرد، صرفهجویی قابل توجه در مصرف منابع است؛ به طوری که برای یکی از تیمها، این سیستم به طور سالانه ۵۸ درصد در هزینههای محاسباتی صرفهجویی ایجاد کرده است. این دستاورد نشاندهنده اهمیت و تاثیر فناوریهای متنباز در بهبود کارایی سیستمهای بزرگ مقیاس است.
در نهایت، این تحولات نشان میدهند که انتقال به سیستمهای متنباز و هوشمند، نه تنها از نظر صرفهجویی اقتصادی بلکه از منظر بهبود عملکرد و کنترل دقیقتر منابع، گامی مثبت و ضروری در مسیر توسعه فناوریهای دادهمحور است.
#هوشمندسازی #فناوری_متن_باز #صرفهجویی_درمنابع #پیشرفت_تکنولوژی
🟣لینک مقاله:
https://netflixtechblog.com/a-tale-of-two-flink-autoscalers-e9f6a1b1492b?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
A tale of two Flink autoscalers (7 minute read)
🟢 خلاصه مقاله:
در دنیای مدیریت اجرایی برنامههای دادهای، سیستمهای خودکار اسکیلینگ نقش حیاتی دارند، و در این عرصه، Netflix تصمیم گرفته است تا بیش از ۳۰ هزار وظیفه فراگیرش را از سیستمهای داخلی خود که به صورت سفارشی توسعه یافته بودند به سمت سیستم اسکیلینگ اتوماتیک مبتنی بر پروژه Apache Flink سوق دهد. این تغییر استراتژیک نشان دهنده اهمیت بهرهگیری از فناوریهای متنباز و ابزارهای تخصصی در تحقق بهینگی و بهرهوری بیشتر در مدیریت منابع است.
سیستم قدیمی که Netflix استفاده میکرد، بر اساس شاخصهای میزان مصرف منابع در داخل هر کلاستر، کل کلاستر را به طور کامل در صورت نیاز اسکیل میکرد. این روش توانسته بود تا ۲۵ تا ۴۵ درصد در مصرف منابع صرفهجویی کند، اما در کنار این مزیت، همچنان معایبی هم داشت. به عنوان نمونه، این سیستم قادر نبود سطح عملیات خاص و وضعیت داخلی اپراتورها را در نظر بگیرد، بنابراین در مدیریت بهتر و دقیقتر منابع محدودیتهایی داشت. همچنین، نقص در جمعآوری دادههای telemetry و کمبود در ارائه دید جامع، منجر به کاهش کارایی کامل آن میشد و باعث میشد نتواند به بهترین شکل نیازهای در حال تغییر سیستمهای اجرایی را برآورده کند.
در مقابل، نسخه جدید اسکیلر متنباز Apache Flink، بر مبنای تحلیل وضعیت هر وظیفه به صورت جداگانه عمل میکند. این سیستم قادر است تا بر رفتارهای داخلی هر وظیفه بر پایه دادههای زمان واقعی نظارت کرده و تصمیمگیریهای هوشمندانهتری انجام دهد. نتیجه این رویکرد، صرفهجویی قابل توجه در مصرف منابع است؛ به طوری که برای یکی از تیمها، این سیستم به طور سالانه ۵۸ درصد در هزینههای محاسباتی صرفهجویی ایجاد کرده است. این دستاورد نشاندهنده اهمیت و تاثیر فناوریهای متنباز در بهبود کارایی سیستمهای بزرگ مقیاس است.
در نهایت، این تحولات نشان میدهند که انتقال به سیستمهای متنباز و هوشمند، نه تنها از نظر صرفهجویی اقتصادی بلکه از منظر بهبود عملکرد و کنترل دقیقتر منابع، گامی مثبت و ضروری در مسیر توسعه فناوریهای دادهمحور است.
#هوشمندسازی #فناوری_متن_باز #صرفهجویی_درمنابع #پیشرفت_تکنولوژی
🟣لینک مقاله:
https://netflixtechblog.com/a-tale-of-two-flink-autoscalers-e9f6a1b1492b?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Medium
A Tale of Two Flink Autoscalers
Samuel Yeboah, Francesco Di Chiara and Mingliang Liu
🔵 عنوان مقاله
TrueFoundry open-sources TrueForge, an enterprise AI agent harness (8 minute read)
🟢 خلاصه مقاله:
در عرصه توسعه هوش مصنوعی، ابزارهای قدرتمند و کارآمد نقش کلیدی در بهبود فرآیندها و کاهش هزینهها دارند. یکی از این ابزارها، TrueForge است که توسط TrueFoundry ارائه شده و در قالب یک «هِرانس» (نماینده خودکار) قابل میزبانی است. این ابزار با هدف کاهش هزینههای مربوط به انجام وظایف، امکاناتی مانند فشردهسازی اطلاعات، بارگذاری تأخیری اسکیمهای ابزار (tool-schema)، ایجاد زیرنمایندگان (subagents) و اجرای sandbox به عنوان یک ابزار عملیاتی را ارائه میدهد. این ویژگیها به تیمهای دادهای کمک میکند تا به صورت بهینهتر وظایف خود را مدیریت و انجام دهند.
در عمل، TrueForge به تیمهای داده و توسعه این امکان را میدهد که بدون وابستگی کامل به یک مدل خاص، فرآیندهای اورکستراسیون را کنترل کنند. این یعنی، تیمها میتوانند به راحتی بین مدلها جابهجا شده و تنظیمات امنیتی، دسترسیها و نظارتها را مستقل از انتخاب مدل مدیریت کنند. ویژگیهایی مانند تنظیمات هویت، کنترل دسترسی و نظارت بر فعالیتها، در کنار مدیریت بودجه، به این ابزار قدرتی بینظیر میبخشد که خصوصاً برای تیمهایی که در حال آزمایش و توسعه مدلهای عمومی یا خصوصی هستند، بسیار مفید است.
در نهایت، Open-sourcing بودن TrueForge نشان میدهد که این پروژه در دسترس عموم قرار گرفته است و توسعهدهندگان میتوانند آن را برای نیازهای خاص خود سفارشی و بهبود بخشند. این حرکت، زمینهساز همکاریهای بیشتر در اکوسیستم هوش مصنوعی شده و به تیمهای داده کمک میکند تا با بهرهگیری از فناوریهای متنباز، راهکارهای ایمن، موثرتری برای مدیریت و اجرای عملیات هوشمند داشته باشند.
#هوش_مصنوعی #توسعه_هوشمند #ابزارهای_هوش_مصنوعی #فناوری_باز
🟣لینک مقاله:
https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
TrueFoundry open-sources TrueForge, an enterprise AI agent harness (8 minute read)
🟢 خلاصه مقاله:
در عرصه توسعه هوش مصنوعی، ابزارهای قدرتمند و کارآمد نقش کلیدی در بهبود فرآیندها و کاهش هزینهها دارند. یکی از این ابزارها، TrueForge است که توسط TrueFoundry ارائه شده و در قالب یک «هِرانس» (نماینده خودکار) قابل میزبانی است. این ابزار با هدف کاهش هزینههای مربوط به انجام وظایف، امکاناتی مانند فشردهسازی اطلاعات، بارگذاری تأخیری اسکیمهای ابزار (tool-schema)، ایجاد زیرنمایندگان (subagents) و اجرای sandbox به عنوان یک ابزار عملیاتی را ارائه میدهد. این ویژگیها به تیمهای دادهای کمک میکند تا به صورت بهینهتر وظایف خود را مدیریت و انجام دهند.
در عمل، TrueForge به تیمهای داده و توسعه این امکان را میدهد که بدون وابستگی کامل به یک مدل خاص، فرآیندهای اورکستراسیون را کنترل کنند. این یعنی، تیمها میتوانند به راحتی بین مدلها جابهجا شده و تنظیمات امنیتی، دسترسیها و نظارتها را مستقل از انتخاب مدل مدیریت کنند. ویژگیهایی مانند تنظیمات هویت، کنترل دسترسی و نظارت بر فعالیتها، در کنار مدیریت بودجه، به این ابزار قدرتی بینظیر میبخشد که خصوصاً برای تیمهایی که در حال آزمایش و توسعه مدلهای عمومی یا خصوصی هستند، بسیار مفید است.
در نهایت، Open-sourcing بودن TrueForge نشان میدهد که این پروژه در دسترس عموم قرار گرفته است و توسعهدهندگان میتوانند آن را برای نیازهای خاص خود سفارشی و بهبود بخشند. این حرکت، زمینهساز همکاریهای بیشتر در اکوسیستم هوش مصنوعی شده و به تیمهای داده کمک میکند تا با بهرهگیری از فناوریهای متنباز، راهکارهای ایمن، موثرتری برای مدیریت و اجرای عملیات هوشمند داشته باشند.
#هوش_مصنوعی #توسعه_هوشمند #ابزارهای_هوش_مصنوعی #فناوری_باز
🟣لینک مقاله:
https://venturebeat.com/orchestration/truefoundrys-open-source-ai-agent-harness-trueforge-boasts-30-75-cheaper-task-completion-than-claude-managed-agents?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Venturebeat
TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion than Claude Managed Agents
A sandbox is provisioned as a tool only when the agent needs to execute code or work with files. TrueFoundry says that reduces unnecessary compute.
🔵 عنوان مقاله
Not every problem needs an AI agent (5 minute read)
🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات، بسیاری تصور میکنند که هر مشکل پیچیدهای باید با کمک هوش مصنوعی حل شود. اما واقعیت این است که سیستمهای هوش مصنوعی تولیدی زمانی بهترین عملکرد را دارند که هر بخش از سیستم، وظایف خود را با تناسب مناسب و بهینه انجام دهد. برای مثال، سیستمهای پیشنهاددهی، مدیریت محتوا، جستجوهای بزرگ دیتابیسی و فرآیندهای شروع سرد (cold start) نیازمند ترکیبی هوشمندانه از منطق قطعی، یادگیری ماشین کلاسیک، لایههای معنایی و تکنولوژیهای مبتنی بر مدلهای زبانی بزرگ (LLMs) هستند. استفاده از هر کدام از این ابزارها بسته به نیاز، باید به شکل متعادل و هوشمندانه صورت گیرد، چرا که بهرهوری بهتر در نتیجه، در این تعادل نهفته است.
در این میان، بهترین الگو غالباً رویکرد ترکیبی است: ما میتوانیم از عوامل هوشمند برای استنتاج و استدلال بهرهمند شویم، ولی در عین حال، منطق تجاری، معیارهای ارزیابی، مسیریابی دادهها و محدودیتهای ایمنی، بهتر است در قالب منطق قطعی و قابل پیشبینی باقی بمانند. این رویکرد، مزیتهای هر دو حوزه را با هم تلفیق میکند و سیستم را هم چالشبرانگیز و پیچیده نمیسازد و هم از خطاهای احتمالی کاسته میشود.
در نتیجه، بهترین استراتژی در توسعه سیستمهای هوشمند، ترکیبی هوشمندانه و متوازن است که در آن از قدرت استنتاجی هوش مصنوعی بهرهمند میشویم، ولی در عین حال، اصول و قوانینی که باید همواره ثابت و قابل اعتماد باقی بمانند، در قالب منطق قطعی حفظ میشوند. این تعادل، باعث میشود که سیستمهای ما هم قدرتمند، هم قابل کنترل و هم امن باشند، و در کنار این، بهرهوری و کارایی بیشتری داشته باشند.
#هوش_مصنوعی #سیستم_یکپارچه #یادگیری_ماشین #تکنولوژی
🟣لینک مقاله:
https://www.cio.com/article/4210687/not-every-problem-needs-an-ai-agent.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Not every problem needs an AI agent (5 minute read)
🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات، بسیاری تصور میکنند که هر مشکل پیچیدهای باید با کمک هوش مصنوعی حل شود. اما واقعیت این است که سیستمهای هوش مصنوعی تولیدی زمانی بهترین عملکرد را دارند که هر بخش از سیستم، وظایف خود را با تناسب مناسب و بهینه انجام دهد. برای مثال، سیستمهای پیشنهاددهی، مدیریت محتوا، جستجوهای بزرگ دیتابیسی و فرآیندهای شروع سرد (cold start) نیازمند ترکیبی هوشمندانه از منطق قطعی، یادگیری ماشین کلاسیک، لایههای معنایی و تکنولوژیهای مبتنی بر مدلهای زبانی بزرگ (LLMs) هستند. استفاده از هر کدام از این ابزارها بسته به نیاز، باید به شکل متعادل و هوشمندانه صورت گیرد، چرا که بهرهوری بهتر در نتیجه، در این تعادل نهفته است.
در این میان، بهترین الگو غالباً رویکرد ترکیبی است: ما میتوانیم از عوامل هوشمند برای استنتاج و استدلال بهرهمند شویم، ولی در عین حال، منطق تجاری، معیارهای ارزیابی، مسیریابی دادهها و محدودیتهای ایمنی، بهتر است در قالب منطق قطعی و قابل پیشبینی باقی بمانند. این رویکرد، مزیتهای هر دو حوزه را با هم تلفیق میکند و سیستم را هم چالشبرانگیز و پیچیده نمیسازد و هم از خطاهای احتمالی کاسته میشود.
در نتیجه، بهترین استراتژی در توسعه سیستمهای هوشمند، ترکیبی هوشمندانه و متوازن است که در آن از قدرت استنتاجی هوش مصنوعی بهرهمند میشویم، ولی در عین حال، اصول و قوانینی که باید همواره ثابت و قابل اعتماد باقی بمانند، در قالب منطق قطعی حفظ میشوند. این تعادل، باعث میشود که سیستمهای ما هم قدرتمند، هم قابل کنترل و هم امن باشند، و در کنار این، بهرهوری و کارایی بیشتری داشته باشند.
#هوش_مصنوعی #سیستم_یکپارچه #یادگیری_ماشین #تکنولوژی
🟣لینک مقاله:
https://www.cio.com/article/4210687/not-every-problem-needs-an-ai-agent.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
DuckDB v2.0: Your database deserves a better parser (9 minute read)
🟢 خلاصه مقاله:
نسخه جدید DuckDB، یعنی نسخه ۲.۰، تغییرات بزرگی در ساختار پارسر SQL این پایگاه داده ایجاد کرده است. در این نسخه، به جای استفاده از پارسر مبتنی بر PostgreSQL که در نسخههای قبلی به کار میرفت، از یک پارسر مبتنی بر فناوری PEG (Parsing Expression Grammar) استفاده شده است. این تغییر مهم باعث میشود که فرآیند تفسیر دستورات SQL سریعتر و مطمئنتر انجام شود، زیرا این نوع پارسر مشکلاتی مانند تعارضهای مربوط به ابزار Bison را برطرف میکند و از پسزمینههای ناخواسته در حین پردازش ورودیهای نادرست جلوگیری میکند.
با این تحول، سیستم دیگر در مواجهه با ورودیهای خراب یا دستورات نادرست دچار مشکل نمیشود و قابلیت افزودن قوانین جدید در زمان اجرا را نیز دارد. این امر امکان توسعه و افزودن نحو (Syntax) جدید بدون نیاز به بازنویسی کامل پارسر SQL را فراهم میکند، که در نسخههای قبلی ممکن بود منجر به اصلاحات پیچیده و زمانبر شود. نتیجه نهایی، برتری در قدرت، انعطافپذیری و ثبات DuckDB است که توجه هر توسعهدهنده و کاربر پایگاه داده را جلب میکند.
در مجموع، این بهروزرسانی نشان میدهد که تیم توسعه DuckDB با استفاده از فناوریهای نوین، قصد دارد بهبودهای چشمگیری در تجربه کاربری و قابلیتهای فنی ارایه دهد و جایگاهی قویتر در عرصه پایگاههای داده داشته باشد.
#DuckDB #پایگاه_داده #توسعه_نرمافزار #پارساز
🟣لینک مقاله:
https://duckdb.org/2026/08/20/duckdb-20-peg-parser.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
DuckDB v2.0: Your database deserves a better parser (9 minute read)
🟢 خلاصه مقاله:
نسخه جدید DuckDB، یعنی نسخه ۲.۰، تغییرات بزرگی در ساختار پارسر SQL این پایگاه داده ایجاد کرده است. در این نسخه، به جای استفاده از پارسر مبتنی بر PostgreSQL که در نسخههای قبلی به کار میرفت، از یک پارسر مبتنی بر فناوری PEG (Parsing Expression Grammar) استفاده شده است. این تغییر مهم باعث میشود که فرآیند تفسیر دستورات SQL سریعتر و مطمئنتر انجام شود، زیرا این نوع پارسر مشکلاتی مانند تعارضهای مربوط به ابزار Bison را برطرف میکند و از پسزمینههای ناخواسته در حین پردازش ورودیهای نادرست جلوگیری میکند.
با این تحول، سیستم دیگر در مواجهه با ورودیهای خراب یا دستورات نادرست دچار مشکل نمیشود و قابلیت افزودن قوانین جدید در زمان اجرا را نیز دارد. این امر امکان توسعه و افزودن نحو (Syntax) جدید بدون نیاز به بازنویسی کامل پارسر SQL را فراهم میکند، که در نسخههای قبلی ممکن بود منجر به اصلاحات پیچیده و زمانبر شود. نتیجه نهایی، برتری در قدرت، انعطافپذیری و ثبات DuckDB است که توجه هر توسعهدهنده و کاربر پایگاه داده را جلب میکند.
در مجموع، این بهروزرسانی نشان میدهد که تیم توسعه DuckDB با استفاده از فناوریهای نوین، قصد دارد بهبودهای چشمگیری در تجربه کاربری و قابلیتهای فنی ارایه دهد و جایگاهی قویتر در عرصه پایگاههای داده داشته باشد.
#DuckDB #پایگاه_داده #توسعه_نرمافزار #پارساز
🟣لینک مقاله:
https://duckdb.org/2026/08/20/duckdb-20-peg-parser.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
DuckDB
DuckDB v2.0: Your Database Deserves a Better Parser
DuckDB v2.0 replaces its PostgreSQL-derived SQL parser with a PEG-based parser that is easier to evolve and can be extended at runtime.
فراتر از Npgsql: راهنمای کامل PgBouncer، Pgpool-II، Odyssey و پروکسیهای ابری Postgres برای اپلیکیشنهای C#
https://mhmdnzr.drl.ink/post/npgsql-pgbouncer-pgpool-ii-odyssey-postgres-c
https://mhmdnzr.drl.ink/post/npgsql-pgbouncer-pgpool-ii-odyssey-postgres-c
وبلاگ محمد نظری
فراتر از Npgsql: راهنمای کامل PgBouncer، Pgpool-II، Odyssey و پروکسیهای ابری Postgres برای اپلیکیشنهای C#
مقایسه و پیادهسازی عملی لایههای server-side connection pooling برای PostgreSQL — شامل کانفیگ کامل PgBouncer در حالت transaction mode، Pgpool-II برای load…
🔵 عنوان مقاله
AI Engineering Skills Map: Building and Deploying AI Applications (4 minute read)
🟢 خلاصه مقاله:
در دهههای اخیر، هوش مصنوعی به یکی از پرمخاطبترین و پرفروشترین حوزههای فناوری تبدیل شده است. در همین راستا، مهارتهای مهندسی هوش مصنوعی نقش کلیدی در توسعه و پیادهسازی برنامههای هوشمند دارند. در این مقاله، نگاهی به نقشه مهارتهای مهندسی AI انداختهایم که توسط اندرو نگ، یکی از پیشگامان این حوزه، طراحی شده است.
نقشه مهارتهای مهندسی هوش مصنوعی او بر شش حوزه اصلی تمرکز دارد. اولین حوزه، مبانی و پایههای مدلهای زبانی بزرگ (LLM) است که شامل درک ساختار و نحوه کار این مدلها میشود. دومین بخش، grounding دادهها، که اهمیت زیادی در صحت و کارآیی مدلها دارند، و به نحوه جمعآوری، پاکسازی و استفاده بهینه از دادهها اختصاص یافته است. سومین حوزه، عوامل یا agents است که در طراحی سیستمهای خودکار و هوشمند نقش دارند و میتوانند تصمیمگیری و تعاملات هوشمندانه انجام دهند.
علاوه بر این، ارزیابیها یا evals بخش دیگری در نقشه مهارتها هستند که به سنجش و تضمین کیفیت عملکرد مدلهای AI میپردازند. بخش بعد، عملیاتهای تولیدی یا production operations، مسئولیت مدیریت و پشتیبانی از سیستمهای هوش مصنوعی در محیطهای عملیاتی را بر عهده دارد. نهایتاً، مبانی یادگیری ماشین (ML fundamentals) نقش زیربنایی در ساخت و توسعه هرگونه سیستم هوشمند دارند.
این نقشه جامع، راهنمایی است برای مهندسان و توسعهدهندگان AI که میخواهند مهارتهای خود را گسترش دهند و در پروژههای مختلف به طور موثر فعالیت کنند. در نتیجه، درک عمیق و تسلط بر این شش حوزه، کلید موفقیت در صنعت هوش مصنوعی به شمار میآید.
#هوشمندسازی #یادگیری_ماشین #توسعه_هوش_مصنوعی #مهارتهای_AI
🟣لینک مقاله:
https://x.com/AndrewYNg/status/2090840747738374568?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
AI Engineering Skills Map: Building and Deploying AI Applications (4 minute read)
🟢 خلاصه مقاله:
در دهههای اخیر، هوش مصنوعی به یکی از پرمخاطبترین و پرفروشترین حوزههای فناوری تبدیل شده است. در همین راستا، مهارتهای مهندسی هوش مصنوعی نقش کلیدی در توسعه و پیادهسازی برنامههای هوشمند دارند. در این مقاله، نگاهی به نقشه مهارتهای مهندسی AI انداختهایم که توسط اندرو نگ، یکی از پیشگامان این حوزه، طراحی شده است.
نقشه مهارتهای مهندسی هوش مصنوعی او بر شش حوزه اصلی تمرکز دارد. اولین حوزه، مبانی و پایههای مدلهای زبانی بزرگ (LLM) است که شامل درک ساختار و نحوه کار این مدلها میشود. دومین بخش، grounding دادهها، که اهمیت زیادی در صحت و کارآیی مدلها دارند، و به نحوه جمعآوری، پاکسازی و استفاده بهینه از دادهها اختصاص یافته است. سومین حوزه، عوامل یا agents است که در طراحی سیستمهای خودکار و هوشمند نقش دارند و میتوانند تصمیمگیری و تعاملات هوشمندانه انجام دهند.
علاوه بر این، ارزیابیها یا evals بخش دیگری در نقشه مهارتها هستند که به سنجش و تضمین کیفیت عملکرد مدلهای AI میپردازند. بخش بعد، عملیاتهای تولیدی یا production operations، مسئولیت مدیریت و پشتیبانی از سیستمهای هوش مصنوعی در محیطهای عملیاتی را بر عهده دارد. نهایتاً، مبانی یادگیری ماشین (ML fundamentals) نقش زیربنایی در ساخت و توسعه هرگونه سیستم هوشمند دارند.
این نقشه جامع، راهنمایی است برای مهندسان و توسعهدهندگان AI که میخواهند مهارتهای خود را گسترش دهند و در پروژههای مختلف به طور موثر فعالیت کنند. در نتیجه، درک عمیق و تسلط بر این شش حوزه، کلید موفقیت در صنعت هوش مصنوعی به شمار میآید.
#هوشمندسازی #یادگیری_ماشین #توسعه_هوش_مصنوعی #مهارتهای_AI
🟣لینک مقاله:
https://x.com/AndrewYNg/status/2090840747738374568?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
X (formerly Twitter)
Andrew Ng (@AndrewYNg) on X
AI Engineering Skills Map: Building and Deploying AI Applications