Forwarded from Persian Post
کتاب «اپل در چین: تسخیر بزرگترین شرکت جهان»
(Apple in China: The Capture of the World's Greatest Company)
اثری جذاب و خواندنی از پاتریک مکگی است.
این کتاب به بررسی وابستگی عمیق شرکت اپل به نیروی کار و زیرساختهای صنعتی چین میپردازد و نشان میدهد که چگونه اپل با برونسپاری تولید آیفون به چین، به بزرگترین شرکت فناوری جهان تبدیل شد. همچنین به این موضوع اشاره دارد که این وابستگی متقابل چگونه به پکن قدرت زیادی بخشیده است، به طوری که اگر دولت چین بخواهد، میتواند حیات تولید آیفون را یکشبه با چالش جدی مواجه کند.
https://xn--r1a.website/+Bp8JeTpQoiUwMjVk
(Apple in China: The Capture of the World's Greatest Company)
اثری جذاب و خواندنی از پاتریک مکگی است.
این کتاب به بررسی وابستگی عمیق شرکت اپل به نیروی کار و زیرساختهای صنعتی چین میپردازد و نشان میدهد که چگونه اپل با برونسپاری تولید آیفون به چین، به بزرگترین شرکت فناوری جهان تبدیل شد. همچنین به این موضوع اشاره دارد که این وابستگی متقابل چگونه به پکن قدرت زیادی بخشیده است، به طوری که اگر دولت چین بخواهد، میتواند حیات تولید آیفون را یکشبه با چالش جدی مواجه کند.
https://xn--r1a.website/+Bp8JeTpQoiUwMjVk
🔵 عنوان مقاله
Smevals - a Small Eval Suite for Evaluating Models, Prompts, and Harnesses (9 minute read)
🟢 خلاصه مقاله:
اسمیوالز، مجموعهای کوچک و کاربردی برای ارزیابی مدلها، پویاها و ابزارهای مختلف در حوزه هوش مصنوعی است که کار با آن بسیار آسان و سریع است. این ابزار، یک خط فرمان سبک و کارآمد بر پایه پایتون است که امکان اجرای ارزیابیهای تخصصی مرتبط با وظایف مختلف را بر روی چندین مدل فراهم میکند. هدف اصلی این مجموعه، پیدا کردن اقتصادیترین مدلهایی است که از نظر کیفیت در سطح مورد انتظار قرار دارند.
در استفاده از اسمیوالز، ابتدا وظایف مورد نظر خود را تعریف میکنید؛ سپس با نوشتن فایلهای YAML حاوی ارزیابهای اختصاصی و اسکریپتهای بررسی سفارشی، ارزیابیها را مینویسید و آنها را بر روی مجموعهای از تنظیمات مدلها اجرا میکنید. نتایج نمرهگذاری شده در قالب یک داشبورد محلی یا یک سایت استاتیک نمایش داده میشوند تا بتوانید به راحتی و در کمترین زمان، مدلهایی را که بهترین عملکرد را دارند، شناسایی و مقایسه کنید.
این ابزار، به ویژه برای توسعهدهندگان و محققانی که نیاز دارند سریع و به صورت موثری کیفیت مدلهای مختلف را ارزیابی کنند، بسیار مفید است. رابط کاربری ساده و قابلیتهای قابل تنظیم آن، فرآیند آزمایش و انتخاب مدلها را به مراتب آسانتر میسازد و کمک میکند تا در هزینهها و زمان صرفهجویی بیشتری صورت گیرد.
#هوش_مصنوعی #ارزیابی_مدل #پایتون #توسعه_هوش
🟣لینک مقاله:
https://primeradiant.com/blog/2026/smevals.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Smevals - a Small Eval Suite for Evaluating Models, Prompts, and Harnesses (9 minute read)
🟢 خلاصه مقاله:
اسمیوالز، مجموعهای کوچک و کاربردی برای ارزیابی مدلها، پویاها و ابزارهای مختلف در حوزه هوش مصنوعی است که کار با آن بسیار آسان و سریع است. این ابزار، یک خط فرمان سبک و کارآمد بر پایه پایتون است که امکان اجرای ارزیابیهای تخصصی مرتبط با وظایف مختلف را بر روی چندین مدل فراهم میکند. هدف اصلی این مجموعه، پیدا کردن اقتصادیترین مدلهایی است که از نظر کیفیت در سطح مورد انتظار قرار دارند.
در استفاده از اسمیوالز، ابتدا وظایف مورد نظر خود را تعریف میکنید؛ سپس با نوشتن فایلهای YAML حاوی ارزیابهای اختصاصی و اسکریپتهای بررسی سفارشی، ارزیابیها را مینویسید و آنها را بر روی مجموعهای از تنظیمات مدلها اجرا میکنید. نتایج نمرهگذاری شده در قالب یک داشبورد محلی یا یک سایت استاتیک نمایش داده میشوند تا بتوانید به راحتی و در کمترین زمان، مدلهایی را که بهترین عملکرد را دارند، شناسایی و مقایسه کنید.
این ابزار، به ویژه برای توسعهدهندگان و محققانی که نیاز دارند سریع و به صورت موثری کیفیت مدلهای مختلف را ارزیابی کنند، بسیار مفید است. رابط کاربری ساده و قابلیتهای قابل تنظیم آن، فرآیند آزمایش و انتخاب مدلها را به مراتب آسانتر میسازد و کمک میکند تا در هزینهها و زمان صرفهجویی بیشتری صورت گیرد.
#هوش_مصنوعی #ارزیابی_مدل #پایتون #توسعه_هوش
🟣لینک مقاله:
https://primeradiant.com/blog/2026/smevals.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
❤2
🔵 عنوان مقاله
Crowdsourced taxonomy verification: A feedback-driven framework for refining knowledge graph relationships via online search interactions (6 minute read)
🟢 خلاصه مقاله:
در فرآیند توسعه سامانههای دانشمدار، یکی از چالشهای مهم، اطمینان از صحت و سقم روابط بین موجودیتها در نقشههای دانش (Knowledge Graph) است. در این حوزه، رویکردهای سنتی معمولاً مبتنی بر تحلیلهای دستوری یا منابع ثابت هستند که ممکن است نتوانند تغییرات و واقعیات روزمره را به خوبی منعکس کنند. به همین دلیل، اخیراً رویکرد نوینی به نام "تایپوگرافی مبتنی بر جمع سپاری و بازخورد" ابداع شده که با بهرهگیری از رفتارهای جستجو در وب، امکان ارزیابی و اصلاح روابط موجود در نقشههای دانش را فراهم میآورد.
در این چارچوب جدید، روابط فرضی بین موجودیتها—مانند روابط پدری، فرزندی یا همخون—به عنوان فرضیههایی در نظر گرفته میشوند که باید صحت آنها با توجه به تعاملات کاربران در فرآیندهای جستجو تایید یا رد شود. بدین صورت، پیشنهادهای اولیه بر پایه تحلیلهای آماری و الگوریتمهای هوشمند ارائه میگردد و سپس با جمعآوری دادههای واقعی کاربران مانند کلیکها، مدت زمان گذاشته شده بر صفحات، اسکرولها و نرخ تبدیل، امتیازهای اعتمادی ساخته میشود. این امتیازها نشان میدهند که چه میزان رابطهای در نقشه دانش معتبر است و کدام روابط باید تقویت یا حذف شوند.
این رویکرد نه تنها قابلیت اصلاح و بهروزرسانی سریعتر نقشههای دانش را فراهم میکند، بلکه با تکیه بر بازخوردهای مستقیم کاربران، به تدریج به سمت ساختاری دقیقتر و منعکسکنندهتر واقعیت حرکت میکند. در نتیجه، این سیستم مبتنی بر جمع سپاری، امکان توسعه سیستمهای هوشمند و قابل اعتمادتر در حوزههای متعددی را فراهم میآورد و بهبود مستمر در صحت روابط بین دادهها و مفاهیم را تضمین میکند.
#نقشه_دانش #بازخورد_کاربر #هوش_مصنوعی #تحلیل_داده
🟣لینک مقاله:
https://engineering.grab.com/crowdsourced-taxonomy-verification?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Crowdsourced taxonomy verification: A feedback-driven framework for refining knowledge graph relationships via online search interactions (6 minute read)
🟢 خلاصه مقاله:
در فرآیند توسعه سامانههای دانشمدار، یکی از چالشهای مهم، اطمینان از صحت و سقم روابط بین موجودیتها در نقشههای دانش (Knowledge Graph) است. در این حوزه، رویکردهای سنتی معمولاً مبتنی بر تحلیلهای دستوری یا منابع ثابت هستند که ممکن است نتوانند تغییرات و واقعیات روزمره را به خوبی منعکس کنند. به همین دلیل، اخیراً رویکرد نوینی به نام "تایپوگرافی مبتنی بر جمع سپاری و بازخورد" ابداع شده که با بهرهگیری از رفتارهای جستجو در وب، امکان ارزیابی و اصلاح روابط موجود در نقشههای دانش را فراهم میآورد.
در این چارچوب جدید، روابط فرضی بین موجودیتها—مانند روابط پدری، فرزندی یا همخون—به عنوان فرضیههایی در نظر گرفته میشوند که باید صحت آنها با توجه به تعاملات کاربران در فرآیندهای جستجو تایید یا رد شود. بدین صورت، پیشنهادهای اولیه بر پایه تحلیلهای آماری و الگوریتمهای هوشمند ارائه میگردد و سپس با جمعآوری دادههای واقعی کاربران مانند کلیکها، مدت زمان گذاشته شده بر صفحات، اسکرولها و نرخ تبدیل، امتیازهای اعتمادی ساخته میشود. این امتیازها نشان میدهند که چه میزان رابطهای در نقشه دانش معتبر است و کدام روابط باید تقویت یا حذف شوند.
این رویکرد نه تنها قابلیت اصلاح و بهروزرسانی سریعتر نقشههای دانش را فراهم میکند، بلکه با تکیه بر بازخوردهای مستقیم کاربران، به تدریج به سمت ساختاری دقیقتر و منعکسکنندهتر واقعیت حرکت میکند. در نتیجه، این سیستم مبتنی بر جمع سپاری، امکان توسعه سیستمهای هوشمند و قابل اعتمادتر در حوزههای متعددی را فراهم میآورد و بهبود مستمر در صحت روابط بین دادهها و مفاهیم را تضمین میکند.
#نقشه_دانش #بازخورد_کاربر #هوش_مصنوعی #تحلیل_داده
🟣لینک مقاله:
https://engineering.grab.com/crowdsourced-taxonomy-verification?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Grab Tech
Crowdsourced taxonomy verification: A feedback-driven framework for refining knowledge graph relationships via online search interactions
Knowledge graphs power modern search and recommendation systems, but automated construction methods can introduce semantic inaccuracies. This framework verifies KG relationships in real time by injecting candidate edges into live search results and using…
❤3
🔵 عنوان مقاله
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model (12 minute read)
🟢 خلاصه مقاله:
در طول شش ماه گذشته، شرکت Meta توانسته است عملکرد مدل پایهی مربوط به تبلیغات خود را به طرز شگفتانگیزی بهبود ببخشد. این شرکت با بهرهگیری از مجموعهای از فناوریهای نوآورانه، موفق شده است مدل پیشنهادی تبلیغات خود را چهار برابر بزرگتر کند و در نتیجه، کارایی آموزش آن را دو برابر افزایش دهد. این تغییرات در کارایی، از جمله افزایش بهرهوری در فرآیند آموزش مدلهای بزرگ زبانی (LLMs)، نقش بسزایی ایفا میکنند و Meta را در رقابتهای جهانی پیشروتر کردهاند.
برای دستیابی به این نتایج چشمگیر، Meta پنج تکنیک کلیدی را به کار گرفته است. نخست، استفاده از مکانیزم توجه سریع و انعطافپذیر (جگد فلش اتنشن) که میکوشد تا هدررفت ناشی از قسمتهای padding را حذف کند و فضای بیشتری را برای عملیات مفید فراهم آورد. دوم، ایجاد هستهی یکنواخت توجه که با سرعت ۲ تا ۳.۵ برابری، عملیات محاسباتی را به صورت موثرتری انجام میدهد. سوم، آموزش با استفاده از دقت MXFP8، که بهرهوری را در مدلسازی افزایش میدهد و زمان لازم برای آموزش را کاهش میدهد. چهارم، فناوری ارتباط جمعی بدون سیام (SM-free) که توانایی جمعآوری دادهها را بدون نیاز به منابع اضافی، نزدیک به ۲۳ واحد SM (واحدهای محاسباتی) آزاد میکند. و در نهایت، تکنیکی به نام جابهجایی تعادل بار، که باعث افزایش ۴ درصدی کارایی میشود بدون اینکه هزینهای برای ارتباط درون سیستم داشته باشد.
این پیشرفتها نشان میدهند که با ترکیب خلاقانه فناوریهای نوین، میتوان مدلهای هوشمند را بسیار بهینهتر و کارآمدتر ساخت و در عین حال، زمان و منابع مورد نیاز برای آموزش آنها را کاهش داد. این موفقیتها مسیر را برای توسعه فناوریهای تبلیغاتی و مدلسازی زبان طبیعی در آینده هموارتر میکنند و Meta را در صدر رقابتهای فناوری قرار میدهد.
#هوش_مصنوعی #یادگیری_عمیق #مدل_زبانی #تکنولوژیهای_نوین
🟣لینک مقاله:
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model (12 minute read)
🟢 خلاصه مقاله:
در طول شش ماه گذشته، شرکت Meta توانسته است عملکرد مدل پایهی مربوط به تبلیغات خود را به طرز شگفتانگیزی بهبود ببخشد. این شرکت با بهرهگیری از مجموعهای از فناوریهای نوآورانه، موفق شده است مدل پیشنهادی تبلیغات خود را چهار برابر بزرگتر کند و در نتیجه، کارایی آموزش آن را دو برابر افزایش دهد. این تغییرات در کارایی، از جمله افزایش بهرهوری در فرآیند آموزش مدلهای بزرگ زبانی (LLMs)، نقش بسزایی ایفا میکنند و Meta را در رقابتهای جهانی پیشروتر کردهاند.
برای دستیابی به این نتایج چشمگیر، Meta پنج تکنیک کلیدی را به کار گرفته است. نخست، استفاده از مکانیزم توجه سریع و انعطافپذیر (جگد فلش اتنشن) که میکوشد تا هدررفت ناشی از قسمتهای padding را حذف کند و فضای بیشتری را برای عملیات مفید فراهم آورد. دوم، ایجاد هستهی یکنواخت توجه که با سرعت ۲ تا ۳.۵ برابری، عملیات محاسباتی را به صورت موثرتری انجام میدهد. سوم، آموزش با استفاده از دقت MXFP8، که بهرهوری را در مدلسازی افزایش میدهد و زمان لازم برای آموزش را کاهش میدهد. چهارم، فناوری ارتباط جمعی بدون سیام (SM-free) که توانایی جمعآوری دادهها را بدون نیاز به منابع اضافی، نزدیک به ۲۳ واحد SM (واحدهای محاسباتی) آزاد میکند. و در نهایت، تکنیکی به نام جابهجایی تعادل بار، که باعث افزایش ۴ درصدی کارایی میشود بدون اینکه هزینهای برای ارتباط درون سیستم داشته باشد.
این پیشرفتها نشان میدهند که با ترکیب خلاقانه فناوریهای نوین، میتوان مدلهای هوشمند را بسیار بهینهتر و کارآمدتر ساخت و در عین حال، زمان و منابع مورد نیاز برای آموزش آنها را کاهش داد. این موفقیتها مسیر را برای توسعه فناوریهای تبلیغاتی و مدلسازی زبان طبیعی در آینده هموارتر میکنند و Meta را در صدر رقابتهای فناوری قرار میدهد.
#هوش_مصنوعی #یادگیری_عمیق #مدل_زبانی #تکنولوژیهای_نوین
🟣لینک مقاله:
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Engineering at Meta
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
Meta’s Generative Ads Recommendation Model (GEM), the foundation model behind ads recommendations across Instagram and Facebook, now trains at LLM scale on several thousand of the latest-gene…
🔵 عنوان مقاله
How DoorDash Built a Centralized Gateway for AI Agent-Tool Access (13 minute read)
🟢 خلاصه مقاله:
در دنیای فناوری امروز، نقش هوش مصنوعی و ابزارهای مبتنی بر آن در بهبود عملیاتهای تجاری بسیار حیاتی است. شرکت DoorDash با درک نیاز به یک سامانه مرکزی برای مدیریت دسترسیهای هوشمند، تصمیم گرفت یک درگاه مرکزی برای ارتباط بین عاملهای هوشمند و ابزارهای MCP ایجاد کند. این درگاه که به صورت متمرکز طراحی شده است، امکان دسترسی کنترلشده و امن به ابزارهای مورد نیاز را برای عوامل هوشمند فراهم میکند، و فرآیند مدیریت هویت، مجوزها، اعتبارنامهها، فیلترگذاری، نظارت و محدودیت سرعت را بر عهده میگیرد.
این سیستم توانسته است هماکنون از بیش از ۲۰۰ سرور MCP پشتیبانی کرده و میلیونها درخواست هفتگی را مدیریت کند، در حالی که سطح امنیت، اعتمادپذیری و کنترل کلی عملیات به شکل قابل توجهی بهبود یافته است. با نصب این درگاه مرکزی، شرکت DoorDash توانسته اطمینان حاصل کند که دسترسیهای هوشمند به صورت مؤثر و امن صورت میپذیرد، و در عین حال فرآیندها سادهتر و مدیریتپذیرتر شوند. نتیجه نهایی، ارتقاء سطح امنیت و کارایی در سیستمهای داخلی است که اهمیت زیادی در پشتیبانی از عملیاتهای روزمره و حفظ رضایت مشتری دارد.
#هوش_مصنوعی #امنیت_سایبری #مدیریت_دسترسی #تکنولوژی
🟣لینک مقاله:
https://careersatdoordash.com/blog/how-doordash-built-a-centralized-gateway-for-ai-agent-tool-access/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
How DoorDash Built a Centralized Gateway for AI Agent-Tool Access (13 minute read)
🟢 خلاصه مقاله:
در دنیای فناوری امروز، نقش هوش مصنوعی و ابزارهای مبتنی بر آن در بهبود عملیاتهای تجاری بسیار حیاتی است. شرکت DoorDash با درک نیاز به یک سامانه مرکزی برای مدیریت دسترسیهای هوشمند، تصمیم گرفت یک درگاه مرکزی برای ارتباط بین عاملهای هوشمند و ابزارهای MCP ایجاد کند. این درگاه که به صورت متمرکز طراحی شده است، امکان دسترسی کنترلشده و امن به ابزارهای مورد نیاز را برای عوامل هوشمند فراهم میکند، و فرآیند مدیریت هویت، مجوزها، اعتبارنامهها، فیلترگذاری، نظارت و محدودیت سرعت را بر عهده میگیرد.
این سیستم توانسته است هماکنون از بیش از ۲۰۰ سرور MCP پشتیبانی کرده و میلیونها درخواست هفتگی را مدیریت کند، در حالی که سطح امنیت، اعتمادپذیری و کنترل کلی عملیات به شکل قابل توجهی بهبود یافته است. با نصب این درگاه مرکزی، شرکت DoorDash توانسته اطمینان حاصل کند که دسترسیهای هوشمند به صورت مؤثر و امن صورت میپذیرد، و در عین حال فرآیندها سادهتر و مدیریتپذیرتر شوند. نتیجه نهایی، ارتقاء سطح امنیت و کارایی در سیستمهای داخلی است که اهمیت زیادی در پشتیبانی از عملیاتهای روزمره و حفظ رضایت مشتری دارد.
#هوش_مصنوعی #امنیت_سایبری #مدیریت_دسترسی #تکنولوژی
🟣لینک مقاله:
https://careersatdoordash.com/blog/how-doordash-built-a-centralized-gateway-for-ai-agent-tool-access/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
DoorDash
How DoorDash Built a Centralized Gateway for AI Agent-Tool Access - DoorDash
How DoorDash built the Agent Gateway: one governed control plane where AI agents securely discover, authorize, and invoke internal and third-party tools.
🔵 عنوان مقاله
Waiting for Postgres 19: SQL Property Graph Queries (SQL/PGQ)
🟢 خلاصه مقاله:
در دنیای پایگاههای داده، سوال بسیار رایجی مطرح میشود: چه مزیتی دارد که از قابلیتهای خاص کوئرینویسی گراف در SQL، مانند پرسوجویهای گرافخصی (SQL/PGQ)، نسبت به روشهای سنتی مانند استفاده از JOINهای معمول بهرهمند شویم؟ اگر تاکنون در این باره فکر کردهاید که چرا باید از امکانات ویژه گرافهای ویژگی در SQL استفاده کنید، تنها نیستید. بسیاری از توسعهدهندگان و مدیران پایگاهدادهها کنجکاوند بدانند که این فناوری چه تفاوتی با روشهای سنتی دارد و چه مزایایی میتواند برای آنها فراهم کند.
در واقع، افزوده شدن قابلیتهای گرافپایه در SQL، امکان ذخیره و پرسوجوی دادههای پیچیده و شبکهمانند را با سهولت بیشتری فراهم میکند. این ویژگیها به ویژه در مسائلی کاربرد دارند که ساختارهای داده آنها به صورت سلسلهمراتب یا شبکههای متصل هستند، جایی که کوئریهای سنتی ممکن است نیاز به چندین عملیات JOIN و زیرپرسوجوهای پیچیده داشته باشند. با بهرهگیری از پرسوجویهای گراف در SQL، میتوان روابط پیچیده بین دادهها را به شکلی طبیعیتر و کارآمدتر مدلسازی و جستوجو کرد، امری که در آینده نزدیک و با انتشار نسخه 19 پایگاهداده PostgreSQL، بیشتر شاهد آن خواهیم بود.
در نتیجه، انتظار میرود که توسعهدهندگان بتوانند در پروژههای خود، دسترسی سریعتر و دقیقتر به دادههای مرتبط و شبکهای داشته باشند و بتوانند به شکل مؤثرتری سوالات پیچیده مربوط به روابط را پاسخ دهند. این تغییرات، علاوه بر بهبود کارایی، امکانات جدیدی برای تحلیلهای پیشرفته و بینشهای عمیقتر در دادهها فراهم میکند. در انتظار نسخه جدید PostgreSQL میمانیم تا ببینیم چگونه این قابلیتها، دنیای مدیریت و تحلیل داده را متحول خواهند ساخت.
#پایگاهداده #PostgreSQL #گراف #تحلیلداده
🟣لینک مقاله:
https://www.depesz.com/2026/07/31/waiting-for-postgresql-19-sql-property-graph-queries-sql-pgq/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Waiting for Postgres 19: SQL Property Graph Queries (SQL/PGQ)
🟢 خلاصه مقاله:
در دنیای پایگاههای داده، سوال بسیار رایجی مطرح میشود: چه مزیتی دارد که از قابلیتهای خاص کوئرینویسی گراف در SQL، مانند پرسوجویهای گرافخصی (SQL/PGQ)، نسبت به روشهای سنتی مانند استفاده از JOINهای معمول بهرهمند شویم؟ اگر تاکنون در این باره فکر کردهاید که چرا باید از امکانات ویژه گرافهای ویژگی در SQL استفاده کنید، تنها نیستید. بسیاری از توسعهدهندگان و مدیران پایگاهدادهها کنجکاوند بدانند که این فناوری چه تفاوتی با روشهای سنتی دارد و چه مزایایی میتواند برای آنها فراهم کند.
در واقع، افزوده شدن قابلیتهای گرافپایه در SQL، امکان ذخیره و پرسوجوی دادههای پیچیده و شبکهمانند را با سهولت بیشتری فراهم میکند. این ویژگیها به ویژه در مسائلی کاربرد دارند که ساختارهای داده آنها به صورت سلسلهمراتب یا شبکههای متصل هستند، جایی که کوئریهای سنتی ممکن است نیاز به چندین عملیات JOIN و زیرپرسوجوهای پیچیده داشته باشند. با بهرهگیری از پرسوجویهای گراف در SQL، میتوان روابط پیچیده بین دادهها را به شکلی طبیعیتر و کارآمدتر مدلسازی و جستوجو کرد، امری که در آینده نزدیک و با انتشار نسخه 19 پایگاهداده PostgreSQL، بیشتر شاهد آن خواهیم بود.
در نتیجه، انتظار میرود که توسعهدهندگان بتوانند در پروژههای خود، دسترسی سریعتر و دقیقتر به دادههای مرتبط و شبکهای داشته باشند و بتوانند به شکل مؤثرتری سوالات پیچیده مربوط به روابط را پاسخ دهند. این تغییرات، علاوه بر بهبود کارایی، امکانات جدیدی برای تحلیلهای پیشرفته و بینشهای عمیقتر در دادهها فراهم میکند. در انتظار نسخه جدید PostgreSQL میمانیم تا ببینیم چگونه این قابلیتها، دنیای مدیریت و تحلیل داده را متحول خواهند ساخت.
#پایگاهداده #PostgreSQL #گراف #تحلیلداده
🟣لینک مقاله:
https://www.depesz.com/2026/07/31/waiting-for-postgresql-19-sql-property-graph-queries-sql-pgq/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
🔵 عنوان مقاله
Bringing DuckLake to DataFusion (4 minute read)
🟢 خلاصه مقاله:
در این مقاله کوتاه، به معرفی پروژه DuckLake برای DataFusion میپردازیم که اکنون به عنوان یک سامانهی بکاند کاتالوگ قابل اعتماد و متن باز، آماده بهرهبرداری در محیطهای تولید شده است. این سامانه امکان مدیریت متادیتای تراکنشی، گرفتن تصویرهای لحظهای (اسنپشات) و مدیریت طرحهای جدولهای پارکت در فضای ذخیرهسازی ابری را برای کاربران فراهم میکند. طراحی DuckLake به گونهای است که از چندین نوع بکاند کاتالوگ رابطهای و کاتالوگهای منطقی پشتیبانی میکند، و بدین ترتیب میلیونها پایگاه دادهی موقت و ایزوله شده را برای عاملهای هوش مصنوعی بدون نیاز به تکرار زیرساختها، امکانپذیر میسازد.
این سیستم با آزمایشهای مقیاسپذیری و بنچمارکهای TPC-H بر روی ۲۲ پرسش و سه اندازه متفاوت از دادهها، نشان داده است که هیچگونه هزینه اضافی در مقایسه با اجرای مستقیم پرسوجو بر روی دادهها، ندارد. نتیجه این است که DuckLake نه تنها یک پیادهسازی پایدار و کارآمد است، بلکه توسعهپذیری و انعطافپذیری بالا در مواجهه با نیازهای مختلف هوش مصنوعی و دادهکاوی را فراهم میکند و میتواند به طور مؤثر در محیطهای صنعتی و تحقیقاتی مورد استفاده قرار گیرد.
#دیتافیوژن #دینامیکداده #هوش مصنوعی #مدیریتداده
🟣لینک مقاله:
https://ducklake.select/2026/07/29/bringing-ducklake-to-datafusion/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Bringing DuckLake to DataFusion (4 minute read)
🟢 خلاصه مقاله:
در این مقاله کوتاه، به معرفی پروژه DuckLake برای DataFusion میپردازیم که اکنون به عنوان یک سامانهی بکاند کاتالوگ قابل اعتماد و متن باز، آماده بهرهبرداری در محیطهای تولید شده است. این سامانه امکان مدیریت متادیتای تراکنشی، گرفتن تصویرهای لحظهای (اسنپشات) و مدیریت طرحهای جدولهای پارکت در فضای ذخیرهسازی ابری را برای کاربران فراهم میکند. طراحی DuckLake به گونهای است که از چندین نوع بکاند کاتالوگ رابطهای و کاتالوگهای منطقی پشتیبانی میکند، و بدین ترتیب میلیونها پایگاه دادهی موقت و ایزوله شده را برای عاملهای هوش مصنوعی بدون نیاز به تکرار زیرساختها، امکانپذیر میسازد.
این سیستم با آزمایشهای مقیاسپذیری و بنچمارکهای TPC-H بر روی ۲۲ پرسش و سه اندازه متفاوت از دادهها، نشان داده است که هیچگونه هزینه اضافی در مقایسه با اجرای مستقیم پرسوجو بر روی دادهها، ندارد. نتیجه این است که DuckLake نه تنها یک پیادهسازی پایدار و کارآمد است، بلکه توسعهپذیری و انعطافپذیری بالا در مواجهه با نیازهای مختلف هوش مصنوعی و دادهکاوی را فراهم میکند و میتواند به طور مؤثر در محیطهای صنعتی و تحقیقاتی مورد استفاده قرار گیرد.
#دیتافیوژن #دینامیکداده #هوش مصنوعی #مدیریتداده
🟣لینک مقاله:
https://ducklake.select/2026/07/29/bringing-ducklake-to-datafusion/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
DuckLake
Bringing DuckLake to DataFusion
We implemented DuckLake for Apache DataFusion, supporting multiple databases as catalog backends. The integration gives DataFusion a lakehouse format that manages snapshots and catalog metadata for Parquet files stored in object storage. Our implementation…
🔵 عنوان مقاله
LLMs for Relevance: Automating High-Quality Product Relevance Labeling in Flipkart Search (10 minute read)
🟢 خلاصه مقاله:
در دنیای تجارت الکترونیک، ارائه نتایج جستجوی مرتبط و با کیفیت نقش بسیار مهمی در رضایت مشتریان دارد. شرکت فلیپکارت با توجه به حجم بالای محصولات و جستجوهای روزانه، نیازمند روشی هوشمندانه و کارآمد برای تعیین ارتباط میان محصولات و عنوانهای جستجو است. در نتیجه، تیم توسعه این شرکت از فناوریهای پیشرفته هوش مصنوعی و یادگیری ماشین بهره گرفته است تا فرآیند برچسبگذاری مرتبط بودن محصولات با جستجوها را خودکار کند. این روش نه تنها باعث صرفهجویی در زمان و هزینه میشود، بلکه دقت و کیفیت نتایج را نیز بهبود میبخشد.
در مرحله اول، مدل ارزیابی مرتبط بودن محصولات (Relevance Labeling Model) در فلیپکارت بر اساس روشی به نام "یادگیری تقویتی با نمونهگیریهای آزادشده" (Supervised Fine-Tuning یا SFT) آموزش میبیند. این مدل از میلیونها نمونه متعادل شامل کوئری و محصول و همچنین فرآیندهای استنتاجی احتمالی، برای یادگیری الگوهای مربوط بودن استفاده میکند. هدف از این مرحله، ایجاد یک معیار اولیه و قابل اعتماد برای سنجش ارتباط محصولات با درخواستهای کاربران است. پس از آن، تیم توسعه با استفاده از رویکردی به نام "هماهنگی در مدلهای تقویتی" (GRPO) بر پایه یک مدل پاداش با ابعاد 8 میلیارد، فرآیند ارزیابی و اصلاح مدل را انجام میدهد. این مدل پاداش به صورت همزمان کیفیت توضیحات و صحت برچسبها را ارزیابی میکند، تا اطمینان حاصل شود که مدل نه تنها مرتبط بودن را تشخیص میدهد، بلکه توضیحات منطقی و قابل قبول نیز ارائه میدهد.
نتیجه نهایی، گزارش ارزیابی مرتبط بودن نمره NDCG است که به صورت خودکار تولید میشود. این گزارش با نمونههای دستی و انسانی مقایسه شده و تفاوتی کمتر از 1 درصد دارد. مهمتر اینکه، این فرآیند خودکار هزینهای حدود 30 درصد کمتر از ارزیابیهای دستی دارد و در عین حال دقت و اعتمادپذیری همچنان حفظ شده است. این پیشرفتها نشان میدهد که استفاده از فناوریهای هوشمند در بهبود فرآیندهای کسبوکار، میتواند تاثیر چشمگیری در کاهش هزینهها و ارتقاء کیفیت خدمات داشته باشد.
در نتیجه، بهرهگیری از مدلهای زبان بزرگ و فناوریهای نوین در حوزه ارزیابی کیفیت محصولات، فرصتهای بینظیری را برای شرکتهای تجارت الکترونیک فراهم میکند تا بتوانند تجربه مصرفکننده را بهبود بخشند و روند تصمیمگیری در فرآیند جستجو را هوشمندانهتر و کارآمدتر سازند.
#هوش_مصنوعی #یادگیری_ماشین #فناوری_پیشرفته #تجارت_الکترونیک
🟣لینک مقاله:
https://blog.flipkart.tech/llms-for-relevance-automating-high-quality-product-relevance-labeling-in-flipkart-search-ddd5ca50b584?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
LLMs for Relevance: Automating High-Quality Product Relevance Labeling in Flipkart Search (10 minute read)
🟢 خلاصه مقاله:
در دنیای تجارت الکترونیک، ارائه نتایج جستجوی مرتبط و با کیفیت نقش بسیار مهمی در رضایت مشتریان دارد. شرکت فلیپکارت با توجه به حجم بالای محصولات و جستجوهای روزانه، نیازمند روشی هوشمندانه و کارآمد برای تعیین ارتباط میان محصولات و عنوانهای جستجو است. در نتیجه، تیم توسعه این شرکت از فناوریهای پیشرفته هوش مصنوعی و یادگیری ماشین بهره گرفته است تا فرآیند برچسبگذاری مرتبط بودن محصولات با جستجوها را خودکار کند. این روش نه تنها باعث صرفهجویی در زمان و هزینه میشود، بلکه دقت و کیفیت نتایج را نیز بهبود میبخشد.
در مرحله اول، مدل ارزیابی مرتبط بودن محصولات (Relevance Labeling Model) در فلیپکارت بر اساس روشی به نام "یادگیری تقویتی با نمونهگیریهای آزادشده" (Supervised Fine-Tuning یا SFT) آموزش میبیند. این مدل از میلیونها نمونه متعادل شامل کوئری و محصول و همچنین فرآیندهای استنتاجی احتمالی، برای یادگیری الگوهای مربوط بودن استفاده میکند. هدف از این مرحله، ایجاد یک معیار اولیه و قابل اعتماد برای سنجش ارتباط محصولات با درخواستهای کاربران است. پس از آن، تیم توسعه با استفاده از رویکردی به نام "هماهنگی در مدلهای تقویتی" (GRPO) بر پایه یک مدل پاداش با ابعاد 8 میلیارد، فرآیند ارزیابی و اصلاح مدل را انجام میدهد. این مدل پاداش به صورت همزمان کیفیت توضیحات و صحت برچسبها را ارزیابی میکند، تا اطمینان حاصل شود که مدل نه تنها مرتبط بودن را تشخیص میدهد، بلکه توضیحات منطقی و قابل قبول نیز ارائه میدهد.
نتیجه نهایی، گزارش ارزیابی مرتبط بودن نمره NDCG است که به صورت خودکار تولید میشود. این گزارش با نمونههای دستی و انسانی مقایسه شده و تفاوتی کمتر از 1 درصد دارد. مهمتر اینکه، این فرآیند خودکار هزینهای حدود 30 درصد کمتر از ارزیابیهای دستی دارد و در عین حال دقت و اعتمادپذیری همچنان حفظ شده است. این پیشرفتها نشان میدهد که استفاده از فناوریهای هوشمند در بهبود فرآیندهای کسبوکار، میتواند تاثیر چشمگیری در کاهش هزینهها و ارتقاء کیفیت خدمات داشته باشد.
در نتیجه، بهرهگیری از مدلهای زبان بزرگ و فناوریهای نوین در حوزه ارزیابی کیفیت محصولات، فرصتهای بینظیری را برای شرکتهای تجارت الکترونیک فراهم میکند تا بتوانند تجربه مصرفکننده را بهبود بخشند و روند تصمیمگیری در فرآیند جستجو را هوشمندانهتر و کارآمدتر سازند.
#هوش_مصنوعی #یادگیری_ماشین #فناوری_پیشرفته #تجارت_الکترونیک
🟣لینک مقاله:
https://blog.flipkart.tech/llms-for-relevance-automating-high-quality-product-relevance-labeling-in-flipkart-search-ddd5ca50b584?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Medium
LLMs for Relevance: Automating High-Quality Product Relevance Labeling in Flipkart Search
Amey Patil , Shreya Malani· November 2025
🔵 عنوان مقاله
COUNT(DISTINCT) Too Slow? A Guide to Fast Approximations
🟢 خلاصه مقاله:
در دنیای پایگاههای داده، عملیات شمارش تعداد رکوردهای منحصر به فرد یکی از نیازهای رایج است که ممکن است با حجم بالای دادهها، به صورت سنتی و مستقیم سرعت پایینتری داشته باشد. در این مقاله، به بررسی روشهای مختلف برای انجام این عملیات با کارایی بالا میپردازیم، از جمله ابزارهایی مانند TABLESAMPLE، ساختارهای هیویت یا HLL و نیز کتابخانههای پیشرفته مانند Apache DataSketches.
در طی این راهنما، نگاهی دقیق و عملی به قدرتهای تقریبی و نمونهگیری در سیستمهای مبتنی بر PostgreSQL خواهیم داشت. هدف ارائه راهکارهای سریعتر در سناریوهایی است که نیاز به تخمین سریع تعداد رکوردهای یکتا وجود دارد، به خصوص در جداول بسیار بزرگ، مانند جدولی با ده میلیون رکورد که در آزمایشها مورد ارزیابی قرار گرفت. این روشها مزایا و معایب خود را دارند و در کنار مقایسه عملکردی، ویژگیهای هر کدام را بررسی میکنیم تا بتوانید بهترین ابزار را بر اساس نیازهای خاص پروژه خود انتخاب کنید.
گامهای مختلف این راهنما، شما را با روشهای تقریبی آشنا میکند و نشان میدهد چگونه میتوانید بدون نیاز به شمارش دقیق، نتایجی قابل اعتماد و سریع بدست آورید که به تصمیمگیریهای شما کمک کند و به طور قابل توجهی زمان انجام عملیات را کاهش دهد.
#پایگاه_داده #بزرگ_داده #تقریبی #پستگرس
🟣لینک مقاله:
https://www.snowflake.com/en/blog/engineering/postgres-count-distinct-approximation/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
COUNT(DISTINCT) Too Slow? A Guide to Fast Approximations
🟢 خلاصه مقاله:
در دنیای پایگاههای داده، عملیات شمارش تعداد رکوردهای منحصر به فرد یکی از نیازهای رایج است که ممکن است با حجم بالای دادهها، به صورت سنتی و مستقیم سرعت پایینتری داشته باشد. در این مقاله، به بررسی روشهای مختلف برای انجام این عملیات با کارایی بالا میپردازیم، از جمله ابزارهایی مانند TABLESAMPLE، ساختارهای هیویت یا HLL و نیز کتابخانههای پیشرفته مانند Apache DataSketches.
در طی این راهنما، نگاهی دقیق و عملی به قدرتهای تقریبی و نمونهگیری در سیستمهای مبتنی بر PostgreSQL خواهیم داشت. هدف ارائه راهکارهای سریعتر در سناریوهایی است که نیاز به تخمین سریع تعداد رکوردهای یکتا وجود دارد، به خصوص در جداول بسیار بزرگ، مانند جدولی با ده میلیون رکورد که در آزمایشها مورد ارزیابی قرار گرفت. این روشها مزایا و معایب خود را دارند و در کنار مقایسه عملکردی، ویژگیهای هر کدام را بررسی میکنیم تا بتوانید بهترین ابزار را بر اساس نیازهای خاص پروژه خود انتخاب کنید.
گامهای مختلف این راهنما، شما را با روشهای تقریبی آشنا میکند و نشان میدهد چگونه میتوانید بدون نیاز به شمارش دقیق، نتایجی قابل اعتماد و سریع بدست آورید که به تصمیمگیریهای شما کمک کند و به طور قابل توجهی زمان انجام عملیات را کاهش دهد.
#پایگاه_داده #بزرگ_داده #تقریبی #پستگرس
🟣لینک مقاله:
https://www.snowflake.com/en/blog/engineering/postgres-count-distinct-approximation/
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Snowflake
Postgres COUNT(DISTINCT) Too Slow? Fast Approximation Guide
Learn how to replace slow Postgres COUNT(DISTINCT) queries using TABLESAMPLE, HyperLogLog, and Apache DataSketches for sub-millisecond analytics.
🔵 عنوان مقاله
Asynchronous I/O in DuckDB: Work, Thread, Work (12 minute read)
🟢 خلاصه مقاله:
در داکدیبی، یکی از بهروزرسانیهای مهم، افزودن ورودی و خروجی غیرهمزمان (asychronous I/O) است. هدف اصلی از این تغییر، این است که نخهای کاری که وظیفه خواندن فایلهای پارکت و CSV بر بستر S3 را دارند، دیگر در حین عملیات مسدود نشوند و در نتیجه عملیاتهای کاربردی همزمان و کارآمدتری را تجربه کنند.
در طراحی جدید، بخشبندی بین عملیاتهای غیرهمزمان و استخرهای نخهای کاری به گونهای صورت گرفته است که هر کدام مستقل عمل میکنند. علاوه بر این، ویژگیهای پیشخوانی (read-ahead) و مدیریت حافظه (memory governance) به سیستم افزوده شده است تا کارایی و کنترل بر عملیاتهای دادهها به صورت بهتری صورت گیرد. نتیجه این بهروزرسانیها، بهبودهای چشمگیری در عملکرد است؛ مثلا، زمان اجرای پرسوجوی TPC-H Q6 روی دادههای ۲۲ گیگابایتی در قالب فایل پارکت، کاهش قابل توجهی از ۸.۲۳ ثانیه به ۲.۸۴ ثانیه پیدا کرد. همچنین، زمان اسکن کردن فایلهای CSV بزرگ تقریباً بیست برابر سریعتر شد، که نشاندهنده افزایش چشمگیر کارایی در پردازش دادههای حجیم است. این تغییرات، توانسته است موجب بهبود قابل توجه عملکرد سیستم در مواجهه با حجم بالای دادهها در بستر ابر و فضاهای ذخیرهسازی ابری شوند.
#دکتابی #ورودی_خروجی #پایگاه_داده #بهبود_عملکرد
🟣لینک مقاله:
https://duckdb.org/2026/07/31/asynchronous-io.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Asynchronous I/O in DuckDB: Work, Thread, Work (12 minute read)
🟢 خلاصه مقاله:
در داکدیبی، یکی از بهروزرسانیهای مهم، افزودن ورودی و خروجی غیرهمزمان (asychronous I/O) است. هدف اصلی از این تغییر، این است که نخهای کاری که وظیفه خواندن فایلهای پارکت و CSV بر بستر S3 را دارند، دیگر در حین عملیات مسدود نشوند و در نتیجه عملیاتهای کاربردی همزمان و کارآمدتری را تجربه کنند.
در طراحی جدید، بخشبندی بین عملیاتهای غیرهمزمان و استخرهای نخهای کاری به گونهای صورت گرفته است که هر کدام مستقل عمل میکنند. علاوه بر این، ویژگیهای پیشخوانی (read-ahead) و مدیریت حافظه (memory governance) به سیستم افزوده شده است تا کارایی و کنترل بر عملیاتهای دادهها به صورت بهتری صورت گیرد. نتیجه این بهروزرسانیها، بهبودهای چشمگیری در عملکرد است؛ مثلا، زمان اجرای پرسوجوی TPC-H Q6 روی دادههای ۲۲ گیگابایتی در قالب فایل پارکت، کاهش قابل توجهی از ۸.۲۳ ثانیه به ۲.۸۴ ثانیه پیدا کرد. همچنین، زمان اسکن کردن فایلهای CSV بزرگ تقریباً بیست برابر سریعتر شد، که نشاندهنده افزایش چشمگیر کارایی در پردازش دادههای حجیم است. این تغییرات، توانسته است موجب بهبود قابل توجه عملکرد سیستم در مواجهه با حجم بالای دادهها در بستر ابر و فضاهای ذخیرهسازی ابری شوند.
#دکتابی #ورودی_خروجی #پایگاه_داده #بهبود_عملکرد
🟣لینک مقاله:
https://duckdb.org/2026/07/31/asynchronous-io.html?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
DuckDB
Asynchronous I/O in DuckDB: Work, Thread, Work
Starting with v2.0, scheduled for fall 2026, DuckDB will support asynchronous reads of Parquet and CSV files. This can significantly speed up queries when synchronous I/O does not saturate the available bandwidth, as is typical in EC2/S3 compute-storage setups.
🔵 عنوان مقاله
PGSimCity (Tool)
🟢 خلاصه مقاله:
اسنادی که درباره PGSimCity صحبت میکند، یک شبیهساز آموزشی تعاملی است که نحوه عملکرد پایگاه دادههای PostgreSQL را به شکل یک شهر سهبعدی نمایش میدهد. این ابزار قدرتمند به کاربران امکان میدهد تا با تنظیم میزان بار کاری و شبیهسازی سناریوهای مختلف، نحوه واکنش سیستمهای داخلی PostgreSQL را مشاهده کنند.
در این محیط، میتوان رویدادهایی مانند طوفانهای checkpoint، ویرانشدن کش، بلوکه شدنهای خودکار، تجمع قفلها و تأخیر در تکرارپذیری دادهها را فعال کرد تا وضعیت سیستم و تأثیر آن بر کارایی پایگاه داده به درستی دیده شود. این تجربه آموزشی به توسعهدهندگان و مدیران سیستم کمک میکند تا بهتر درک کنند که چگونه سیستمهای داخلی PostgreSQL در مقابل فشارهای مختلف واکنش نشان میدهند و چه راهکارهایی برای بهبود کارایی و پایداری آن وجود دارد.
این ابزار، با ترسیم تصویری واقعی و بصری از رفتار داخلی پایگاه داده، یک فرصت بینظیر برای آموزش و آزمون است. دانشپذیران میتوانند بدون نگرانی از تأثیرات منفی بر سیستمهای زنده، روندهای مختلف را تست و تحلیل کنند و بر مبنای آن استراتژیهای بهبود عملکرد تدوین نمایند.
#پایگاهداده #پستگرسکوال #شبیهسازی #آموزش
🟣لینک مقاله:
https://nikolays.github.io/PGSimCity/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
PGSimCity (Tool)
🟢 خلاصه مقاله:
اسنادی که درباره PGSimCity صحبت میکند، یک شبیهساز آموزشی تعاملی است که نحوه عملکرد پایگاه دادههای PostgreSQL را به شکل یک شهر سهبعدی نمایش میدهد. این ابزار قدرتمند به کاربران امکان میدهد تا با تنظیم میزان بار کاری و شبیهسازی سناریوهای مختلف، نحوه واکنش سیستمهای داخلی PostgreSQL را مشاهده کنند.
در این محیط، میتوان رویدادهایی مانند طوفانهای checkpoint، ویرانشدن کش، بلوکه شدنهای خودکار، تجمع قفلها و تأخیر در تکرارپذیری دادهها را فعال کرد تا وضعیت سیستم و تأثیر آن بر کارایی پایگاه داده به درستی دیده شود. این تجربه آموزشی به توسعهدهندگان و مدیران سیستم کمک میکند تا بهتر درک کنند که چگونه سیستمهای داخلی PostgreSQL در مقابل فشارهای مختلف واکنش نشان میدهند و چه راهکارهایی برای بهبود کارایی و پایداری آن وجود دارد.
این ابزار، با ترسیم تصویری واقعی و بصری از رفتار داخلی پایگاه داده، یک فرصت بینظیر برای آموزش و آزمون است. دانشپذیران میتوانند بدون نگرانی از تأثیرات منفی بر سیستمهای زنده، روندهای مختلف را تست و تحلیل کنند و بر مبنای آن استراتژیهای بهبود عملکرد تدوین نمایند.
#پایگاهداده #پستگرسکوال #شبیهسازی #آموزش
🟣لینک مقاله:
https://nikolays.github.io/PGSimCity/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
PGSimCity
PGSimCity · How PostgreSQL Works, in 3D
An independent, non-commercial educational visualization of PostgreSQL internals. Not affiliated with Electronic Arts.
🔵 عنوان مقاله
The Mean Means Nothing (9 minute read)
🟢 خلاصه مقاله:
در یک مطالعه اخیر، مشخص شد که اجرای سرویسهای وب با تاخیر نشان میدهد که میانگین زمان پاسخدهی در بازه زمانی مورد بررسی، ۹ درصد افزایش یافته است. در حالی که در همان دادهها، میانه یا مقدار وسط پاسخها، کاهش قابل توجهی معادل ۴۶ درصد را تجربه کرده است. همچنین، شاخص p99 یا نود و نهمین درصد، با افزایش چشمگیر ۱۱۹ درصد روبهرو شده است. این تفاوتها نشان میدهد که تکیه بر تنها یک شاخص آماری میتواند تصویری نادرست از وضعیت واقعی ارائه دهد، زیرا این دستهبندیها ممکن است توزیع دادهها را مخفی کند و نشاندهنده همزمان بودن حالتهای مختلف باشد.
برای درک بهتر این پدیده، تحلیلهای تکمیلی مانند نمودارهای چگالی، توزیع تجمعی، شاخصهای شیفت و نقشههای شیبدار مورد استفاده قرار گرفتند. این ابزارها کمک کردند تا الگوهای توزیع_RESPONSE به شکل دقیقتری مشاهده و تحلیل شوند. نتیجه هریک از این روشها نشان داد که اندازه پاسخها یا همان حجم پاسخهای دریافتشده، علت اصلی تفاوتها و رفتارهای غیرمنتظره در دادهها است. در نهایت، این تحلیلها نشان دادند که تمرکز روی یک شاخص واحد مانند میانگین، ممکن است کلیت وضعیت را نادیده گرفته و تصویری نادرست از عملکرد سیستم ارائه کند.
در نتیجه، تحلیل جامع و چند وجهی دادهها اهمیت زیادی دارد و تنها اتکا به یک معیار باعث فهم ناقص و گمراهکننده در مسائل مربوط به عملکرد سرویسهای وب میشود. این مطالعه بر اهمیت استفاده از ابزارهای تحلیلی متنوع تاکید دارد که میتوانند جزئیات مهم را که در نگاه اول دیده نمیشوند، آشکار سازند.
#تجزیه_و_تحلیل #سرویس_وب #توزیع_دادهها #بهبود_عملکرد
🟣لینک مقاله:
https://fzakaria.com/2026/07/27/the-mean-means-nothing?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
The Mean Means Nothing (9 minute read)
🟢 خلاصه مقاله:
در یک مطالعه اخیر، مشخص شد که اجرای سرویسهای وب با تاخیر نشان میدهد که میانگین زمان پاسخدهی در بازه زمانی مورد بررسی، ۹ درصد افزایش یافته است. در حالی که در همان دادهها، میانه یا مقدار وسط پاسخها، کاهش قابل توجهی معادل ۴۶ درصد را تجربه کرده است. همچنین، شاخص p99 یا نود و نهمین درصد، با افزایش چشمگیر ۱۱۹ درصد روبهرو شده است. این تفاوتها نشان میدهد که تکیه بر تنها یک شاخص آماری میتواند تصویری نادرست از وضعیت واقعی ارائه دهد، زیرا این دستهبندیها ممکن است توزیع دادهها را مخفی کند و نشاندهنده همزمان بودن حالتهای مختلف باشد.
برای درک بهتر این پدیده، تحلیلهای تکمیلی مانند نمودارهای چگالی، توزیع تجمعی، شاخصهای شیفت و نقشههای شیبدار مورد استفاده قرار گرفتند. این ابزارها کمک کردند تا الگوهای توزیع_RESPONSE به شکل دقیقتری مشاهده و تحلیل شوند. نتیجه هریک از این روشها نشان داد که اندازه پاسخها یا همان حجم پاسخهای دریافتشده، علت اصلی تفاوتها و رفتارهای غیرمنتظره در دادهها است. در نهایت، این تحلیلها نشان دادند که تمرکز روی یک شاخص واحد مانند میانگین، ممکن است کلیت وضعیت را نادیده گرفته و تصویری نادرست از عملکرد سیستم ارائه کند.
در نتیجه، تحلیل جامع و چند وجهی دادهها اهمیت زیادی دارد و تنها اتکا به یک معیار باعث فهم ناقص و گمراهکننده در مسائل مربوط به عملکرد سرویسهای وب میشود. این مطالعه بر اهمیت استفاده از ابزارهای تحلیلی متنوع تاکید دارد که میتوانند جزئیات مهم را که در نگاه اول دیده نمیشوند، آشکار سازند.
#تجزیه_و_تحلیل #سرویس_وب #توزیع_دادهها #بهبود_عملکرد
🟣لینک مقاله:
https://fzakaria.com/2026/07/27/the-mean-means-nothing?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Farid Zakaria’s Blog
The mean means nothing
I was recently trying to validate some performance improvements related to lld at $DAYJOB and it was a little frustrating to see the improvements in our benchmarks but not in the live-production dashboards.
🔵 عنوان مقاله
Prototype on a laptop, scale to 16 billion rows: one Polars query (14 minute read)
🟢 خلاصه مقاله:
در فرایند توسعه و آزمایش، تیمها میتوانند با استفاده از پروتوتایپسازی در لپتاپ، نمونه دادههای نماینده را بررسی و آزمایش کنند. این کار به آنان امکان میدهد تا در مرحله اولیه، با حجم کوچکتری از دادهها، الگوها و روندها را شناسایی و بهبود دهند. پس از تکمیل مراحل توسعه، همان کوئریهای LazyFrame میتوانند به سادگی در بستر ابری روی ۱۶ میلیارد ردیف داده اجرا شوند، بدون نیاز به بازنویسی یا تغییر در منطق پردازش. این قابلیت، صرفهجویی قابل توجهی در زمان و تلاش را فراهم میکند و تفاوتی نمیگذارد که دادهها کوچک باشد یا عظیم، همگی با همان کدهای برتر قابل اجرا هستند.
پروتکل توسعه دادههای خام Polymarket در قالب فایلهای کوچک Parquet در سرویس S3 ذخیره میشود. این پیشپردازش به سیستم امکان میدهد تا دادهها را به صورت خلاصه و دستهبندی شده درآورد و حجم قابلمقایسهای از اطلاعات برای تجزیه و تحلیلهای سریع آماده کند. این رویکرد، باعث میشود داشبوردهای تعاملی مبتنی بر Plotly Dash بتوانند همیشه سریع و پاسخگو باقی بمانند، بدون نیاز به اسکن کامل مجموعه دادهها در هر بار درخواست. نتیجه نهایی، همزمانی میان توسعه محلی و اجرای در مقیاس بزرگ است که سرعت و کارایی را تضمین میکند، در حالی که کاربر نهایی تجربهای بینظیر کسب میکند.
در مجموع، این امکانات نشان میدهد که چگونه فناوریهای نوین مانند Polars و Uniting با زیرساختهای ابری، تحولی در روند تجزیه و تحلیل دادهها ایجاد کردهاند. تیمها اکنون میتوانند با آرامش خاطر، پروژههای بزرگ را با همان سرعت و انعطافپذیری نمونههای کوچک، مدیریت و اجرا کنند و بهرهوری خود را به طور چشمگیری افزایش دهند.
#تحلیل_داده #ابزارهای_پیشرفته #پایگاه_داده #هوش_مصنوعی
🟣لینک مقاله:
https://pola.rs/posts/market-data-to-plotly-enterprise-dashboard/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Prototype on a laptop, scale to 16 billion rows: one Polars query (14 minute read)
🟢 خلاصه مقاله:
در فرایند توسعه و آزمایش، تیمها میتوانند با استفاده از پروتوتایپسازی در لپتاپ، نمونه دادههای نماینده را بررسی و آزمایش کنند. این کار به آنان امکان میدهد تا در مرحله اولیه، با حجم کوچکتری از دادهها، الگوها و روندها را شناسایی و بهبود دهند. پس از تکمیل مراحل توسعه، همان کوئریهای LazyFrame میتوانند به سادگی در بستر ابری روی ۱۶ میلیارد ردیف داده اجرا شوند، بدون نیاز به بازنویسی یا تغییر در منطق پردازش. این قابلیت، صرفهجویی قابل توجهی در زمان و تلاش را فراهم میکند و تفاوتی نمیگذارد که دادهها کوچک باشد یا عظیم، همگی با همان کدهای برتر قابل اجرا هستند.
پروتکل توسعه دادههای خام Polymarket در قالب فایلهای کوچک Parquet در سرویس S3 ذخیره میشود. این پیشپردازش به سیستم امکان میدهد تا دادهها را به صورت خلاصه و دستهبندی شده درآورد و حجم قابلمقایسهای از اطلاعات برای تجزیه و تحلیلهای سریع آماده کند. این رویکرد، باعث میشود داشبوردهای تعاملی مبتنی بر Plotly Dash بتوانند همیشه سریع و پاسخگو باقی بمانند، بدون نیاز به اسکن کامل مجموعه دادهها در هر بار درخواست. نتیجه نهایی، همزمانی میان توسعه محلی و اجرای در مقیاس بزرگ است که سرعت و کارایی را تضمین میکند، در حالی که کاربر نهایی تجربهای بینظیر کسب میکند.
در مجموع، این امکانات نشان میدهد که چگونه فناوریهای نوین مانند Polars و Uniting با زیرساختهای ابری، تحولی در روند تجزیه و تحلیل دادهها ایجاد کردهاند. تیمها اکنون میتوانند با آرامش خاطر، پروژههای بزرگ را با همان سرعت و انعطافپذیری نمونههای کوچک، مدیریت و اجرا کنند و بهرهوری خود را به طور چشمگیری افزایش دهند.
#تحلیل_داده #ابزارهای_پیشرفته #پایگاه_داده #هوش_مصنوعی
🟣لینک مقاله:
https://pola.rs/posts/market-data-to-plotly-enterprise-dashboard/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Polars
Prototype on a laptop, scale to 16 billion rows: one Polars query
Explore a subset of Polymarket orderbook data locally, then run the exact same Polars query on 16 billion rows with Polars Cloud and serve it with Plotly Dash.
🔵 عنوان مقاله
Encoding or Compression: Why not both? (9 minute read)
🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات، مفهوم «کدگذاری» و «فشردهسازی» نقش مهمی در بهینهسازی عملکرد سیستمها دارند. کدگذاری، فناوریای است که امکان اجرای پرسوجوهای تحلیلی را سریعتر و موثرتر میکند، در حالی که فشردهسازی عمدتاً برای کاهش حجم دادههای ذخیرهسازی به کار میرود. این دو تکنیک در عین تفاوت در کاربردشان، میتوانند مکمل یکدیگر باشند و استفاده همزمان از هر دو، کارایی سیستمهای اطلاعاتی را به طور قابل توجهی بهبود بخشد.
در فرآیندهای کدگذاری، روشهایی مانند کدگذاری دیکشنری و قالب مرجع (frame-of-reference) به منظور سرعت بخشیدن به مقایسهها و عملیات SIMD طراحی شدهاند. این فناوریها امکان مقایسه سریع، حذف دادههای غیر ضروری و بهینهسازی عملیات محاسباتی را فراهم میآورند. به عنوان نمونه، نتایج بهدست آمده از سیستم CedarDB نشان میدهد که اولین قدم همواره باید کدگذاری دادهها باشد، و تنها زمانی که صرفهجویی در فضای دیسک قابل توجه باشد، افزودن تکنولوژیهایی مانند zstd منطقی است.
بنابراین، استراتژی ایدهآل در مدیریت دادهها ممکن است استفاده همزمان از هر دو روش باشد؛ ابتدا دادهها را کدگذاری کنیم تا عملیات پردازشی سریعتر انجام شود و در صورت نیاز، آنها را با فشردهسازی مناسب، برای صرفهجویی در فضای ذخیرهسازی، کاهش دهیم. این رویکرد انعطافپذیر و اقتصادی، به سازمانها کمک میکند تا بهترین بهرهبرداری را از منابع خود داشته باشند و عملکرد سیستمهای دادهای خود را ارتقاء دهند.
#فشردهسازی #کدگذاری #مدیریت_داده #بهینهسازی
🟣لینک مقاله:
https://cedardb.com/blog/encoding_vs_compression/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Encoding or Compression: Why not both? (9 minute read)
🟢 خلاصه مقاله:
در دنیای فناوری اطلاعات، مفهوم «کدگذاری» و «فشردهسازی» نقش مهمی در بهینهسازی عملکرد سیستمها دارند. کدگذاری، فناوریای است که امکان اجرای پرسوجوهای تحلیلی را سریعتر و موثرتر میکند، در حالی که فشردهسازی عمدتاً برای کاهش حجم دادههای ذخیرهسازی به کار میرود. این دو تکنیک در عین تفاوت در کاربردشان، میتوانند مکمل یکدیگر باشند و استفاده همزمان از هر دو، کارایی سیستمهای اطلاعاتی را به طور قابل توجهی بهبود بخشد.
در فرآیندهای کدگذاری، روشهایی مانند کدگذاری دیکشنری و قالب مرجع (frame-of-reference) به منظور سرعت بخشیدن به مقایسهها و عملیات SIMD طراحی شدهاند. این فناوریها امکان مقایسه سریع، حذف دادههای غیر ضروری و بهینهسازی عملیات محاسباتی را فراهم میآورند. به عنوان نمونه، نتایج بهدست آمده از سیستم CedarDB نشان میدهد که اولین قدم همواره باید کدگذاری دادهها باشد، و تنها زمانی که صرفهجویی در فضای دیسک قابل توجه باشد، افزودن تکنولوژیهایی مانند zstd منطقی است.
بنابراین، استراتژی ایدهآل در مدیریت دادهها ممکن است استفاده همزمان از هر دو روش باشد؛ ابتدا دادهها را کدگذاری کنیم تا عملیات پردازشی سریعتر انجام شود و در صورت نیاز، آنها را با فشردهسازی مناسب، برای صرفهجویی در فضای ذخیرهسازی، کاهش دهیم. این رویکرد انعطافپذیر و اقتصادی، به سازمانها کمک میکند تا بهترین بهرهبرداری را از منابع خود داشته باشند و عملکرد سیستمهای دادهای خود را ارتقاء دهند.
#فشردهسازی #کدگذاری #مدیریت_داده #بهینهسازی
🟣لینک مقاله:
https://cedardb.com/blog/encoding_vs_compression/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Cedardb
Encoding or Compression: Why not both?
CedarDB is a database system that delivers unmatched performance for transactions and analytics, from small writes to handling billions of rows. Built on cutting-edge research to power today’s tools and tomorrow’s challenges.
🔵 عنوان مقاله
Kafka App? There's a Skill for That (9 minute read)
🟢 خلاصه مقاله:
کافکا اپ؟ مهارتی برای آن وجود دارد
گروه Etsy با توسعه مهارتهای Claude Code برای هفت فرآیند جریان داده در کافکا، نشان داد که میتوان فناوریهای نوین را در زمینه مدیریت دادههای بزرگ و جریانساز بهکار گرفت. این مهارتها به طور خاص برای فرآیندهای حیاتی مانند تولید ویژگیهای یادگیری ماشین، ساختن بردارهای تعبیه شده (embeddings) و پیادهسازی پایپلاینهای توزیعشده طراحی شدهاند. هدف از این اقدام، سادهسازی و بهبود کارایی عملیاتهای مربوط به دادههای بزرگ در زمینههای مختلف است.
شرکت Etsy در این پروژه تلاش کرده است که با بهرهگیری از مهارتهای کلاود و ابزارهای هوشمند، فرآیندهای جریان داده خود را به صورت موثر و سریع مدیریت کند. این فناوریها امکان تولید ویژگیهای مورد نیاز برای آموزش مدلهای یادگیری ماشین، ساخت بردارهای تعبیه شده برای درک بهتر محتوای دادهها، و همچنین توزیع دادهها به صورت همزمان در بخشهای مختلف کسبوکار را فراهم میآورند. نتیجه نهایی، فرآیندی است که به شرکتها امکان میدهد دادههای خود را بهتر، سریعتر و هوشمندانهتر مدیریت کنند.
در مجموع، این توسعه نشان میدهد که مهارتهای برنامهنویسی و فناوریهای نوین میتوانند در حوزههای مختلف صنعت، از جمله تولید محتوا، تجارت الکترونیک و هوش مصنوعی، تاثیرگذار باشند و فرآیندهای پیچیده را ساده کنند. به کارگیری چنین فناوریهایی، آیندهای نویدبخش در زمینه مدیریت هوشمند دادهها را نوید میدهد.
#کافکا #هوش_مصنوعی #مدیریت_داده #فناوری
🟣لینک مقاله:
https://www.etsy.com/codeascraft/kafka-app-thereas-a-skill-for-that?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Kafka App? There's a Skill for That (9 minute read)
🟢 خلاصه مقاله:
کافکا اپ؟ مهارتی برای آن وجود دارد
گروه Etsy با توسعه مهارتهای Claude Code برای هفت فرآیند جریان داده در کافکا، نشان داد که میتوان فناوریهای نوین را در زمینه مدیریت دادههای بزرگ و جریانساز بهکار گرفت. این مهارتها به طور خاص برای فرآیندهای حیاتی مانند تولید ویژگیهای یادگیری ماشین، ساختن بردارهای تعبیه شده (embeddings) و پیادهسازی پایپلاینهای توزیعشده طراحی شدهاند. هدف از این اقدام، سادهسازی و بهبود کارایی عملیاتهای مربوط به دادههای بزرگ در زمینههای مختلف است.
شرکت Etsy در این پروژه تلاش کرده است که با بهرهگیری از مهارتهای کلاود و ابزارهای هوشمند، فرآیندهای جریان داده خود را به صورت موثر و سریع مدیریت کند. این فناوریها امکان تولید ویژگیهای مورد نیاز برای آموزش مدلهای یادگیری ماشین، ساخت بردارهای تعبیه شده برای درک بهتر محتوای دادهها، و همچنین توزیع دادهها به صورت همزمان در بخشهای مختلف کسبوکار را فراهم میآورند. نتیجه نهایی، فرآیندی است که به شرکتها امکان میدهد دادههای خود را بهتر، سریعتر و هوشمندانهتر مدیریت کنند.
در مجموع، این توسعه نشان میدهد که مهارتهای برنامهنویسی و فناوریهای نوین میتوانند در حوزههای مختلف صنعت، از جمله تولید محتوا، تجارت الکترونیک و هوش مصنوعی، تاثیرگذار باشند و فرآیندهای پیچیده را ساده کنند. به کارگیری چنین فناوریهایی، آیندهای نویدبخش در زمینه مدیریت هوشمند دادهها را نوید میدهد.
#کافکا #هوش_مصنوعی #مدیریت_داده #فناوری
🟣لینک مقاله:
https://www.etsy.com/codeascraft/kafka-app-thereas-a-skill-for-that?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Etsy Engineering
Etsy Engineering | Kafka App? There’s a Skill for That
Etsy is home to over 100 million listings from 5.6 million active sellers. Because the items for sale are unique and creative,...
🔵 عنوان مقاله
WeatherNext: AI model achieves breakthrough in forecasting cyclones (9 minute read)
🟢 خلاصه مقاله:
در دنیای پیشبینی وضع هوا، مدل هوشمند WeatherNext توانسته است تحولی چشمگیر ایجاد کند. این سیستم پیشرفته قادر است مسیرهای چرخندهای هوایی، شدت آنها و سرعت بادهای مرتبط را با دقت بالا و بیش از یک روز زودتر از مدلهای مرسوم پیشبینی کند. در حقیقت، این فناوری جدید باعث میشود که روابط بحرانی و رویدادهای خطرناک در مدت زمان بیشتری قابل پیشبینی باشند، و این امر به نجات جان و مال مردم کمک میکند.
مدل WeatherNext با بهرهگیری از فناوریهای نوین هوش مصنوعی و تجزیه و تحلیل دادههای وسیع، توانسته است در عرصه پیشبینی طوفانهای حارهای پیشرفت قابل توجهی داشته باشد. این سیستم نه تنها مسیر احتمالی چرخندهای هواشناسی را مشخص میکند، بلکه شدت آنها و قدرت بادهای ضمنی را نیز با دقت بالا تخمین میزند. نتیجه این است که مدیران بحران و مراقبتهای اضطراری فرصت بیشتری برای آمادگی و اقدام موثر را پیدا میکنند؛ چیزی که سابق بر این در دسترس نبود.
در مجموع، این فناوری پیشرفته، چشماندازی نوین برای آینده پیشبینیهای جوی ارائه میدهد. با پیشرفتهای مداوم در حوزه هوش مصنوعی، انتظار میرود که دقت این مدلها بهبود بیابد و بر قابلیت پیشبینی رویدادهای طبیعی افزوده شود، و در نتیجه، جامعهها بتوانند بهتر و سریعتر واکنش نشان دهند و آسیبهای ناشی از بلایای طبیعی را کاهش دهند.
#پیش_بینی_طوفان #هوش_مصنوعی #مدیریت_بحران #آینده_پیشبینی
🟣لینک مقاله:
https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
WeatherNext: AI model achieves breakthrough in forecasting cyclones (9 minute read)
🟢 خلاصه مقاله:
در دنیای پیشبینی وضع هوا، مدل هوشمند WeatherNext توانسته است تحولی چشمگیر ایجاد کند. این سیستم پیشرفته قادر است مسیرهای چرخندهای هوایی، شدت آنها و سرعت بادهای مرتبط را با دقت بالا و بیش از یک روز زودتر از مدلهای مرسوم پیشبینی کند. در حقیقت، این فناوری جدید باعث میشود که روابط بحرانی و رویدادهای خطرناک در مدت زمان بیشتری قابل پیشبینی باشند، و این امر به نجات جان و مال مردم کمک میکند.
مدل WeatherNext با بهرهگیری از فناوریهای نوین هوش مصنوعی و تجزیه و تحلیل دادههای وسیع، توانسته است در عرصه پیشبینی طوفانهای حارهای پیشرفت قابل توجهی داشته باشد. این سیستم نه تنها مسیر احتمالی چرخندهای هواشناسی را مشخص میکند، بلکه شدت آنها و قدرت بادهای ضمنی را نیز با دقت بالا تخمین میزند. نتیجه این است که مدیران بحران و مراقبتهای اضطراری فرصت بیشتری برای آمادگی و اقدام موثر را پیدا میکنند؛ چیزی که سابق بر این در دسترس نبود.
در مجموع، این فناوری پیشرفته، چشماندازی نوین برای آینده پیشبینیهای جوی ارائه میدهد. با پیشرفتهای مداوم در حوزه هوش مصنوعی، انتظار میرود که دقت این مدلها بهبود بیابد و بر قابلیت پیشبینی رویدادهای طبیعی افزوده شود، و در نتیجه، جامعهها بتوانند بهتر و سریعتر واکنش نشان دهند و آسیبهای ناشی از بلایای طبیعی را کاهش دهند.
#پیش_بینی_طوفان #هوش_مصنوعی #مدیریت_بحران #آینده_پیشبینی
🟣لینک مقاله:
https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Google DeepMind
AI model achieves breakthrough in forecasting cyclones
WeatherNext enables accurate cyclone forecasts that can give an extra day of warning. Now we are open sourcing the model.
🔵 عنوان مقاله
Validating Data With Pointblank in Python (30 minute read)
🟢 خلاصه مقاله:
در دنیای تحلیل دادهها و مدیریت پایگاههای داده، صحت و معتبر بودن اطلاعات اهمیت بسیار زیادی دارد. یکی از ابزارهای قدرتمند و در عین حال ساده برای اطمینان از کیفیت دادهها، کتابخانه Pointblank در زبان پایتون است. این ابزار به کمک قوانین تعریفشده، آستانههای مختلف و مدیریت خودکار خطاها، فرآیند اعتبارسنجی دادهها را بسیار ساده و موثر میکند. میتوان گفت که Pointblank بیشتر بر اصول کنترل کیفیت، بررسیهای سطح سطر و ارائه گزارشهایی مناسب برای ذینفعان تمرکز دارد، در مقایسه با ابزارهای دیگر مانند Pandera و Great Expectations.
با استفاده از Pointblank، میتوان به راحتی دادههای موجود در منابع مختلفی مانند pandas، Polars، DuckDB و PostgreSQL را اعتبارسنجی کرد. این ابزار با بهرهگیری از قواعد تعریفشده، به کاربران اجازه میدهد تا خطاهای احتمالی در دادهها را به سرعت شناسایی و رفع کنند. علاوه بر این، قابلیتهای مرتبط با محدود کردن خطاها در سطح ردیف، فرآیند مدیریت دادههای ناسازگار و نادرست را بسیار بهبود میبخشد و سیستمهای پایش کیفیت داده را کارآمدتر میسازد. گزارشهای جامع و قابل فهمی که Pointblank تولید میکند، به ذینفعان کمک میکند تا به درک بهتر از وضعیت دادهها برسند و تصمیمگیریهای مبتنی بر دادههای صحیح و سالم را تسهیل کند.
در مجموع، اگر به دنبال ابزاری هستید که فرآیند اعتبارسنجی دادههایتان را سادهتر، دقیقتر و کاراتر کند، Pointblank گزینهای عالی است. این ابزار نه تنها در زمینه کنترل کیفیت دادهها قوی است، بلکه با ارائه گزارشهای شفاف و امکانات سطح پیشرفته، نقش مهمی در تضمین صحت دادههای شما ایفا میکند. استفاده از این ابزار در پروژههای دادهمحور، بهرهوری تیمهای تحلیلگر و مدیران داده را به طور قابل توجهی افزایش میدهد و اطمینان بیشتری از صحت و سلامت دادهها ایجاد میکند.
#کیفیت_داده #پایگاه_داده #اعتبارسنجی_داده #پایتون
🟣لینک مقاله:
https://realpython.com/python-pointblank/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Validating Data With Pointblank in Python (30 minute read)
🟢 خلاصه مقاله:
در دنیای تحلیل دادهها و مدیریت پایگاههای داده، صحت و معتبر بودن اطلاعات اهمیت بسیار زیادی دارد. یکی از ابزارهای قدرتمند و در عین حال ساده برای اطمینان از کیفیت دادهها، کتابخانه Pointblank در زبان پایتون است. این ابزار به کمک قوانین تعریفشده، آستانههای مختلف و مدیریت خودکار خطاها، فرآیند اعتبارسنجی دادهها را بسیار ساده و موثر میکند. میتوان گفت که Pointblank بیشتر بر اصول کنترل کیفیت، بررسیهای سطح سطر و ارائه گزارشهایی مناسب برای ذینفعان تمرکز دارد، در مقایسه با ابزارهای دیگر مانند Pandera و Great Expectations.
با استفاده از Pointblank، میتوان به راحتی دادههای موجود در منابع مختلفی مانند pandas، Polars، DuckDB و PostgreSQL را اعتبارسنجی کرد. این ابزار با بهرهگیری از قواعد تعریفشده، به کاربران اجازه میدهد تا خطاهای احتمالی در دادهها را به سرعت شناسایی و رفع کنند. علاوه بر این، قابلیتهای مرتبط با محدود کردن خطاها در سطح ردیف، فرآیند مدیریت دادههای ناسازگار و نادرست را بسیار بهبود میبخشد و سیستمهای پایش کیفیت داده را کارآمدتر میسازد. گزارشهای جامع و قابل فهمی که Pointblank تولید میکند، به ذینفعان کمک میکند تا به درک بهتر از وضعیت دادهها برسند و تصمیمگیریهای مبتنی بر دادههای صحیح و سالم را تسهیل کند.
در مجموع، اگر به دنبال ابزاری هستید که فرآیند اعتبارسنجی دادههایتان را سادهتر، دقیقتر و کاراتر کند، Pointblank گزینهای عالی است. این ابزار نه تنها در زمینه کنترل کیفیت دادهها قوی است، بلکه با ارائه گزارشهای شفاف و امکانات سطح پیشرفته، نقش مهمی در تضمین صحت دادههای شما ایفا میکند. استفاده از این ابزار در پروژههای دادهمحور، بهرهوری تیمهای تحلیلگر و مدیران داده را به طور قابل توجهی افزایش میدهد و اطمینان بیشتری از صحت و سلامت دادهها ایجاد میکند.
#کیفیت_داده #پایگاه_داده #اعتبارسنجی_داده #پایتون
🟣لینک مقاله:
https://realpython.com/python-pointblank/?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Realpython
Validating Data With Pointblank in Python – Real Python
Learn how to validate data in Python with Pointblank: declare quality checks, split clean from failing rows, and rerun validation plans from YAML.
🔵 عنوان مقاله
Xberg (GitHub Repo)
🟢 خلاصه مقاله:
اینجا یک موتور منبع باز قدرتمند به نام Xberg قرار دارد که توانایی استخراج متن، جداول، متادادهها و دادههای ساختاریافته از بیش از صد فرمت مختلف را داراست. این فرمتها شامل فایلهای PDF، تصاویر، فایلهای صوتی و تصویری، لینکهای وب، آرشیوهای فشرده و کدهای برنامهنویسی میشوند. هسته اصلی این موتور بر پایه زبان برنامهنویسی Rust نوشته شده است که نه تنها از 15 زبان مختلف پشتیبانی میکند، بلکه امکانات متنوعی مانند تشخیص متن از طریق OCR، تبدیل صوت به متن، تولید بردارهای معنایی، استخراج ساختاریافته و قابلیتهای استقرار را در برمیگیرد.
این ابزار قدرتمند با انعطافپذیری بالا امکان استفاده از طریق کتابخانههای کد، خط فرمان، APIهای REST، بستههای مدیریت کانتینر مانند Docker و Helm را فراهم میکند. یعنی توسعهدهندگان و شرکتها میتوانند آن را در پروژههای مختلف با سادهترین راهکارها به کار گیرند و فرآیندهای استخراج اطلاعات را به شکل قابل اعتماد و سریع انجام دهند. بنابراین، Xberg یک راهحل جامع برای نیازهای استخراج داده در حوزههای مختلف فناوری اطلاعات و پردازش متن است.
#استخراج_داده #نرمافزار_منبع_باز #هوش_مصنوعی #پیشرفت_تکنولوژی
🟣لینک مقاله:
https://github.com/xberg-io/xberg?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Xberg (GitHub Repo)
🟢 خلاصه مقاله:
اینجا یک موتور منبع باز قدرتمند به نام Xberg قرار دارد که توانایی استخراج متن، جداول، متادادهها و دادههای ساختاریافته از بیش از صد فرمت مختلف را داراست. این فرمتها شامل فایلهای PDF، تصاویر، فایلهای صوتی و تصویری، لینکهای وب، آرشیوهای فشرده و کدهای برنامهنویسی میشوند. هسته اصلی این موتور بر پایه زبان برنامهنویسی Rust نوشته شده است که نه تنها از 15 زبان مختلف پشتیبانی میکند، بلکه امکانات متنوعی مانند تشخیص متن از طریق OCR، تبدیل صوت به متن، تولید بردارهای معنایی، استخراج ساختاریافته و قابلیتهای استقرار را در برمیگیرد.
این ابزار قدرتمند با انعطافپذیری بالا امکان استفاده از طریق کتابخانههای کد، خط فرمان، APIهای REST، بستههای مدیریت کانتینر مانند Docker و Helm را فراهم میکند. یعنی توسعهدهندگان و شرکتها میتوانند آن را در پروژههای مختلف با سادهترین راهکارها به کار گیرند و فرآیندهای استخراج اطلاعات را به شکل قابل اعتماد و سریع انجام دهند. بنابراین، Xberg یک راهحل جامع برای نیازهای استخراج داده در حوزههای مختلف فناوری اطلاعات و پردازش متن است.
#استخراج_داده #نرمافزار_منبع_باز #هوش_مصنوعی #پیشرفت_تکنولوژی
🟣لینک مقاله:
https://github.com/xberg-io/xberg?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
GitHub
GitHub - xberg-io/xberg: A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured…
A polyglot document intelligence framework with a Rust core. Extract text, metadata, images, and structured data from 101 formats (115 file extensions) plus code intelligence for 371 code languages...
🔵 عنوان مقاله
Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data (37 minute read)
🟢 خلاصه مقاله:
تیتان با هدف تسهیل فرآیند ساخت ساختارهای معنایی تحلیلی، به طور خودکار اسکیمای معنایی را از دادههای رابطهای یا جدولی ایجاد میکند. این سامانه از ترکیب استنتاج معنایی مبتنی بر مدلهای زبانی بزرگ (LLM) و بررسیهای قطعی مانند کلیدها، پیوندها، انواع داده و مقادیر استفاد میکند. در این روند، تنها زمانی از کاربر سوال میپرسد که ابهامی باقی میماند، که این باعث کاهش خطا و افزایش دقت میشود.
در طول آزمایشهای انجامشده بر روی هشت پایگاه داده مختلف، تیتان عملکرد قابل توجهی از خود نشان داد. این سیستم توانست تمامی ارجاعات را پوشش دهد، تمامی ۳۷۵۸ آزمایش بازیابی را با موفقیت انجام دهد و میزان همسویی با نقشهای معنایی را بین ۹۲ تا ۱۰۰ درصد حفظ کند. این موفقیتها نشان دهنده قابلیت اطمینان و کارایی بالای این فناوری در تحلیل و تفسیر دادههای ساختاری است، که میتواند کاربردهای متنوعی در حوزههای هوش مصنوعی، تحلیل داده و پردازش زبان طبیعی داشته باشد.
در نهایت، تیتان یکی از پیشرفتهترین روشهای خودکار برای ساخت ساختارهای معنایی است که، با بهرهگیری از هوش مصنوعی و بررسیهای دقیق، به کاربر امکان میدهد دادهها را به شکلی مؤثر و معنادار تفسیر و تحلیل کند، و به این ترتیب مرزهای فهم انسانی و ماشینی در تحلیل دادهها را نزدیکتر مینماید.
#هوش_مصنوعی #تحلیل_داده #معناشناسی #مدلهای_زبان
🟣لینک مقاله:
https://arxiv.org/abs/2608.06331?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data (37 minute read)
🟢 خلاصه مقاله:
تیتان با هدف تسهیل فرآیند ساخت ساختارهای معنایی تحلیلی، به طور خودکار اسکیمای معنایی را از دادههای رابطهای یا جدولی ایجاد میکند. این سامانه از ترکیب استنتاج معنایی مبتنی بر مدلهای زبانی بزرگ (LLM) و بررسیهای قطعی مانند کلیدها، پیوندها، انواع داده و مقادیر استفاد میکند. در این روند، تنها زمانی از کاربر سوال میپرسد که ابهامی باقی میماند، که این باعث کاهش خطا و افزایش دقت میشود.
در طول آزمایشهای انجامشده بر روی هشت پایگاه داده مختلف، تیتان عملکرد قابل توجهی از خود نشان داد. این سیستم توانست تمامی ارجاعات را پوشش دهد، تمامی ۳۷۵۸ آزمایش بازیابی را با موفقیت انجام دهد و میزان همسویی با نقشهای معنایی را بین ۹۲ تا ۱۰۰ درصد حفظ کند. این موفقیتها نشان دهنده قابلیت اطمینان و کارایی بالای این فناوری در تحلیل و تفسیر دادههای ساختاری است، که میتواند کاربردهای متنوعی در حوزههای هوش مصنوعی، تحلیل داده و پردازش زبان طبیعی داشته باشد.
در نهایت، تیتان یکی از پیشرفتهترین روشهای خودکار برای ساخت ساختارهای معنایی است که، با بهرهگیری از هوش مصنوعی و بررسیهای دقیق، به کاربر امکان میدهد دادهها را به شکلی مؤثر و معنادار تفسیر و تحلیل کند، و به این ترتیب مرزهای فهم انسانی و ماشینی در تحلیل دادهها را نزدیکتر مینماید.
#هوش_مصنوعی #تحلیل_داده #معناشناسی #مدلهای_زبان
🟣لینک مقاله:
https://arxiv.org/abs/2608.06331?utm_source=tldrdata
➖➖➖➖➖➖➖➖
👑 @Database_Academy
arXiv.org
Tytan: Interactive Neurosymbolic Construction of Analytic Semantic...
From natural-language query interfaces to automated report generation, data analysis tools need a description of the data: the real-world entities it contains, which columns function as measures...