Metabase

پشته داده مدرن (به‌روزرسانی شده برای ۲۰۲۱)

تیم متابیستیم متابیس
Sep 30, 2021
پشته داده مدرن (به‌روزرسانی شده برای ۲۰۲۱) Image

مدل‌های کسب‌وکار ابری، منبع باز و SaaS صنعت نرم‌افزار و نحوه تفکر و ساخت محصولات شرکت‌ها را متحول کرده‌اند. امروز، می‌توانیم یک پشته فناوری کامل را در کسری از زمان و هزینه نسبت به قبل راه‌اندازی کنیم. و جای تعجب نیست که این تحولات راه را برای پشته داده مدرن هموار کرده‌اند.

پشته داده مدرن شامل مجموعه‌ای انعطاف‌پذیر از فناوری‌ها است که به کسب‌وکارها کمک می‌کند داده‌های خود را ذخیره، مدیریت و از آنها یاد بگیرند. به طور معمول، پشته‌های داده مدرن بر روی سرویس‌های مبتنی بر ابر ساخته می‌شوند، و به طور فزاینده شامل ابزارهای Low- و No-code هستند که به کاربران امکان کاوش و استفاده از داده را می‌دهند.

پشته داده چیست؟

اصطلاح "پشته داده" از "پشته فناوری" سرچشمه می‌گیرد، ترکیبات بسیار عمدی از فناوری‌های مختلف که مهندسان نرم‌افزار برای ساخت محصولات و سرویس‌ها ترکیب می‌کنند. در حالی که پشته‌های فناوری ممکن است روی انواع موارد استفاده متمرکز باشند، پشته‌های داده به طور خاص برای پشتیبانی از ذخیره‌سازی، مدیریت و دسترسی به داده ساخته می‌شوند. پشته‌های داده به طور معمول توسط شرکت‌هایی که به دنبال استفاده از داده‌های خود در تصمیم‌گیری استراتژیک هستند ساخته می‌شوند.

پشته داده در مقابل پلتفرم داده در مقابل زیرساخت داده

  • پشته داده: مجموعه‌ای از فناوری‌ها و سرویس‌هایی که سازمان‌ها برای ذخیره، مدیریت و دسترسی به داده استفاده می‌کنند. به طور معمول این به عنوان یک فهرست از فناوری‌ها و سرویس‌ها به اشتراک گذاشته می‌شود، اما کار و نظریه پشت یک پشته معین بسیار چندوجهی‌تر از فرمت ساده است.
  • پلتفرم داده: پیاده‌سازی پشته داده شما در زیرساخت، یعنی نحوه اتصال هر یک از فناوری‌ها و سرویس‌های شما به یکدیگر. به طور معمول این به عنوان یک نمودار که زیرساخت زیربنایی را انتزاع می‌کند، اما نشان می‌دهد که چگونه هر جزء با دیگران همکاری می‌کند به اشتراک گذاشته می‌شود.
  • زیرساخت داده: سیستم محاسباتی زیربنایی که پشته داده شما را قدرت می‌دهد. معمولاً به عنوان یک نمودار به اشتراک گذاشته می‌شود، اما با تمرکز بر شبکه‌سازی، منابع سخت‌افزاری و API سطح پایین.

نحوه تکامل پشته داده

سه تغییر عمده در معماری زیرساخت داده زیربنایی راه را برای پشته داده مدرن هموار کرده‌اند، و اساس تعریف آن را تشکیل می‌دهند.

۱. انتقال از on-prem به ابر

پشته‌های داده مدرن به طور معمول از بهبودهای ذخیره‌سازی میزبانی ابری به امنیت و کشسانی بهره می‌برند، اما مهم‌تر از آن برای ذخیره و پردازش تکه‌های بسیار بزرگ داده با هزینه بسیار کم.

۲. تغییر از ETL به ELT

انبارهای داده قبلاً یک گلوگاه بزرگ برای تیم‌های داده بودند. مشتریان عمدتاً از پایگاه‌های داده رابطه‌ای مبتنی بر ردیف به عنوان انبار داده خود استفاده می‌کردند، که برای بارهای کاری تحلیل داده به خوبی مقیاس نمی‌شد، زیرا داده‌های مرتبط را در چندین دیسک یا سرور پخش می‌کند. حتی با فناوری‌هایی مانند Hadoop، کارهای map-reduce هنوز ساعاتی طول می‌کشید تا اجرا شوند و نوشتن و نگهداری آنها بسیار پیچیده بود. علاوه بر این، به دلیل قدرت پردازش محدود در انبارهای داده قدیمی، مهندسان داده قبلاً کارهای تبدیل را قبل از بارگذاری داده می‌نوشتند، که منجر به اصطلاح ETL (Extract-Transform-Load) شد. اکنون، با پیشرفت انبارهای داده ستونی مبتنی بر ابر با عملکرد بالا، مهندسان داده می‌توانند پرس‌وجوهای در مقیاس پتابایت را در عرض چند دقیقه اجرا کنند. با یک پشته داده مدرن، آنها می‌توانند در عرض چند دقیقه تأمین کنند و شروع به بارگذاری داده در انبار داده کنند (ELT، Extract-Load-Transform) و تحلیل‌گران دیگر نیازی به تکیه بر مهندسان برای تبدیل داده ندارند.

۳. ظهور تحلیل‌های خودخدمت برای دموکراتیک کردن کاوش داده

صرف نظر از اندازه شرکت، دانش SQL مشتریان را از دسترسی به داده‌های ذخیره شده در پایگاه‌های داده و انبارها بدون کمک یک تحلیل‌گر محدود می‌کند. به عنوان مثال در یک پشته داده سنتی، یک مدیر حساب که می‌خواهد فهرستی از مشتریانی که از یک منطقه خاص محصول بازدید کرده‌اند نیاز به کمک یک مهندس یا تحلیل‌گر دوستانه برای "کشیدن" داده برای آنها دارد.

شرکت‌ها این گلوگاه را شناسایی کرده‌اند، و از ابزارهای هوش تجاری مانند Metabase برای توانمندسازی همه در سازمان خود برای کاوش و یافتن پاسخ‌های خود از داده استفاده می‌کنند. اکنون، طراحان می‌توانند درباره استفاده از ویژگی‌های خود یاد بگیرند، مدیران اجرایی می‌توانند گزینه‌های استراتژیک را کاوش کنند، و مدیران حساب می‌توانند فروش خود را انجام دهند، همه بدون تکیه بر تحلیل‌گران.

مزایای پشته داده مدرن

ماژولار بودن

چون یک پشته داده مدرن شامل فناوری‌هایی با نقاط اتصال به طور کلی استاندارد است، تیم‌ها می‌توانند بخش‌هایی از پشته را با تکامل نیازهای خود تعویض کنند. این به آنها کمک می‌کند از قفل فروشنده اجتناب کنند، و به تیم امکان رشد پشته خود را با بلوغ نیازهای داده می‌دهد.

سرعت (عملیات و اجرا)

به دلیل محدودیت‌های قدرت پردازش در انبارهای داده قدیمی، خطوط لوله قبلاً ساعاتی طول می‌کشید تا اجرا شوند، اگر نه روزها. امروز، با یک پشته داده مدرن و دسترسی آن به منابع محاسباتی کشسان، همان کار می‌تواند در عرض چند دقیقه انجام شود.

علاوه بر این، به دلیل ماهیت خودکفای اجزای آنها، پشته‌های داده مدرن به طور قابل توجهی سریع‌تر برای راه‌اندازی و تکرار هستند. امروز، یک استارتاپ جوان می‌تواند یک پشته تحلیل برای ردیابی آزمایش‌های خود در عرض چند ساعت بسازد، بدون نیاز به نوشتن یک خط کد—کاری که در یک پشته قدیمی روزها یا هفته‌ها طول می‌کشید.

هزینه

فناوری‌ها و ذخیره‌سازی داده مبتنی بر ابر به طور معمول صرفه‌جویی هزینه قابل توجهی نسبت به همتایان on-premise خود دارند. یک انبار داده on-premise نیاز به پرداخت برای استفاده از سرور برای ۱۰۰٪ از زمان دارد، و مقیاس‌بندی را دشوار یا پرهزینه می‌کند. با انبارهای داده مبتنی بر ابر مانند Redshift، Snowflake و BigQuery، شما فقط برای آنچه استفاده می‌کنید پول می‌پردازید و می‌توانید با بارهای کاری عظیم به طور یکپارچه مقیاس کنید.

اجزای پشته داده مدرن

بیشتر تیم‌ها پشته داده خود را به لایه‌ها سازماندهی می‌کنند—مانند یک کیک. هر تیمی نیاز به پوشش هر لایه ندارد، اما هر کدام نقش منحصر به فردی دارد که به ساخت تا دستور العمل کامل و خوشمزه کمک می‌کند.

به عنوان مثال، یک بنیانگذار انفرادی که فقط سعی می‌کند چند آزمایش را اعتبارسنجی کند احتمالاً به ابزارهای تبدیل پیچیده نیاز ندارد، اما ممکن است به راهی برای اتصال منابع داده خود به یک ابزار تحلیل نیاز داشته باشد.

منبع داده

اینجا جایی است که داده شما از آن می‌آید: می‌تواند پایگاه داده تولید شما (به عنوان مثال PostgreSQL)، لاگ‌های سرور وب شما، یا یک برنامه شخص ثالث مانند Stripe، Zendesk، یا هر محصول دیگری که با آن کار می‌کنید باشد. رایج است که تیم‌ها چندین منبع داده داشته باشند، همه با هم به راه‌حل‌های ذخیره‌سازی داده متمرکز جریان دارند.

ورود داده

اینجا نحوه انتقال و عادی‌سازی داده از منبع داده شما به ذخیره‌سازی داده شما است.

سه شرکت عمده در این فضا عبارتند از: Fivetran، Stitchdata و Segment.

ذخیره‌سازی داده

اینجا جایی است که تمام داده‌های ورودی از منابع داده تجمیع و ذخیره می‌شوند. در پشته‌های داده بالغ معمولاً یک انبار داده است، اما ممکن است فقط یک کپی فقط خواندنی از پایگاه داده شما در شرکت‌های مرحله اولیه باشد.

سه شرکت عمده در این فضا عبارتند از: Snowflake، Amazon Redshift و Google BigQuery.

تبدیل و مدل‌سازی داده

تبدیل و مدل‌سازی داده کمک می‌کند منابع داده مختلف را در مدل‌های کاربرپسند بسته‌بندی کند، تا مشتریان بتوانند این مجموعه‌های ترکیبی را بدون غربال کردن داده خام و حدس زدن درباره آنچه نشان می‌دهند کاوش کنند.

شرکت‌های قابل توجه در این فضا: dbt و Dataform.

تحلیل داده

گاهی اوقات به عنوان "تجسم داده" یا "هوش تجاری" ساده شده، تحلیل داده به کاربران کمک می‌کند داده‌های خود را کاوش کنند و بینش پیدا کنند. این معمولاً شامل ساخت تجسم‌ها یا نمایش‌های دیگر است، و می‌تواند شامل توسعه داشبوردها و ابزارهای دیگر برای نظارت باشد.

تحلیل داده مدرن شامل ابزارهایی برای کمک به کاربران غیرفنی برای کاوش داده بدون نیاز به دانستن SQL است. این آنها را از وابستگی به توسعه‌دهندگان و تحلیل‌گران آزاد می‌کند، و همه را به کاوش و یادگیری از داده تشویق می‌کند.

ما کاملاً متعصب هستیم، اما فکر می‌کنیم Metabase یک گزینه عالی است. می‌توانید اینجا آن را امتحان کنید.

عملیاتی‌سازی داده

همچنین به عنوان "Reverse ETL" شناخته می‌شود، عملیاتی‌سازی داده فرآیند انتقال داده از یک انبار داده به سیستم‌های شخص ثالث برای عملیاتی کردن داده است. به عنوان مثال، همگام‌سازی داده مشتری از انبار شما به نرم‌افزار خدمات مشتری شما تا نمایندگان خط مقدم شما بتوانند بهتر از آنها پشتیبانی کنند.

شرکت‌های قابل توجه در این فضا: Census و Hightouch.

این مقاله فقط نوک کوه یخ است، اما امیدواریم درک واضحی از ویژگی‌ها و مزایای ساخت و کار با پشته‌های داده مدرن به شما بدهد.

درود،

تیم Metabase