گسترش بی‌سابقه رایانش ابری، توسعه مدل‌های زبان بزرگ (LLM) در حوزه هوش مصنوعی و نیاز به پردازش پایگاه‌های داده عظیم و توزیع‌شده، پارادایم‌های سنتی طراحی دیتاسنترها را با چالش‌های جدی مواجه ساخته است. در خط مقدم این تحول، زیرساخت‌های فوق‌همگرا (Hyper-Converged Infrastructure یا HCI) قرار دارند که با تجمیع منابع پردازشی، ذخیره‌سازی و شبکه در قالب یک پلتفرم نرم‌افزارمحور و مقیاس‌پذیر، پیچیدگی‌های عملیاتی را به حداقل رسانده‌اند.

با این حال، افزایش تراکم ماشین‌های مجازی (VM)، کانتینرها و بارهای کاری مبتنی بر کلاسترینگ سبب شده تا گلوگاه‌های عملکردی به تدریج از لایه پردازنده مرکزی (CPU) به زیرسیستم‌های ورودی/خروجی (I/O) و شبکه منتقل شوند. در این مقطع حساس تکنولوژیک، تکامل درایوهای حالت جامد (SSD) مبتنی بر پروتکل NVMe و ارتقای گذرگاه‌های ارتباطی به استانداردهای Peripheral Component Interconnect Express (PCIe) نسل چهارم و پنجم، به ویژه دستاوردهای سیلیکونی و نرم‌افزاری شرکت سامسونگ، نقشی کاتالیزوری در بازتولید توان عملیاتی محیط‌های HCI ایفا کرده است.   

این گزارش به بررسی جامع و عمیق تاثیر استقرار درایوهای SSD سازمانی سامسونگ در نسل‌های PCIe Gen 4 (نظیر خانواده‌های PM9A3 و PM1733) و PCIe Gen 5 (نظیر PM1743، PM9D3a و درایوهای QLC سری BM1743) بر معماری‌های پیشرو HCI، به طور خاص پلتفرم‌های VMware vSAN و Nutanix Cloud Platform می‌پردازد. تحلیل پیش‌رو صرفاً به بازخوانی مشخصات اسمی محدود نبوده و با واکاوی مکانیزم‌های بنیادین، پیامدهای ثانویه و ثالثه این جهش را در ابعاد معماری تک‌لایه، محلی‌سازی داده‌ها، تاب‌آوری سیستم، استراتژی‌های دفع حرارت و در نهایت، بهینه‌سازی ساختار هزینه کل مالکیت (TCO) تفسیر می‌نماید.

تاثیر درایوهای حالت جامد (SSD) PCIe Gen 4-5 سامسونگ در زیرساخت‌های فوق‌همگرا (HCI) تحلیل معماری، عملکرد و TCO

مبانی فیزیکی گذرگاه: کالبدشکافی تفاوت‌های PCIe Gen 4 و PCIe Gen 5 در گره‌های HCI

پیش از ورود به مبحث معماری نرم‌افزاری HCI، تحلیل ظرفیت‌های فیزیکی گذرگاه ارتباطی ضروری است. سازمان PCI-SIG در طراحی PCIe نسل چهارم، نرخ انتقال سیگنال را به ۱۶ گیگاتراکنش بر ثانیه (GT/s) رساند که با استفاده از کدگذاری 128b/130b، پهنای باند دوطرفه‌ای معادل تقریبی ۳۱.۵ گیگابایت بر ثانیه را برای یک اتصال کامل x16 و حدود ۷.۹ گیگابایت بر ثانیه را برای یک اتصال x4 (متداول در درایوهای NVMe) فراهم ساخت. سامسونگ با بهره‌گیری از این بستر، مدل‌هایی نظیر PM9A3 و PM1733 را به بازار عرضه کرد که توانستند نرخ خواندن ترتیبی را در مرز ۷ گیگابایت بر ثانیه تثبیت کنند و مفهوم حافظه‌های کش سنتی را به چالش بکشند.   

با معرفی استاندارد PCIe 5.0، نرخ سیگنال‌دهی بار دیگر بدون تغییر در ساختار کدگذاری پایه، به ۳۲ GT/s دو برابر شد. این جهش به معنای دسترسی به پهنای باند ۱۵.۸ گیگابایت بر ثانیه برای یک اتصال PCIe 5.0 x4 است. اهمیت این ارتقا در گره‌های متراکم HCI زمانی آشکار می‌شود که سرورها همزمان میزبان درایوهای ذخیره‌سازی، شتاب‌دهنده‌های هوش مصنوعی (GPU)، آداپتورهای شبکه (NIC) با سرعت ۱۰۰ الی ۴۰۰ گیگابیت بر ثانیه و واحدهای پردازش داده (DPU) هستند. محدودیت تعداد مسیرهای (Lanes) متصل به پردازنده، همواره یکی از گلوگاه‌های پنهان سرورها بوده است.

با گذرگاه Gen 5، می‌توان به همان پهنای باند قبلی تنها با استفاده از نیمی از مسیرها دست یافت، یا در صورت استفاده از تمام مسیرهای x4، سرعت خواندن ترتیبی را در درایوهایی نظیر PM1743 تا مرز ۱۴ گیگابایت بر ثانیه افزایش داد. این معماری به پردازنده‌های نوین نظیر AMD EPYC سری 9004 (Genoa) و نسل چهارم Intel Xeon Scalable (Sapphire Rapids) اجازه می‌دهد تا بدون ایجاد رقابت برای دسترسی به مسیرهای PCIe، حجم عظیمی از ترافیک شبکه و ذخیره‌سازی را مدیریت کنند.   

تحلیل سبد محصولات سازمانی سامسونگ برای زیرساخت‌های فوق‌همگرا

رویکرد سامسونگ در طراحی SSDهای سازمانی بر پایه‌گذاری تنوعی از محصولات استوار است که نیازهای گوناگون بارهای کاری خواندن‌محور (Read-Intensive) و ترکیبی (Mixed-Use) را در دیتاسنترها پوشش می‌دهد. درک دقیق مشخصات این درایوها برای طراحی اصولی خوشه‌های HCI و جلوگیری از اتلاف منابع یا ایجاد تنگناهای عملکردی حیاتی است.

مدل درایو (سری سازمانی)رابط ارتباطینوع فلش (NAND)خواندن/نوشتن ترتیبی (MB/s)خواندن/نوشتن تصادفی (IOPS)فرم فاکتورهای پشتیبانی‌شدهتحمل‌پذیری (DWPD) و پورت
PM9A3PCIe 4.0 x4V6 V-NAND TLC (128-L)۶,۹۰۰ / ۴,۱۰۰۱,۱۰۰,۰۰۰ / ۲۰۰,۰۰۰U.2, M.2, E1.S۱.۰ (تک‌پورت)
PM1733PCIe 4.0 x4V-NAND TLC۷,۰۰۰ / ۳,۸۰۰۱,۵۰۰,۰۰۰ / ۲۵۰,۰۰۰U.3, U.2, HHHL۱.۰ (پشتیبانی Dual-Port)
PM1735PCIe 4.0 x4V-NAND TLC۸,۰۰۰ / ۳,۸۰۰۱,۴۵۰,۰۰۰ / ۲۶۰,۰۰۰U.2, HHHL۳.۰ (پشتیبانی Dual-Port)
PM1743PCIe 5.0 x4V6 V-NAND TLC (128-L)۱۴,۰۰۰ / ۷,۱۰۰۲,۵۰۰,۰۰۰ / ۳۶۰,۰۰۰U.2, E3.S۱.۰ تا ۳.۰ (پشتیبانی Dual-Port)
PM9D3aPCIe 5.0 x48th-Gen V-NAND TLC۱۲,۰۰۰ / ۶,۸۰۰۲,۰۰۰,۰۰۰ / ۴۰۰,۰۰۰U.2, E3.S, E1.S۱.۰ (تک‌پورت)
BM1743PCIe 4.0/5.07th-Gen V-NAND QLCتا ۱۲,۰۰۰ (در حالت Gen5)افزایش ۴ برابری نسبت به نسل قبلU.2, U.3, E3.S, E1.S, E1.L۰.۲۶ (پشتیبانی Dual-Port)

ارقام مندرج در جدول فوق نشان‌دهنده یک جهش پارادایمی در مهندسی ذخیره‌سازی هستند. به عنوان نمونه، درایو PM1743 با ثبت ۲.۵ میلیون IOPS در خواندن تصادفی و ۱۴ گیگابایت بر ثانیه در خواندن ترتیبی، به تنهایی قادر است معادل پهنای باند یک لینک شبکه ۱۰۰GbE را به طور کامل اشباع کند. همچنین معرفی درایو BM1743 با سلول‌های چهارسطحی (QLC) نشان‌دهنده رویکرد سامسونگ برای جایگزینی کامل هارد دیسک‌ها (HDD) در لایه‌های ذخیره‌سازی سرد و گرم است؛ این درایو با تراکم بی‌سابقه، امکان دستیابی به ظرفیت ۶۱.۴۴ ترابایت و حتی برنامه‌ریزی برای ۱۲۲.۸۸ ترابایت در فرم فاکتورهای U.2/U.3 را فراهم می‌سازد که تراکم اطلاعات در هر یونیت از سرور را به شکلی نجومی افزایش می‌دهد.   

دگرگونی بنیادین معماری ذخیره‌سازی در پلتفرم VMware vSAN

با درک تحولات فیزیکی رسانه‌های ذخیره‌سازی، شرکت VMware (زیرمجموعه Broadcom) در نسخه ۸ محصول vSAN، معماری نوینی را تحت عنوان Express Storage Architecture (ESA) معرفی کرد. تا پیش از این، معماری سنتی موسوم به Original Storage Architecture (OSA) بر پایه مفهوم “گروه‌های دیسک” (Disk Groups) بنا شده بود. در معماری OSA، سیستم نیازمند یک درایو بسیار سریع (معمولاً با تحمل‌پذیری بالا مانند کلاس ۳ DWPD) به عنوان حافظه پنهان (Cache Tier) و چندین درایو دیگر برای ذخیره‌سازی دائمی (Capacity Tier) بود.   

گذار به معماری تک‌لایه (Single-Tier) و پیامدهای آن

با توسعه درایوهای NVMe نسل ۴ و ۵ سامسونگ که به طور همزمان ظرفیت‌های عظیم (تا ۳۰ ترابایت) و سرعت‌های نوشتن ترتیبی خیره‌کننده‌ای (تا ۷.۱ گیگابایت بر ثانیه در PM1743) ارائه می‌دهند، فلسفه وجودی لایه کش در HCI به چالش کشیده شد. معماری vSAN ESA با حذف کامل گروه‌های دیسک، یک ساختار تک‌لایه یکپارچه معرفی نمود که در آن تمامی درایوهای NVMe متصل به گره، مستقیماً به استخر ذخیره‌سازی (Storage Pool) کمک می‌کنند و وظایف کش و ظرفیت را به صورت توأمان انجام می‌دهند.   

این تغییر معماری پیامدهای ثانویه متعددی به همراه دارد. نخست آنکه، پدیده “سربار نوشتن دوگانه” (Double Write Penalty) که در معماری OSA به دلیل انتقال اجباری داده‌ها از لایه کش به لایه ظرفیت (Destaging) رخ می‌داد، به طور کامل حذف شده است. در vSAN ESA، داده‌ها با بهره‌گیری از یک فایل‌سیستم ساختاریافته بر اساس لاگ (Log-Structured File System یا LFS)، با سرعت لاین-ریت (Line-Rate) و به صورت بلوک‌های تجمیع‌شده روی درایوهای سامسونگ نوشته می‌شوند.   

بازآفرینی قابلیت اطمینان: عملکرد RAID 5 در سطح RAID 1

یکی از معضلات تاریخی زیرساخت‌های HCI، کاهش شدید عملکرد به هنگام استفاده از الگوریتم‌های کدگذاری محوکننده (Erasure Coding) نظیر RAID 5 یا RAID 6 بود. در گذشته، مدیران دیتاسنتر برای حفظ تاخیر پایین در پایگاه‌های داده، مجبور بودند از RAID 1 (آینه‌سازی) استفاده کنند که منجر به از دست رفتن ۵۰ درصد از ظرفیت خام درایوها می‌شد.   

در ترکیب معماری ESA و درایوهای پرسرعت PCIe Gen 5 سامسونگ، به دلیل تاخیر بسیار پایین درایوها در پاسخگویی به درخواست‌های نوشتن تصادفی (به عنوان مثال، ۲۰ میکروثانیه در درایوهای سازمانی معین سامسونگ) و توانایی کنترلر درایو در مدیریت صف‌های عمیق، عملکرد بارهای کاری روی کلاسترهای RAID 5 با اختلاف ناچیزی با RAID 1 برابری می‌کند. این دستاورد به سازمان‌ها اجازه می‌دهد تا با استفاده از RAID 5 (در کلاسترهای ۴ گرهی یا بیشتر)، بدون افت عملکرد، حجم ذخیره‌سازی اشیای سیستم را تا ۵۰ درصد بهینه‌سازی کنند که این امر مستقیماً نرخ بازگشت سرمایه (ROI) را در خرید درایوهای گران‌قیمت NVMe تسریع می‌بخشد.   

پردازش زودهنگام ترافیک، یکپارچگی RDMA و کاهش سربار پردازنده

در معماری نوین VMware، عملیات فشرده‌سازی (Compression) و رمزنگاری (Encryption) به بالاترین سطح از پشته نرم‌افزاری منتقل شده‌اند. بدین ترتیب، داده‌ها پیش از آنکه وارد شبکه شوند یا روی درایوهای سامسونگ نوشته شوند، فشرده و رمزنگاری می‌گردند. استفاده از الگوریتم‌های فشرده‌سازی بلوک‌های ۴ کیلوبایتی با کارایی بالا در vSAN ESA باعث می‌شود حجم ترافیک شبکه (East-West Traffic) و حجم نوشتن نهایی روی فلش NAND کاهش یابد، که این خود به افزایش طول عمر درایوهای ۱ DWPD نظیر PM9D3a یا PM9A3 کمک شایانی می‌کند.   

از سوی دیگر، توانایی درایوهای نسل ۵ سامسونگ در اشباع مسیرهای ارتباطی، نیاز به شبکه‌های سریع‌تر را برجسته می‌کند. در محیط‌های vSAN ESA با پیکربندی All-NVMe، پیاده‌سازی شبکه‌های ۱۰۰GbE با استفاده از پروتکل دسترسی مستقیم به حافظه از راه دور روی اترنت همگرا (RoCE v2) به یک استاندارد تبدیل شده است. استفاده از RDMA امکان دور زدن هسته سیستم‌عامل (Kernel Bypass) را فراهم کرده و کپی‌های غیرضروری در حافظه رم را حذف می‌کند.

مستندات رسمی VMware و سامسونگ حاکی از آن است که استقرار RDMA در کنار درایوهای PM1743، توان عملیاتی بارهای کاری مختلط را تا ۲۵ درصد افزایش داده و به طور همزمان میزان استفاده از پردازنده مرکزی (CPU Utilization) گره‌ها را تا ۱۸ درصد کاهش می‌دهد. این آزادسازی منابع پردازشی، امکان میزبانی از ماشین‌های مجازی بیشتر روی هر گره را فراهم کرده و هزینه‌های صدور گواهینامه نرم‌افزاری را تقلیل می‌دهد.   

لزوم استفاده از درایوهای کلاس سازمانی: مقابله با سراب بنچمارک‌ها

طراحی خوشه‌های HCI بر پایه تجهیزات مصرف‌کننده (Consumer-Grade) یک خطای مهلک است. آزمایش‌های مستقل روی vSAN ESA با استفاده از درایوهای NVMe رده مصرف‌کننده (نظیر Samsung 980 Pro) نشان داده است که این درایوها در مواجهه با بارهای کاری سنگین نوشتن و پس از پر شدن بافر موقت SLC خود، دچار فروپاشی عملکردی شدیدی می‌شوند و سرعت نوشتن تصادفی ۴ کیلوبایتی آن‌ها به مقادیر ناچیزی نظیر ۵۰۰ کیلوبایت بر ثانیه (حدود ۸۰ IOPS) سقوط می‌کند.   

دلیل این پدیده، فقدان خازن‌های محافظت در برابر قطع جریان برق (Power Loss Protection یا PLP) در درایوهای مصرف‌کننده است. پلتفرم‌های HCI برای حفظ جامعیت داده‌ها (Data Integrity)، دستورات نوشتن همگام (Synchronous Writes) صادر می‌کنند. درایوهای مجهز به PLP، نظیر تمامی مدل‌های خانواده سازمانی سامسونگ (PM9A3، PM1733، PM1743)، بلافاصله پس از دریافت داده در حافظه نهان DRAM داخلی خود، تاییدیه نوشتن را به سیستم‌عامل ارسال می‌کنند، زیرا خازن‌های سخت‌افزاری تضمین می‌کنند که در صورت قطع برق، داده‌های موجود در رم به فلش منتقل خواهند شد. فقدان این معماری در درایوهای مصرف‌کننده باعث می‌شود تاخیری فزاینده در تایید دستورات رخ داده و سیستم دچار فروپاشی گردد.   

بهینه‌سازی مسیر داده در معماری Nutanix Cloud Platform

بر خلاف رویکرد VMware که درایورهای ذخیره‌سازی را در هسته هایپروایزر تعبیه کرده است، پلتفرم ابری Nutanix با بهره‌گیری از یک ماشین مجازی کنترل‌کننده (CVM) مجزا روی هر گره، زیرساخت ذخیره‌سازی توزیع‌شده خود (AOS Scale-Out Storage) را پیاده‌سازی می‌کند. این ماشین‌های مجازی با کنترل کامل کنترلرهای ذخیره‌سازی، به صورت یک شبکه توزیع‌شده با یکدیگر در ارتباط هستند. ورود درایوهای PCIe Gen 4 و Gen 5 سامسونگ، مکانیزم‌های کلیدی این معماری را به شدت تقویت کرده است.   

محلی‌سازی داده‌ها (Data Locality) و رفع گلوگاه شبکه

یکی از اصول رقابتی Nutanix، اصل محلی‌سازی داده‌ها (Data Locality) است؛ به این مفهوم که CVM همواره تلاش می‌کند داده‌های خواندن و نوشتن هر ماشین مجازی را در درایوهای فیزیکی تعبیه‌شده در همان گره محلی پردازش کند. با ارتقای بستر سخت‌افزاری به درایوهای PM1743 سامسونگ که قادر به دستیابی به پهنای باند ۱۴ گیگابایت بر ثانیه (در حالت ترتیبی) و ۲.۵ میلیون IOPS (در حالت تصادفی) هستند، سرعت فراخوانی داده‌ها از دیسک محلی به مراتب بیشتر از سرعت شبکه بین‌گرهی شده است.   

توسعه‌دهندگان Nutanix برای بهره‌برداری حداکثری از این سرعت، الگوریتم‌های مهاجرت داده بین لایه‌ها (Tiering) را سخت‌گیرانه‌تر کرده‌اند. بررسی‌ها نشان می‌دهد در خوشه‌هایی که از ترکیبی از درایوهای با تاخیر فوق‌کم و SSDهای معمولی استفاده می‌کنند، ارجاع درخواست‌های خواندن به گره‌های همسایه (حتی روی شبکه‌های سریع) می‌تواند مزیت تاخیر پایین درایوهای NVMe را خنثی کند. بنابراین، کدهای سیستم AOS بهینه‌سازی شده‌اند تا خواندن‌ها ترجیحاً از درایوهای سامسونگ در همان میزبان (Host) انجام پذیرد.   

مدیریت طوفان‌های ورودی/خروجی: استراتژی فلات (Plateau) در برابر دندان‌اره‌ای (Sawtooth)

در زمان وقوع طوفان‌های ورودی/خروجی، نظیر ورود همزمان هزاران کاربر در سیستم‌های دسکتاپ مجازی (VDI Login Storms) یا تراکنش‌های انبوه در پایگاه‌های داده توزیع‌شده، پلتفرم‌های مختلف رفتارهای متفاوتی نشان می‌دهند. برخی معماری‌ها مانند vSAN (پیش از ESA) با دریافت داده‌ها تا زمان اشباع بافر دیسک، سرعت را بالا نگه می‌دارند، اما به محض پر شدن بافر، سیستم دچار پدیده‌ای به نام فشار معکوس (Backpressure) شده و تاخیر عملیاتی به شکل ناگهانی به بالای ۵۰ میلی‌ثانیه پرش می‌کند (نمودار دندان‌اره‌ای).   

در مقابل، معماری AOS در Nutanix از بافر نوشتن ماندگاری به نام OpLog بهره می‌برد که بخشی از فضای درایوهای SSD را به خود اختصاص می‌دهد. با استفاده از درایوهای بسیار سریع PCIe Gen 5 سامسونگ نظیر PM9D3a یا PM1743، ظرفیت جذب آنی OpLog به شکل بی‌سابقه‌ای گسترش می‌یابد. سیستم CVM به گونه‌ای برنامه‌ریزی شده است که قبل از پر شدن کامل بافرها، جریان ورودی داده را به شکل کنترل‌شده‌ای تنظیم می‌کند. این امر باعث می‌شود که عملکرد سیستم به جای نوسانات شدید، به یک پایداری مطلق در زیر بارهای سنگین برسد که از آن به عنوان “استراتژی فلات” یاد می‌شود.

همچنین در بارهای کاری پایگاه داده با توان عملیاتی بسیار بالا، Nutanix از قابلیت Volume Groups با توازن بار (VGLB) استفاده می‌کند که فرآیندهای I/O ماشین مجازی را در میان تمام CVMهای کلاستر توزیع (Shard) می‌کند، بدین ترتیب ماشین مجازی می‌تواند از توانایی و IOPS فوق‌العاده تجمیع‌شده چندین درایو Gen 5 سامسونگ بهره‌مند شود.   

نوآوری‌های نرم‌افزاری سامسونگ: فراتر از سرعت و پهنای باند

برتری محصولات سازمانی سامسونگ در زیرساخت‌های HCI تنها ناشی از ارتقای نسل گذرگاه‌ها یا استفاده از تراشه‌های فلش جدید نیست. بخش عمده‌ای از پایداری سیستم در محیط‌های سازمانی مدیون منطق هوشمندی است که در فریم‌ور (Firmware) و کنترلرهای اختصاصی این درایوها پیاده‌سازی شده است.

فناوری بقا در محل (Fail-in-Place یا FIP)

در دیتاسنترهای مقیاس‌گسترده ابری، یکی از رایج‌ترین و در عین حال پرهزینه‌ترین رویدادها، بروز نقص در رسانه‌های ذخیره‌سازی است. در درایوهای سنتی، اگر تنها یکی از صدها تراشه NAND موجود روی بورد SSD دچار نقص فیزیکی می‌شد، کل درایو از مدار خارج شده و سیستم آن را به عنوان سخت‌افزار معیوب گزارش می‌داد. در یک پلتفرم HCI، آفلاین شدن یک دیسک ۳۰ ترابایتی فاجعه‌بار است؛ سیستم بلافاصله متوجه فقدان قطعاتی از داده‌های توزیع‌شده شده و فرآیند همگام‌سازی مجدد (Resync/Rebuild) را در سطح کل خوشه آغاز می‌کند. این فرآیند، پهنای باند شبکه و I/O سایر دیسک‌ها را برای ساعت‌ها اشغال کرده و عملکرد محیط تولیدی را مختل می‌سازد.   

سامسونگ با توسعه فناوری Fail-in-Place در سری درایوهای PCIe Gen 4 و 5 خود (مانند PM1733 و PM1735)، به این معضل پایان داده است. این فناوری، SSDها را به دستگاه‌هایی تقریباً “نامیرا” تبدیل می‌کند. مکانیزم FIP به طور پیوسته تراشه‌های NAND را پایش کرده و در صورت تشخیص خرابی در یک تراشه، با استفاده از الگوریتم‌های پیشرفته تصحیح خطا (ECC) و کدهای توزیع‌شده، داده‌های مخدوش را بازتولید کرده و به صورت خودکار در بخش‌های سالمِ تراشه‌های دیگرِ همان درایو جایابی (Relocate) می‌کند. از آنجا که این فرآیند کاملاً در لایه سخت‌افزاری و بدون توقف سرویس‌دهی درایو رخ می‌دهد، پلتفرم‌های vSAN یا Nutanix هرگز متوجه آفلاین شدن دیسک نمی‌شوند و هیچ طوفان بازسازی در کلاستر به راه نمی‌افتد.   

یادگیری ماشین V-NAND و مجازی‌سازی سخت‌افزاری (SR-IOV)

افزایش تصاعدی نرخ تبادل داده در گذرگاه‌های نوین چالش‌های فیزیکی جدیدی به همراه دارد. با کاهش زمان پالس‌های ولتاژ برای دستیابی به سرعت‌های بالاتر، خواندن و اعتبارسنجی دقیق حالت‌های سلول‌های فلش بسیار دشوار می‌شود. سامسونگ با یکپارچه‌سازی فناوری یادگیری ماشین V-NAND، امکان تحلیل کلان‌داده‌ها از الگوهای مداری و پیش‌بینی نوسانات ولتاژ را در داخل کنترلر فراهم کرده است. این هوش مصنوعی درون‌تراشه‌ای، خطاهای خواندن را پیش از وقوع جبران نموده و یکپارچگی داده‌ها را در شرایط اوج ترافیک I/O تضمین می‌کند.   

علاوه بر این، درایوهای سازمانی سامسونگ از قابلیت مجازی‌سازی I/O با ریشه منفرد (SR-IOV) پشتیبانی می‌کنند که به لطف آن، یک درایو فیزیکی می‌تواند تا ۶۴ درایو مجازی مستقل (Virtual Namespaces) ایجاد نماید. این نوآوری به هایپروایزرهای تعبیه‌شده در پلتفرم‌های HCI اجازه می‌دهد تا مسیرهای ذخیره‌سازی ایزوله و اختصاصی را بدون درگیری مدام لایه انتزاعی پردازنده مرکزی (CPU Overhead) در اختیار ماشین‌های مجازی قرار دهند و بدین ترتیب راندمان کلی سیستم را افزایش دهند.   

ارزیابی عملکردی در بارهای کاری عملیاتی: بنچمارک‌ها و حقایق

تئوری‌های معماری زمانی اعتبار می‌یابند که در بارهای کاری فشرده (Intensive Workloads) مورد آزمون قرار گیرند. معماری مرجع (Reference Architecture) ترکیب درایوهای PM1743 با پایگاه داده VMware Greenplum نشان می‌دهد که استقرار هشت درایو نسل پنجم سامسونگ در یک گره واحد، توانسته است به نرخ خارق‌العاده ۱۲۰ گیگابایت بر ثانیه (ترافیک خواندن تجمیعی) دست یابد که مرزهای تحلیل چندگانه (Multimodal Analytics) و پردازش داده‌های توزیع‌شده را جابجا می‌کند.   

در آزمون‌های بنچمارک Sysbench (شبیه‌ساز پایگاه‌داده OLTP) تحت پردازنده‌های نسل چهارم AMD EPYC 9554، درایو PCIe 5.0 PM1743 سامسونگ موفق شده در سناریوی خواندن و نوشتن ترکیبی (oltp_read_write) به رکورد ۳۳,۰۱۱ تراکنش بر ثانیه (TPS) دست پیدا کند که این رقم در مقایسه با ۱۶,۰۳۴ TPS در نسل قبلی (PM1733)، نشانگر بهبودی بیش از دو برابری است. نکته حائز اهمیت آنکه، با پیکربندی صحیح حافظه بافر در پایگاه‌داده (نظیر تخصیص ۵ درصد حافظه رم به innodb_buffer_size)، تاخیر صدک نود و پنجم (95th Percentile Latency) در درایو PM1743 تا ۶۲ درصد نسبت به درایوهای نسل قبل کاهش یافته است که به معنای تضمین کیفیت سرویس (QoS) برای حساس‌ترین برنامه‌های کاربردی سازمانی است.   

در زمینه مجازی‌سازی دسکتاپ (VDI) که همواره فشار زیادی به زیرساخت‌های ذخیره‌سازی وارد می‌کند، تحلیل‌های ابزار VDBench نشان می‌دهد درایو PM1743 سامسونگ در فرآیند “ورود اولیه کاربران” (Initial Login) قادر است پیک ۱۵۷,۰۰۰ IOPS را با تاخیر شگفت‌انگیز ۱۸۰.۷ میکروثانیه حفظ کند. این ثبات باعث می‌شود کاربران دسکتاپ مجازی به هیچ وجه احساس کندی ناشی از ازدحام سیستم را تجربه نکنند.   

تحول فیزیکی دیتاسنترها: استانداردهای EDSFF و تراکم بی‌رقیب

عبور از معماری‌های کند و توان‌مصرفی بالای تجهیزات، نیازمند بازطراحی فیزیکی محفظه‌های ذخیره‌سازی بود. فرم فاکتورهای سنتی ۲.۵ اینچی (مانند U.2 و U.3) با وجود تکامل از رابط‌های SATA و SAS، برای دفع حرارت درایوهای بسیار سریع PCIe Gen 5 (که مصرف توان آن‌ها می‌تواند به بالای ۲۰ الی ۲۵ وات برسد) با محدودیت‌های جدی مواجه هستند.   

استاندارد Enterprise and Data Center SSD Form Factor (EDSFF) که خانواده محصولات جدید سامسونگ از جمله PM1743 و PM9D3a در نسخه‌های E1.S و E3.S از آن بهره می‌برند، راه‌حلی قطعی برای این چالش‌ها ارائه کرده است:   

  • مدیریت بهینه حرارتی و توان: طراحی فیزیکی فرم فاکتورهای سری E3 باعث می‌شود سطح مقطع برخورد با جریان هوا بهینه‌تر شود. درایوهای E1.S با هیت‌سینک‌های تعبیه‌شده، حرارت را به مراتب بهتر از فرم فاکتورهای M.2 یا U.2 دفع می‌کنند. این طراحی مقاومت حرارتی سرور را کاهش داده و به فن‌ها اجازه می‌دهد با دور کمتری کار کنند، که خود موجب کاهش مصرف انرژی و لرزش سیستم می‌شود. خانواده E3 همچنین پروفایل‌های توان بالاتری (تا ۷۰ وات در مدل‌های E3.L 2T) را پشتیبانی می‌کنند که بستر را برای دستیابی به ظرفیت‌ها و سرعت‌های بی‌نظیر فراهم می‌سازد.   
  • تراکم فوق‌العاده در رک‌های سرور: به لطف طراحی مهندسی‌‌شده استاندارد EDSFF، یک سرور تک‌یونیت (1U) استاندارد امروزی قادر است تا ۲۰ عدد درایو E3.S را در پنل جلویی خود جای دهد. چنانچه در این سرور از درایوهای ۱۵.۳۶ ترابایتی PM1743 سامسونگ استفاده شود، یک سرور 1U به تنهایی بیش از ۳۰۰ ترابایت ظرفیت فلش فوق‌سریع نسل پنجم با قابلیت تعویض در زمان روشن بودن (Hot-Swappable) ارائه می‌دهد. این میزان تراکم برای پیاده‌سازی گره‌های ذخیره‌سازی ابری، محاسبات لبه (Edge) و آموزش مدل‌های هوش مصنوعی (AI Training Data Pipelines) در دیتاسنترهایی که با محدودیت فضای فیزیکی روبرو هستند، اهمیتی استراتژیک دارد. 

اقتصاد دیتاسنتر: تحلیل هزینه کل مالکیت (TCO)

تصمیم‌گیری برای مهاجرت به معماری‌های PCIe Gen 4 و 5 در تجهیزات HCI همواره با بررسی جنبه‌های اقتصادی و هزینه کل مالکیت (TCO) همراه است. با وجود آنکه درایوهای پیشرفته سامسونگ سرمایه‌گذاری اولیه (CAPEX) بالاتری می‌طلبند، تاثیرات آبشاری آن‌ها در سایر سطوح دیتاسنتر منجر به صرفه‌جویی‌های عمده مالی می‌گردد:

  • ۱. راندمان مصرف انرژی: محصولات نسل جدید سامسونگ از جمله PM1743 و PM9D3a به ترتیب بهبودی ۴۸ و ۴۵ درصدی در بهره‌وری انرژی (کاهش وات مصرفی به ازای هر مگابایت ترافیک) نسبت به درایوهای نسل قبلی خود ارائه داده‌اند. این بهره‌وری مستقیماً منجر به کاهش صورتحساب برق مصرفی و سیستم‌های خنک‌کننده (HVAC) در مقیاس وسیع می‌شود.
  • ۲. تجمیع سرورها و صرفه‌جویی در لایسنس نرم‌افزاری: بزرگترین بخش از بودجه فناوری اطلاعات سازمان‌ها معمولاً صرف خرید مجوز (لایسنس) نرم‌افزارهای تجاری نظیر VMware، سیستم‌عامل‌های ویندوز سرور و پایگاه‌های داده‌ای مانند اوراکل می‌شود که بر اساس تعداد پردازنده یا تعداد گره‌ها (Nodes) محاسبه می‌گردند. سرعت حیرت‌انگیز درایوهای NVMe Gen 5 سامسونگ، همراه با آزادسازی پردازنده از طریق پروتکل‌هایی نظیر RDMA، به معماران سیستم اجازه می‌دهد تا تعداد ماشین‌های مجازی مستقر در هر سرور را افزایش دهند (VM Consolidation). این تجمیع منابع به معنای خرید گره‌های فیزیکی کمتر و در نتیجه، کاهش ده‌ها تا صدها هزار دلاری در هزینه‌های لایسنسینگ و پشتیبانی سالیانه است.
  • ۳. پایداری خدمات و طراحی چندمسیره (Multi-Path): قطعی سرویس در دیتاسنترها می‌تواند هزینه‌های گزافی به بار آورد. درایوهای سازمانی رده‌بالای سامسونگ با پشتیبانی از طراحی Dual-Port (درایوهایی با دو مسیر اتصال فیزیکی موازی به کنترلرهای سرور) تضمین می‌کنند که در صورت بروز خطای سخت‌افزاری در یک مسیر ارتباطی، مسیر پشتیبان بلافاصله و بدون وقفه در عملکرد سیستم، بار ترافیکی را بر عهده بگیرد که این امر پایداری استثنایی را در خوشه‌های HCI به ارمغان می‌آورد.   

جمع‌بندی

توسعه زیرساخت‌های فوق‌همگرا (HCI) در محیط‌های مقیاس‌گسترده ابری، با موانع متعددی در زمینه تاخیر، پهنای باند و مقیاس‌پذیری شبکه‌های ذخیره‌سازی روبرو بوده است. گذر از درایوهای مبتنی بر SAS/SATA و پذیرش استاندارد NVMe روی گذرگاه‌های PCIe نسل ۴ و ۵، پاسخی قاطع به این نیاز روزافزون است. سبد محصولات سازمانی سامسونگ، به ویژه با معرفی غول‌های پردازش داده نظیر PM1743 و PM9D3a، تنها ظرفیت و پهنای باند را دوچندان نکرده است، بلکه پایه‌های مهندسی پلتفرم‌های HCI را نیز از نو بنا نموده است.   

پلتفرم‌هایی نظیر VMware vSAN با اتکا به قابلیت‌های شگرف این درایوها در عملیات خواندن/نوشتن همزمان و پایدار، لایه‌بندی‌های سنتی کش و ظرفیت را کنار گذاشته و به سوی معماری کارآمد تک‌لایه (ESA) حرکت کرده‌اند. همزمان، سیستم توزیع‌شده Nutanix با بهره‌گیری از سرعت دسترسی محلی این قطعات سیلیکونی، استراتژی‌های دفع فشارهای ناگهانی داده (Write Bursts) و محلی‌سازی داده‌ها را به سطح جدیدی از پایداری ارتقا داده است.   

در ورای معیارهای رایج بنچمارک، نوآوری‌های متمایز سامسونگ نظیر فناوری بی‌بدیل بقا در محل (FIP)، که مانع از فروپاشی کلاسترها در هنگام خرابی جزئی تراشه‌های فلش می‌شود، و استفاده از الگوریتم‌های یادگیری ماشین برای حفظ جامعیت داده در سرعت‌های بالا، ارزش‌افزوده‌ای استراتژیک برای سازمان‌ها خلق می‌کند. ترکیب این دستاوردها با فرم فاکتورهای متراکم حرارتی EDSFF و یکپارچه‌سازی با قابلیت‌هایی چون RDMA و SR-IOV، نسل جدید درایوهای سامسونگ را به موتور محرکه‌ای قابل‌اعتماد و مقرون‌به‌صرفه (از منظر TCO) برای دیتاسنترهای مبتنی بر هوش مصنوعی و پایگاه‌های داده‌ای توزیع‌شده تبدیل ساخته است.   

منابع: 1، 2، 3، 4، 5، 6، 7

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *