گسترش بیسابقه رایانش ابری، توسعه مدلهای زبان بزرگ (LLM) در حوزه هوش مصنوعی و نیاز به پردازش پایگاههای داده عظیم و توزیعشده، پارادایمهای سنتی طراحی دیتاسنترها را با چالشهای جدی مواجه ساخته است. در خط مقدم این تحول، زیرساختهای فوقهمگرا (Hyper-Converged Infrastructure یا HCI) قرار دارند که با تجمیع منابع پردازشی، ذخیرهسازی و شبکه در قالب یک پلتفرم نرمافزارمحور و مقیاسپذیر، پیچیدگیهای عملیاتی را به حداقل رساندهاند.
با این حال، افزایش تراکم ماشینهای مجازی (VM)، کانتینرها و بارهای کاری مبتنی بر کلاسترینگ سبب شده تا گلوگاههای عملکردی به تدریج از لایه پردازنده مرکزی (CPU) به زیرسیستمهای ورودی/خروجی (I/O) و شبکه منتقل شوند. در این مقطع حساس تکنولوژیک، تکامل درایوهای حالت جامد (SSD) مبتنی بر پروتکل NVMe و ارتقای گذرگاههای ارتباطی به استانداردهای Peripheral Component Interconnect Express (PCIe) نسل چهارم و پنجم، به ویژه دستاوردهای سیلیکونی و نرمافزاری شرکت سامسونگ، نقشی کاتالیزوری در بازتولید توان عملیاتی محیطهای HCI ایفا کرده است.
این گزارش به بررسی جامع و عمیق تاثیر استقرار درایوهای SSD سازمانی سامسونگ در نسلهای PCIe Gen 4 (نظیر خانوادههای PM9A3 و PM1733) و PCIe Gen 5 (نظیر PM1743، PM9D3a و درایوهای QLC سری BM1743) بر معماریهای پیشرو HCI، به طور خاص پلتفرمهای VMware vSAN و Nutanix Cloud Platform میپردازد. تحلیل پیشرو صرفاً به بازخوانی مشخصات اسمی محدود نبوده و با واکاوی مکانیزمهای بنیادین، پیامدهای ثانویه و ثالثه این جهش را در ابعاد معماری تکلایه، محلیسازی دادهها، تابآوری سیستم، استراتژیهای دفع حرارت و در نهایت، بهینهسازی ساختار هزینه کل مالکیت (TCO) تفسیر مینماید.
آنچه میخوانید:

مبانی فیزیکی گذرگاه: کالبدشکافی تفاوتهای PCIe Gen 4 و PCIe Gen 5 در گرههای HCI
پیش از ورود به مبحث معماری نرمافزاری HCI، تحلیل ظرفیتهای فیزیکی گذرگاه ارتباطی ضروری است. سازمان PCI-SIG در طراحی PCIe نسل چهارم، نرخ انتقال سیگنال را به ۱۶ گیگاتراکنش بر ثانیه (GT/s) رساند که با استفاده از کدگذاری 128b/130b، پهنای باند دوطرفهای معادل تقریبی ۳۱.۵ گیگابایت بر ثانیه را برای یک اتصال کامل x16 و حدود ۷.۹ گیگابایت بر ثانیه را برای یک اتصال x4 (متداول در درایوهای NVMe) فراهم ساخت. سامسونگ با بهرهگیری از این بستر، مدلهایی نظیر PM9A3 و PM1733 را به بازار عرضه کرد که توانستند نرخ خواندن ترتیبی را در مرز ۷ گیگابایت بر ثانیه تثبیت کنند و مفهوم حافظههای کش سنتی را به چالش بکشند.
با معرفی استاندارد PCIe 5.0، نرخ سیگنالدهی بار دیگر بدون تغییر در ساختار کدگذاری پایه، به ۳۲ GT/s دو برابر شد. این جهش به معنای دسترسی به پهنای باند ۱۵.۸ گیگابایت بر ثانیه برای یک اتصال PCIe 5.0 x4 است. اهمیت این ارتقا در گرههای متراکم HCI زمانی آشکار میشود که سرورها همزمان میزبان درایوهای ذخیرهسازی، شتابدهندههای هوش مصنوعی (GPU)، آداپتورهای شبکه (NIC) با سرعت ۱۰۰ الی ۴۰۰ گیگابیت بر ثانیه و واحدهای پردازش داده (DPU) هستند. محدودیت تعداد مسیرهای (Lanes) متصل به پردازنده، همواره یکی از گلوگاههای پنهان سرورها بوده است.
با گذرگاه Gen 5، میتوان به همان پهنای باند قبلی تنها با استفاده از نیمی از مسیرها دست یافت، یا در صورت استفاده از تمام مسیرهای x4، سرعت خواندن ترتیبی را در درایوهایی نظیر PM1743 تا مرز ۱۴ گیگابایت بر ثانیه افزایش داد. این معماری به پردازندههای نوین نظیر AMD EPYC سری 9004 (Genoa) و نسل چهارم Intel Xeon Scalable (Sapphire Rapids) اجازه میدهد تا بدون ایجاد رقابت برای دسترسی به مسیرهای PCIe، حجم عظیمی از ترافیک شبکه و ذخیرهسازی را مدیریت کنند.
تحلیل سبد محصولات سازمانی سامسونگ برای زیرساختهای فوقهمگرا
رویکرد سامسونگ در طراحی SSDهای سازمانی بر پایهگذاری تنوعی از محصولات استوار است که نیازهای گوناگون بارهای کاری خواندنمحور (Read-Intensive) و ترکیبی (Mixed-Use) را در دیتاسنترها پوشش میدهد. درک دقیق مشخصات این درایوها برای طراحی اصولی خوشههای HCI و جلوگیری از اتلاف منابع یا ایجاد تنگناهای عملکردی حیاتی است.
| مدل درایو (سری سازمانی) | رابط ارتباطی | نوع فلش (NAND) | خواندن/نوشتن ترتیبی (MB/s) | خواندن/نوشتن تصادفی (IOPS) | فرم فاکتورهای پشتیبانیشده | تحملپذیری (DWPD) و پورت |
|---|---|---|---|---|---|---|
| PM9A3 | PCIe 4.0 x4 | V6 V-NAND TLC (128-L) | ۶,۹۰۰ / ۴,۱۰۰ | ۱,۱۰۰,۰۰۰ / ۲۰۰,۰۰۰ | U.2, M.2, E1.S | ۱.۰ (تکپورت) |
| PM1733 | PCIe 4.0 x4 | V-NAND TLC | ۷,۰۰۰ / ۳,۸۰۰ | ۱,۵۰۰,۰۰۰ / ۲۵۰,۰۰۰ | U.3, U.2, HHHL | ۱.۰ (پشتیبانی Dual-Port) |
| PM1735 | PCIe 4.0 x4 | V-NAND TLC | ۸,۰۰۰ / ۳,۸۰۰ | ۱,۴۵۰,۰۰۰ / ۲۶۰,۰۰۰ | U.2, HHHL | ۳.۰ (پشتیبانی Dual-Port) |
| PM1743 | PCIe 5.0 x4 | V6 V-NAND TLC (128-L) | ۱۴,۰۰۰ / ۷,۱۰۰ | ۲,۵۰۰,۰۰۰ / ۳۶۰,۰۰۰ | U.2, E3.S | ۱.۰ تا ۳.۰ (پشتیبانی Dual-Port) |
| PM9D3a | PCIe 5.0 x4 | 8th-Gen V-NAND TLC | ۱۲,۰۰۰ / ۶,۸۰۰ | ۲,۰۰۰,۰۰۰ / ۴۰۰,۰۰۰ | U.2, E3.S, E1.S | ۱.۰ (تکپورت) |
| BM1743 | PCIe 4.0/5.0 | 7th-Gen V-NAND QLC | تا ۱۲,۰۰۰ (در حالت Gen5) | افزایش ۴ برابری نسبت به نسل قبل | U.2, U.3, E3.S, E1.S, E1.L | ۰.۲۶ (پشتیبانی Dual-Port) |
ارقام مندرج در جدول فوق نشاندهنده یک جهش پارادایمی در مهندسی ذخیرهسازی هستند. به عنوان نمونه، درایو PM1743 با ثبت ۲.۵ میلیون IOPS در خواندن تصادفی و ۱۴ گیگابایت بر ثانیه در خواندن ترتیبی، به تنهایی قادر است معادل پهنای باند یک لینک شبکه ۱۰۰GbE را به طور کامل اشباع کند. همچنین معرفی درایو BM1743 با سلولهای چهارسطحی (QLC) نشاندهنده رویکرد سامسونگ برای جایگزینی کامل هارد دیسکها (HDD) در لایههای ذخیرهسازی سرد و گرم است؛ این درایو با تراکم بیسابقه، امکان دستیابی به ظرفیت ۶۱.۴۴ ترابایت و حتی برنامهریزی برای ۱۲۲.۸۸ ترابایت در فرم فاکتورهای U.2/U.3 را فراهم میسازد که تراکم اطلاعات در هر یونیت از سرور را به شکلی نجومی افزایش میدهد.
دگرگونی بنیادین معماری ذخیرهسازی در پلتفرم VMware vSAN
با درک تحولات فیزیکی رسانههای ذخیرهسازی، شرکت VMware (زیرمجموعه Broadcom) در نسخه ۸ محصول vSAN، معماری نوینی را تحت عنوان Express Storage Architecture (ESA) معرفی کرد. تا پیش از این، معماری سنتی موسوم به Original Storage Architecture (OSA) بر پایه مفهوم “گروههای دیسک” (Disk Groups) بنا شده بود. در معماری OSA، سیستم نیازمند یک درایو بسیار سریع (معمولاً با تحملپذیری بالا مانند کلاس ۳ DWPD) به عنوان حافظه پنهان (Cache Tier) و چندین درایو دیگر برای ذخیرهسازی دائمی (Capacity Tier) بود.
گذار به معماری تکلایه (Single-Tier) و پیامدهای آن
با توسعه درایوهای NVMe نسل ۴ و ۵ سامسونگ که به طور همزمان ظرفیتهای عظیم (تا ۳۰ ترابایت) و سرعتهای نوشتن ترتیبی خیرهکنندهای (تا ۷.۱ گیگابایت بر ثانیه در PM1743) ارائه میدهند، فلسفه وجودی لایه کش در HCI به چالش کشیده شد. معماری vSAN ESA با حذف کامل گروههای دیسک، یک ساختار تکلایه یکپارچه معرفی نمود که در آن تمامی درایوهای NVMe متصل به گره، مستقیماً به استخر ذخیرهسازی (Storage Pool) کمک میکنند و وظایف کش و ظرفیت را به صورت توأمان انجام میدهند.
این تغییر معماری پیامدهای ثانویه متعددی به همراه دارد. نخست آنکه، پدیده “سربار نوشتن دوگانه” (Double Write Penalty) که در معماری OSA به دلیل انتقال اجباری دادهها از لایه کش به لایه ظرفیت (Destaging) رخ میداد، به طور کامل حذف شده است. در vSAN ESA، دادهها با بهرهگیری از یک فایلسیستم ساختاریافته بر اساس لاگ (Log-Structured File System یا LFS)، با سرعت لاین-ریت (Line-Rate) و به صورت بلوکهای تجمیعشده روی درایوهای سامسونگ نوشته میشوند.
بازآفرینی قابلیت اطمینان: عملکرد RAID 5 در سطح RAID 1
یکی از معضلات تاریخی زیرساختهای HCI، کاهش شدید عملکرد به هنگام استفاده از الگوریتمهای کدگذاری محوکننده (Erasure Coding) نظیر RAID 5 یا RAID 6 بود. در گذشته، مدیران دیتاسنتر برای حفظ تاخیر پایین در پایگاههای داده، مجبور بودند از RAID 1 (آینهسازی) استفاده کنند که منجر به از دست رفتن ۵۰ درصد از ظرفیت خام درایوها میشد.
در ترکیب معماری ESA و درایوهای پرسرعت PCIe Gen 5 سامسونگ، به دلیل تاخیر بسیار پایین درایوها در پاسخگویی به درخواستهای نوشتن تصادفی (به عنوان مثال، ۲۰ میکروثانیه در درایوهای سازمانی معین سامسونگ) و توانایی کنترلر درایو در مدیریت صفهای عمیق، عملکرد بارهای کاری روی کلاسترهای RAID 5 با اختلاف ناچیزی با RAID 1 برابری میکند. این دستاورد به سازمانها اجازه میدهد تا با استفاده از RAID 5 (در کلاسترهای ۴ گرهی یا بیشتر)، بدون افت عملکرد، حجم ذخیرهسازی اشیای سیستم را تا ۵۰ درصد بهینهسازی کنند که این امر مستقیماً نرخ بازگشت سرمایه (ROI) را در خرید درایوهای گرانقیمت NVMe تسریع میبخشد.
پردازش زودهنگام ترافیک، یکپارچگی RDMA و کاهش سربار پردازنده
در معماری نوین VMware، عملیات فشردهسازی (Compression) و رمزنگاری (Encryption) به بالاترین سطح از پشته نرمافزاری منتقل شدهاند. بدین ترتیب، دادهها پیش از آنکه وارد شبکه شوند یا روی درایوهای سامسونگ نوشته شوند، فشرده و رمزنگاری میگردند. استفاده از الگوریتمهای فشردهسازی بلوکهای ۴ کیلوبایتی با کارایی بالا در vSAN ESA باعث میشود حجم ترافیک شبکه (East-West Traffic) و حجم نوشتن نهایی روی فلش NAND کاهش یابد، که این خود به افزایش طول عمر درایوهای ۱ DWPD نظیر PM9D3a یا PM9A3 کمک شایانی میکند.
از سوی دیگر، توانایی درایوهای نسل ۵ سامسونگ در اشباع مسیرهای ارتباطی، نیاز به شبکههای سریعتر را برجسته میکند. در محیطهای vSAN ESA با پیکربندی All-NVMe، پیادهسازی شبکههای ۱۰۰GbE با استفاده از پروتکل دسترسی مستقیم به حافظه از راه دور روی اترنت همگرا (RoCE v2) به یک استاندارد تبدیل شده است. استفاده از RDMA امکان دور زدن هسته سیستمعامل (Kernel Bypass) را فراهم کرده و کپیهای غیرضروری در حافظه رم را حذف میکند.
مستندات رسمی VMware و سامسونگ حاکی از آن است که استقرار RDMA در کنار درایوهای PM1743، توان عملیاتی بارهای کاری مختلط را تا ۲۵ درصد افزایش داده و به طور همزمان میزان استفاده از پردازنده مرکزی (CPU Utilization) گرهها را تا ۱۸ درصد کاهش میدهد. این آزادسازی منابع پردازشی، امکان میزبانی از ماشینهای مجازی بیشتر روی هر گره را فراهم کرده و هزینههای صدور گواهینامه نرمافزاری را تقلیل میدهد.
لزوم استفاده از درایوهای کلاس سازمانی: مقابله با سراب بنچمارکها
طراحی خوشههای HCI بر پایه تجهیزات مصرفکننده (Consumer-Grade) یک خطای مهلک است. آزمایشهای مستقل روی vSAN ESA با استفاده از درایوهای NVMe رده مصرفکننده (نظیر Samsung 980 Pro) نشان داده است که این درایوها در مواجهه با بارهای کاری سنگین نوشتن و پس از پر شدن بافر موقت SLC خود، دچار فروپاشی عملکردی شدیدی میشوند و سرعت نوشتن تصادفی ۴ کیلوبایتی آنها به مقادیر ناچیزی نظیر ۵۰۰ کیلوبایت بر ثانیه (حدود ۸۰ IOPS) سقوط میکند.
دلیل این پدیده، فقدان خازنهای محافظت در برابر قطع جریان برق (Power Loss Protection یا PLP) در درایوهای مصرفکننده است. پلتفرمهای HCI برای حفظ جامعیت دادهها (Data Integrity)، دستورات نوشتن همگام (Synchronous Writes) صادر میکنند. درایوهای مجهز به PLP، نظیر تمامی مدلهای خانواده سازمانی سامسونگ (PM9A3، PM1733، PM1743)، بلافاصله پس از دریافت داده در حافظه نهان DRAM داخلی خود، تاییدیه نوشتن را به سیستمعامل ارسال میکنند، زیرا خازنهای سختافزاری تضمین میکنند که در صورت قطع برق، دادههای موجود در رم به فلش منتقل خواهند شد. فقدان این معماری در درایوهای مصرفکننده باعث میشود تاخیری فزاینده در تایید دستورات رخ داده و سیستم دچار فروپاشی گردد.
بهینهسازی مسیر داده در معماری Nutanix Cloud Platform
بر خلاف رویکرد VMware که درایورهای ذخیرهسازی را در هسته هایپروایزر تعبیه کرده است، پلتفرم ابری Nutanix با بهرهگیری از یک ماشین مجازی کنترلکننده (CVM) مجزا روی هر گره، زیرساخت ذخیرهسازی توزیعشده خود (AOS Scale-Out Storage) را پیادهسازی میکند. این ماشینهای مجازی با کنترل کامل کنترلرهای ذخیرهسازی، به صورت یک شبکه توزیعشده با یکدیگر در ارتباط هستند. ورود درایوهای PCIe Gen 4 و Gen 5 سامسونگ، مکانیزمهای کلیدی این معماری را به شدت تقویت کرده است.
محلیسازی دادهها (Data Locality) و رفع گلوگاه شبکه
یکی از اصول رقابتی Nutanix، اصل محلیسازی دادهها (Data Locality) است؛ به این مفهوم که CVM همواره تلاش میکند دادههای خواندن و نوشتن هر ماشین مجازی را در درایوهای فیزیکی تعبیهشده در همان گره محلی پردازش کند. با ارتقای بستر سختافزاری به درایوهای PM1743 سامسونگ که قادر به دستیابی به پهنای باند ۱۴ گیگابایت بر ثانیه (در حالت ترتیبی) و ۲.۵ میلیون IOPS (در حالت تصادفی) هستند، سرعت فراخوانی دادهها از دیسک محلی به مراتب بیشتر از سرعت شبکه بینگرهی شده است.
توسعهدهندگان Nutanix برای بهرهبرداری حداکثری از این سرعت، الگوریتمهای مهاجرت داده بین لایهها (Tiering) را سختگیرانهتر کردهاند. بررسیها نشان میدهد در خوشههایی که از ترکیبی از درایوهای با تاخیر فوقکم و SSDهای معمولی استفاده میکنند، ارجاع درخواستهای خواندن به گرههای همسایه (حتی روی شبکههای سریع) میتواند مزیت تاخیر پایین درایوهای NVMe را خنثی کند. بنابراین، کدهای سیستم AOS بهینهسازی شدهاند تا خواندنها ترجیحاً از درایوهای سامسونگ در همان میزبان (Host) انجام پذیرد.
مدیریت طوفانهای ورودی/خروجی: استراتژی فلات (Plateau) در برابر دندانارهای (Sawtooth)
در زمان وقوع طوفانهای ورودی/خروجی، نظیر ورود همزمان هزاران کاربر در سیستمهای دسکتاپ مجازی (VDI Login Storms) یا تراکنشهای انبوه در پایگاههای داده توزیعشده، پلتفرمهای مختلف رفتارهای متفاوتی نشان میدهند. برخی معماریها مانند vSAN (پیش از ESA) با دریافت دادهها تا زمان اشباع بافر دیسک، سرعت را بالا نگه میدارند، اما به محض پر شدن بافر، سیستم دچار پدیدهای به نام فشار معکوس (Backpressure) شده و تاخیر عملیاتی به شکل ناگهانی به بالای ۵۰ میلیثانیه پرش میکند (نمودار دندانارهای).
در مقابل، معماری AOS در Nutanix از بافر نوشتن ماندگاری به نام OpLog بهره میبرد که بخشی از فضای درایوهای SSD را به خود اختصاص میدهد. با استفاده از درایوهای بسیار سریع PCIe Gen 5 سامسونگ نظیر PM9D3a یا PM1743، ظرفیت جذب آنی OpLog به شکل بیسابقهای گسترش مییابد. سیستم CVM به گونهای برنامهریزی شده است که قبل از پر شدن کامل بافرها، جریان ورودی داده را به شکل کنترلشدهای تنظیم میکند. این امر باعث میشود که عملکرد سیستم به جای نوسانات شدید، به یک پایداری مطلق در زیر بارهای سنگین برسد که از آن به عنوان “استراتژی فلات” یاد میشود.
همچنین در بارهای کاری پایگاه داده با توان عملیاتی بسیار بالا، Nutanix از قابلیت Volume Groups با توازن بار (VGLB) استفاده میکند که فرآیندهای I/O ماشین مجازی را در میان تمام CVMهای کلاستر توزیع (Shard) میکند، بدین ترتیب ماشین مجازی میتواند از توانایی و IOPS فوقالعاده تجمیعشده چندین درایو Gen 5 سامسونگ بهرهمند شود.
نوآوریهای نرمافزاری سامسونگ: فراتر از سرعت و پهنای باند
برتری محصولات سازمانی سامسونگ در زیرساختهای HCI تنها ناشی از ارتقای نسل گذرگاهها یا استفاده از تراشههای فلش جدید نیست. بخش عمدهای از پایداری سیستم در محیطهای سازمانی مدیون منطق هوشمندی است که در فریمور (Firmware) و کنترلرهای اختصاصی این درایوها پیادهسازی شده است.
فناوری بقا در محل (Fail-in-Place یا FIP)
در دیتاسنترهای مقیاسگسترده ابری، یکی از رایجترین و در عین حال پرهزینهترین رویدادها، بروز نقص در رسانههای ذخیرهسازی است. در درایوهای سنتی، اگر تنها یکی از صدها تراشه NAND موجود روی بورد SSD دچار نقص فیزیکی میشد، کل درایو از مدار خارج شده و سیستم آن را به عنوان سختافزار معیوب گزارش میداد. در یک پلتفرم HCI، آفلاین شدن یک دیسک ۳۰ ترابایتی فاجعهبار است؛ سیستم بلافاصله متوجه فقدان قطعاتی از دادههای توزیعشده شده و فرآیند همگامسازی مجدد (Resync/Rebuild) را در سطح کل خوشه آغاز میکند. این فرآیند، پهنای باند شبکه و I/O سایر دیسکها را برای ساعتها اشغال کرده و عملکرد محیط تولیدی را مختل میسازد.
سامسونگ با توسعه فناوری Fail-in-Place در سری درایوهای PCIe Gen 4 و 5 خود (مانند PM1733 و PM1735)، به این معضل پایان داده است. این فناوری، SSDها را به دستگاههایی تقریباً “نامیرا” تبدیل میکند. مکانیزم FIP به طور پیوسته تراشههای NAND را پایش کرده و در صورت تشخیص خرابی در یک تراشه، با استفاده از الگوریتمهای پیشرفته تصحیح خطا (ECC) و کدهای توزیعشده، دادههای مخدوش را بازتولید کرده و به صورت خودکار در بخشهای سالمِ تراشههای دیگرِ همان درایو جایابی (Relocate) میکند. از آنجا که این فرآیند کاملاً در لایه سختافزاری و بدون توقف سرویسدهی درایو رخ میدهد، پلتفرمهای vSAN یا Nutanix هرگز متوجه آفلاین شدن دیسک نمیشوند و هیچ طوفان بازسازی در کلاستر به راه نمیافتد.
یادگیری ماشین V-NAND و مجازیسازی سختافزاری (SR-IOV)
افزایش تصاعدی نرخ تبادل داده در گذرگاههای نوین چالشهای فیزیکی جدیدی به همراه دارد. با کاهش زمان پالسهای ولتاژ برای دستیابی به سرعتهای بالاتر، خواندن و اعتبارسنجی دقیق حالتهای سلولهای فلش بسیار دشوار میشود. سامسونگ با یکپارچهسازی فناوری یادگیری ماشین V-NAND، امکان تحلیل کلاندادهها از الگوهای مداری و پیشبینی نوسانات ولتاژ را در داخل کنترلر فراهم کرده است. این هوش مصنوعی درونتراشهای، خطاهای خواندن را پیش از وقوع جبران نموده و یکپارچگی دادهها را در شرایط اوج ترافیک I/O تضمین میکند.
علاوه بر این، درایوهای سازمانی سامسونگ از قابلیت مجازیسازی I/O با ریشه منفرد (SR-IOV) پشتیبانی میکنند که به لطف آن، یک درایو فیزیکی میتواند تا ۶۴ درایو مجازی مستقل (Virtual Namespaces) ایجاد نماید. این نوآوری به هایپروایزرهای تعبیهشده در پلتفرمهای HCI اجازه میدهد تا مسیرهای ذخیرهسازی ایزوله و اختصاصی را بدون درگیری مدام لایه انتزاعی پردازنده مرکزی (CPU Overhead) در اختیار ماشینهای مجازی قرار دهند و بدین ترتیب راندمان کلی سیستم را افزایش دهند.
ارزیابی عملکردی در بارهای کاری عملیاتی: بنچمارکها و حقایق
تئوریهای معماری زمانی اعتبار مییابند که در بارهای کاری فشرده (Intensive Workloads) مورد آزمون قرار گیرند. معماری مرجع (Reference Architecture) ترکیب درایوهای PM1743 با پایگاه داده VMware Greenplum نشان میدهد که استقرار هشت درایو نسل پنجم سامسونگ در یک گره واحد، توانسته است به نرخ خارقالعاده ۱۲۰ گیگابایت بر ثانیه (ترافیک خواندن تجمیعی) دست یابد که مرزهای تحلیل چندگانه (Multimodal Analytics) و پردازش دادههای توزیعشده را جابجا میکند.
در آزمونهای بنچمارک Sysbench (شبیهساز پایگاهداده OLTP) تحت پردازندههای نسل چهارم AMD EPYC 9554، درایو PCIe 5.0 PM1743 سامسونگ موفق شده در سناریوی خواندن و نوشتن ترکیبی (oltp_read_write) به رکورد ۳۳,۰۱۱ تراکنش بر ثانیه (TPS) دست پیدا کند که این رقم در مقایسه با ۱۶,۰۳۴ TPS در نسل قبلی (PM1733)، نشانگر بهبودی بیش از دو برابری است. نکته حائز اهمیت آنکه، با پیکربندی صحیح حافظه بافر در پایگاهداده (نظیر تخصیص ۵ درصد حافظه رم به innodb_buffer_size)، تاخیر صدک نود و پنجم (95th Percentile Latency) در درایو PM1743 تا ۶۲ درصد نسبت به درایوهای نسل قبل کاهش یافته است که به معنای تضمین کیفیت سرویس (QoS) برای حساسترین برنامههای کاربردی سازمانی است.
در زمینه مجازیسازی دسکتاپ (VDI) که همواره فشار زیادی به زیرساختهای ذخیرهسازی وارد میکند، تحلیلهای ابزار VDBench نشان میدهد درایو PM1743 سامسونگ در فرآیند “ورود اولیه کاربران” (Initial Login) قادر است پیک ۱۵۷,۰۰۰ IOPS را با تاخیر شگفتانگیز ۱۸۰.۷ میکروثانیه حفظ کند. این ثبات باعث میشود کاربران دسکتاپ مجازی به هیچ وجه احساس کندی ناشی از ازدحام سیستم را تجربه نکنند.
تحول فیزیکی دیتاسنترها: استانداردهای EDSFF و تراکم بیرقیب
عبور از معماریهای کند و توانمصرفی بالای تجهیزات، نیازمند بازطراحی فیزیکی محفظههای ذخیرهسازی بود. فرم فاکتورهای سنتی ۲.۵ اینچی (مانند U.2 و U.3) با وجود تکامل از رابطهای SATA و SAS، برای دفع حرارت درایوهای بسیار سریع PCIe Gen 5 (که مصرف توان آنها میتواند به بالای ۲۰ الی ۲۵ وات برسد) با محدودیتهای جدی مواجه هستند.
استاندارد Enterprise and Data Center SSD Form Factor (EDSFF) که خانواده محصولات جدید سامسونگ از جمله PM1743 و PM9D3a در نسخههای E1.S و E3.S از آن بهره میبرند، راهحلی قطعی برای این چالشها ارائه کرده است:
- مدیریت بهینه حرارتی و توان: طراحی فیزیکی فرم فاکتورهای سری E3 باعث میشود سطح مقطع برخورد با جریان هوا بهینهتر شود. درایوهای E1.S با هیتسینکهای تعبیهشده، حرارت را به مراتب بهتر از فرم فاکتورهای M.2 یا U.2 دفع میکنند. این طراحی مقاومت حرارتی سرور را کاهش داده و به فنها اجازه میدهد با دور کمتری کار کنند، که خود موجب کاهش مصرف انرژی و لرزش سیستم میشود. خانواده E3 همچنین پروفایلهای توان بالاتری (تا ۷۰ وات در مدلهای E3.L 2T) را پشتیبانی میکنند که بستر را برای دستیابی به ظرفیتها و سرعتهای بینظیر فراهم میسازد.
- تراکم فوقالعاده در رکهای سرور: به لطف طراحی مهندسیشده استاندارد EDSFF، یک سرور تکیونیت (1U) استاندارد امروزی قادر است تا ۲۰ عدد درایو E3.S را در پنل جلویی خود جای دهد. چنانچه در این سرور از درایوهای ۱۵.۳۶ ترابایتی PM1743 سامسونگ استفاده شود، یک سرور 1U به تنهایی بیش از ۳۰۰ ترابایت ظرفیت فلش فوقسریع نسل پنجم با قابلیت تعویض در زمان روشن بودن (Hot-Swappable) ارائه میدهد. این میزان تراکم برای پیادهسازی گرههای ذخیرهسازی ابری، محاسبات لبه (Edge) و آموزش مدلهای هوش مصنوعی (AI Training Data Pipelines) در دیتاسنترهایی که با محدودیت فضای فیزیکی روبرو هستند، اهمیتی استراتژیک دارد.
اقتصاد دیتاسنتر: تحلیل هزینه کل مالکیت (TCO)
تصمیمگیری برای مهاجرت به معماریهای PCIe Gen 4 و 5 در تجهیزات HCI همواره با بررسی جنبههای اقتصادی و هزینه کل مالکیت (TCO) همراه است. با وجود آنکه درایوهای پیشرفته سامسونگ سرمایهگذاری اولیه (CAPEX) بالاتری میطلبند، تاثیرات آبشاری آنها در سایر سطوح دیتاسنتر منجر به صرفهجوییهای عمده مالی میگردد:
- ۱. راندمان مصرف انرژی: محصولات نسل جدید سامسونگ از جمله PM1743 و PM9D3a به ترتیب بهبودی ۴۸ و ۴۵ درصدی در بهرهوری انرژی (کاهش وات مصرفی به ازای هر مگابایت ترافیک) نسبت به درایوهای نسل قبلی خود ارائه دادهاند. این بهرهوری مستقیماً منجر به کاهش صورتحساب برق مصرفی و سیستمهای خنککننده (HVAC) در مقیاس وسیع میشود.
- ۲. تجمیع سرورها و صرفهجویی در لایسنس نرمافزاری: بزرگترین بخش از بودجه فناوری اطلاعات سازمانها معمولاً صرف خرید مجوز (لایسنس) نرمافزارهای تجاری نظیر VMware، سیستمعاملهای ویندوز سرور و پایگاههای دادهای مانند اوراکل میشود که بر اساس تعداد پردازنده یا تعداد گرهها (Nodes) محاسبه میگردند. سرعت حیرتانگیز درایوهای NVMe Gen 5 سامسونگ، همراه با آزادسازی پردازنده از طریق پروتکلهایی نظیر RDMA، به معماران سیستم اجازه میدهد تا تعداد ماشینهای مجازی مستقر در هر سرور را افزایش دهند (VM Consolidation). این تجمیع منابع به معنای خرید گرههای فیزیکی کمتر و در نتیجه، کاهش دهها تا صدها هزار دلاری در هزینههای لایسنسینگ و پشتیبانی سالیانه است.
- ۳. پایداری خدمات و طراحی چندمسیره (Multi-Path): قطعی سرویس در دیتاسنترها میتواند هزینههای گزافی به بار آورد. درایوهای سازمانی ردهبالای سامسونگ با پشتیبانی از طراحی Dual-Port (درایوهایی با دو مسیر اتصال فیزیکی موازی به کنترلرهای سرور) تضمین میکنند که در صورت بروز خطای سختافزاری در یک مسیر ارتباطی، مسیر پشتیبان بلافاصله و بدون وقفه در عملکرد سیستم، بار ترافیکی را بر عهده بگیرد که این امر پایداری استثنایی را در خوشههای HCI به ارمغان میآورد.
جمعبندی
توسعه زیرساختهای فوقهمگرا (HCI) در محیطهای مقیاسگسترده ابری، با موانع متعددی در زمینه تاخیر، پهنای باند و مقیاسپذیری شبکههای ذخیرهسازی روبرو بوده است. گذر از درایوهای مبتنی بر SAS/SATA و پذیرش استاندارد NVMe روی گذرگاههای PCIe نسل ۴ و ۵، پاسخی قاطع به این نیاز روزافزون است. سبد محصولات سازمانی سامسونگ، به ویژه با معرفی غولهای پردازش داده نظیر PM1743 و PM9D3a، تنها ظرفیت و پهنای باند را دوچندان نکرده است، بلکه پایههای مهندسی پلتفرمهای HCI را نیز از نو بنا نموده است.
پلتفرمهایی نظیر VMware vSAN با اتکا به قابلیتهای شگرف این درایوها در عملیات خواندن/نوشتن همزمان و پایدار، لایهبندیهای سنتی کش و ظرفیت را کنار گذاشته و به سوی معماری کارآمد تکلایه (ESA) حرکت کردهاند. همزمان، سیستم توزیعشده Nutanix با بهرهگیری از سرعت دسترسی محلی این قطعات سیلیکونی، استراتژیهای دفع فشارهای ناگهانی داده (Write Bursts) و محلیسازی دادهها را به سطح جدیدی از پایداری ارتقا داده است.
در ورای معیارهای رایج بنچمارک، نوآوریهای متمایز سامسونگ نظیر فناوری بیبدیل بقا در محل (FIP)، که مانع از فروپاشی کلاسترها در هنگام خرابی جزئی تراشههای فلش میشود، و استفاده از الگوریتمهای یادگیری ماشین برای حفظ جامعیت داده در سرعتهای بالا، ارزشافزودهای استراتژیک برای سازمانها خلق میکند. ترکیب این دستاوردها با فرم فاکتورهای متراکم حرارتی EDSFF و یکپارچهسازی با قابلیتهایی چون RDMA و SR-IOV، نسل جدید درایوهای سامسونگ را به موتور محرکهای قابلاعتماد و مقرونبهصرفه (از منظر TCO) برای دیتاسنترهای مبتنی بر هوش مصنوعی و پایگاههای دادهای توزیعشده تبدیل ساخته است.



