خرید سرور NVIDIA DGX؛ راهنمای کامل سرور هوش مصنوعی NVIDIA DGX

با گسترش مدل‌های زبانی بزرگ، هوش مصنوعی مولد، پردازش تصویر، یادگیری عمیق و سیستم‌های مبتنی بر داده، استفاده از سرورهای عمومی دیگر برای بسیاری از پروژه‌های هوش مصنوعی کافی نیست. سازمان‌هایی که قصد آموزش، بهینه‌سازی یا اجرای مدل‌های پیشرفته AI را دارند، به زیرساختی نیاز دارند که پردازنده‌های گرافیکی قدرتمند، حافظه سریع، شبکه پرسرعت، ذخیره‌سازی مناسب و نرم‌افزارهای تخصصی را در یک پلتفرم هماهنگ ارائه کند.

یکی از شناخته‌شده‌ترین راهکارهای این حوزه، خانواده NVIDIA DGX است.

سرور هوش مصنوعی چیست؟

سرور هوش مصنوعی یا AI Server سیستمی است که برای اجرای پردازش‌های موازی و محاسبات سنگین طراحی شده است. در این سرورها، بخش مهمی از پردازش به‌جای CPU توسط چندین GPU دیتاسنتری یا حرفه‌ای انجام می‌شود.

یک سرور هوش مصنوعی معمولاً از اجزای زیر تشکیل می‌شود:

چند پردازنده گرافیکی قدرتمند
یک یا دو پردازنده مرکزی سروری
حافظه RAM با ظرفیت و پهنای باند بالا
ذخیره‌سازی NVMe پرسرعت
شبکه ۲۵، ۱۰۰، ۴۰۰ یا ۸۰۰ گیگابیتی
سیستم خنک‌کننده و منبع تغذیه دیتاسنتری
نرم‌افزارهای مدیریت GPU، کانتینر و گردش‌کارهای AI

برخلاف یک ورک‌استیشن معمولی، سرور AI برای فعالیت مداوم، استفاده چندکاربره، توسعه کلاستر و اجرای بارهای کاری سازمانی ساخته می‌شود.

NVIDIA DGX چیست؟

NVIDIA DGX تنها یک سرور مجهز به کارت گرافیک نیست؛ بلکه یک پلتفرم یکپارچه سخت‌افزاری و نرم‌افزاری برای توسعه، آموزش و استقرار هوش مصنوعی است.

در این پلتفرم، GPUها، ارتباطات NVLink و NVSwitch، شبکه دیتاسنتری، ذخیره‌سازی، سیستم‌عامل DGX و مجموعه نرم‌افزاری NVIDIA AI Enterprise برای اجرای هماهنگ بارهای کاری AI در کنار یکدیگر قرار می‌گیرند. اکوسیستم DGX همچنین شامل ابزارهای MLOps، مدیریت کلاستر، زمان‌بندی منابع، ذخیره‌سازی تأییدشده و خدمات سازمانی است.

این هماهنگی باعث می‌شود سازمان‌ها زمان کمتری را صرف سازگارکردن درایورها، کتابخانه‌ها، سیستم‌عامل و سخت‌افزار کنند و سریع‌تر از مرحله آزمایش به محیط عملیاتی برسند.

چرا سرور NVIDIA DGX برای هوش مصنوعی مناسب است؟

پردازش موازی در مقیاس بالا

مدل‌های هوش مصنوعی شامل میلیاردها پارامتر و حجم زیادی از عملیات ماتریسی هستند. سیستم‌های DGX با استفاده از چند GPU قدرتمند، پردازش مدل را بین شتاب‌دهنده‌ها تقسیم می‌کنند.

ارتباط سریع میان GPUها

وجود NVLink و NVSwitch امکان جابه‌جایی سریع داده میان GPUها را فراهم می‌کند. این قابلیت برای آموزش مدل‌های بزرگ که روی حافظه یک GPU قرار نمی‌گیرند اهمیت زیادی دارد.

پلتفرم نرم‌افزاری آماده

سیستم‌های DGX همراه با نرم‌افزارها و کتابخانه‌های بهینه NVIDIA ارائه می‌شوند. این موضوع زمان راه‌اندازی محیط‌های CUDA، کانتینرها، فریم‌ورک‌های یادگیری عمیق و ابزارهای مدیریتی را کاهش می‌دهد.

مناسب برای توسعه کلاستر

یک DGX می‌تواند به‌عنوان نود مستقل استفاده شود یا در قالب زیرساخت‌هایی مانند DGX BasePOD و DGX SuperPOD در کنار چندین نود دیگر قرار گیرد.

قابلیت استفاده در محیط خصوصی

سازمان‌هایی که به‌دلیل محرمانگی، قوانین داخلی یا هزینه‌های پردازش ابری ترجیح می‌دهند داده‌هایشان داخل مجموعه باقی بماند، می‌توانند DGX را به‌عنوان هسته Private AI یا کارخانه هوش مصنوعی داخلی مستقر کنند.

NVIDIA DGX B200؛ زیرساخت قدرتمند برای AI سازمانی

یکی از مدل‌های مهم این خانواده، NVIDIA DGX B200 است که بر پایه معماری Blackwell توسعه یافته است.

این سیستم از هشت GPU نسل Blackwell، مجموع ۱۴۴۰ گیگابایت حافظه GPU از نوع HBM3e و ارتباط NVLink با پهنای باند تجمیعی ۱۴٫۴ ترابایت بر ثانیه استفاده می‌کند. DGX B200 همچنین دارای دو پردازنده Intel Xeon Platinum، حداقل دو ترابایت حافظه سیستم، ذخیره‌سازی NVMe و اتصالات شبکه تا ۴۰۰ گیگابیت بر ثانیه است. این دستگاه ۱۰ یونیت رک را اشغال می‌کند و حداکثر مصرف برق اعلام‌شده آن حدود ۱۴٫۳ کیلووات است.

چنین مشخصاتی DGX B200 را برای کاربردهای زیر مناسب می‌کند:

آموزش مدل‌های زبانی بزرگ
Fine-Tuning مدل‌های سازمانی
اجرای پرسرعت مدل‌های مولد
پردازش هم‌زمان تعداد زیادی درخواست
تحلیل داده‌های بسیار حجیم
توسعه سیستم‌های Agentic AI
پردازش تصویر و ویدئو
تحقیقات علمی و محاسبات HPC

 

NVIDIA DGX B300؛ نسل جدیدتر برای AI Reasoning

در نسل جدیدتر، NVIDIA DGX B300 از هشت GPU مدل Blackwell Ultra و مجموع ۲٫۱ ترابایت حافظه GPU استفاده می‌کند. این سیستم برای آموزش و استنتاج مدل‌های بزرگ، به‌ویژه مدل‌های Reasoning و بارهای کاری متراکم AI طراحی شده است.

DGX B300 نسبت به B200 بهبود عملکرد در محاسبات FP4 و پردازش Attention را ارائه می‌کند و از شبکه NVIDIA ConnectX-8 با سرعت حداکثر ۸۰۰ گیگابیت بر ثانیه پشتیبانی می‌کند. NVIDIA اعلام کرده است که سیستم‌های DGX B300 اکنون در حال عرضه هستند.

انتخاب بین DGX B200 و B300 باید بر اساس ظرفیت مدل، نوع پردازش، بودجه، زیرساخت برق و سرمایش و زمان اجرای پروژه انجام شود.

کاربردهای سرور NVIDIA DGX

مدل‌های زبانی بزرگ و هوش مصنوعی مولد

DGX برای آموزش، Fine-Tuning و استنتاج مدل‌های زبانی بزرگ، چت‌بات‌های سازمانی، دستیارهای هوشمند و سامانه‌های تولید محتوا قابل استفاده است.

هوش مصنوعی خصوصی و RAG

سازمان می‌تواند اطلاعات داخلی خود را بدون انتقال به سرویس‌های عمومی، وارد یک سامانه RAG کند و مدل هوش مصنوعی اختصاصی خود را روی زیرساخت داخلی اجرا کند.

بینایی ماشین

پردازش تصاویر دوربین‌ها، کنترل کیفیت صنعتی، تشخیص اشیا، تحلیل تصاویر پزشکی، سیستم‌های نظارتی و شهر هوشمند از کاربردهای مهم سرورهای GPU هستند.

شبیه‌سازی و Digital Twin

در صنایع نفت، گاز، انرژی، معماری، تولید، رباتیک و حمل‌ونقل می‌توان از GPUها برای شبیه‌سازی، مدل‌سازی سه‌بعدی و ایجاد Digital Twin استفاده کرد.

تحلیل داده و محاسبات علمی

کتابخانه‌های شتاب‌گرفته NVIDIA می‌توانند پردازش داده، تحلیل آماری، تحقیقات دارویی، شبیه‌سازی مهندسی و محاسبات HPC را سرعت دهند.

پردازش ویدئو و تولید محتوای هوشمند

رندرینگ، تولید ویدئو با هوش مصنوعی، پردازش هم‌زمان چندین جریان ویدئویی و Transcoding از دیگر کاربردهای زیرساخت GPU است.

تفاوت NVIDIA DGX با سرور GPU سفارشی

ویژگی

NVIDIA DGX

سرور های سفارشی

طراحی

یکپارچه و تأییدشده توسط NVIDIA

طراحی بر اساس نیاز پروژه

نرم‌افزار

پلتفرم آماده و بهینه‌شده

نیازمند نصب و یکپارچه‌سازی

انتخاب قطعات

محدود به معماری تعریف‌شده

انعطاف بالا در CPU، GPU  و Storage

توسعه و پشتیبانی

اکوسیستم سازمانی NVIDIA

وابسته به برند و شرکت ارائه‌دهنده

هزینه اولیه

معمولاً بالاتر

قابل بهینه‌سازی بر اساس بودجه

کاربرد مناسب

AI سازمانی و مقیاس بالا

پروژه‌های اختصاصی و متنوع

DGX برای مجموعه‌هایی مناسب است که یک راهکار کامل، استاندارد و سریع برای استقرار AI می‌خواهند. در مقابل، سرور GPU سفارشی برای پروژه‌هایی مناسب است که به انتخاب دقیق کارت گرافیک، ظرفیت حافظه، شبکه، فضای ذخیره‌سازی یا بودجه کنترل‌شده نیاز دارند.

سرور Supermicro SYS-521GE-TNRT به‌عنوان راهکار سفارشی AI

یکی از پلتفرم‌های مناسب برای ساخت سرور هوش مصنوعی سفارشی، Supermicro SYS-521GE-TNRT است. این شاسی 5U از دو پردازنده Intel Xeon Scalable، حداکثر هشت GPU دو اسلاته، ۳۲ اسلات حافظه DDR5، سیزده اسلات PCIe 5.0 x16 و درایوهای Hot-Swap NVMe پشتیبانی می‌کند. دو پورت داخلی 10GbE نیز در این مدل در نظر گرفته شده است.

این پلتفرم می‌تواند بر اساس نیاز پروژه با موارد زیر پیکربندی شود:

هشت شتاب‌دهنده یا کارت گرافیک حرفه‌ای
حافظه DDR5 ECC با ظرفیت بالا
ذخیره‌سازی NVMe برای Dataset و Cache
شبکه ۲۵، ۱۰۰ یا ۴۰۰ گیگابیتی
RAID مخصوص درایوهای NVMe
منابع تغذیه افزونه Titanium
سیستم‌عامل و ابزارهای مدیریت هوش مصنوعی

مزیت اصلی این معماری، امکان ساخت یک سرور دقیقاً مطابق با نوع پردازش، مدل مورد استفاده و بودجه سازمان است.

آیا سرور سفارشی جایگزین NVIDIA DGX می‌شود؟

در بسیاری از پروژه‌ها پاسخ مثبت است، اما این موضوع به نوع استفاده بستگی دارد.

برای آموزش مدل‌های بسیار بزرگ، توسعه کلاسترهای گسترده و نیاز به پلتفرم کاملاً تأییدشده، DGX انتخاب مطمئن‌تری است. اما برای استنتاج، Fine-Tuning، پردازش تصویر، رندرینگ، سرویس‌دهی مدل‌های سازمانی و پروژه‌هایی که به انعطاف سخت‌افزاری نیاز دارند، یک سرور GPU سفارشی می‌تواند نسبت قیمت به عملکرد مناسبی ارائه کند.

بنابراین انتخاب نباید فقط بر اساس تعداد GPU انجام شود. پهنای باند ارتباط میان GPUها، ظرفیت حافظه گرافیکی، توان برق، خنک‌سازی، شبکه، نرم‌افزار و خدمات پشتیبانی نیز اهمیت دارند.

هنگام خرید سرور هوش مصنوعی چه مواردی را بررسی کنیم؟

نوع بار پردازشی

ابتدا باید مشخص شود هدف اصلی آموزش مدل، Fine-Tuning، استنتاج، RAG، بینایی ماشین، رندرینگ یا محاسبات علمی است.

اندازه مدل

اندازه مدل و نوع دقت محاسباتی مشخص می‌کند به چه مقدار حافظه GPU نیاز دارید. تعداد GPU به‌تنهایی معیار کافی نیست.

سرعت شبکه

در کلاسترهای چندسروری، شبکه ضعیف می‌تواند عملکرد GPUها را محدود کند. برای پردازش توزیع‌شده معمولاً باید از شبکه‌های بسیار پرسرعت استفاده شود.

ذخیره‌سازی

Dataset، Checkpointها و فایل‌های مدل به فضای ذخیره‌سازی سریع نیاز دارند. ترکیب NVMe محلی با Storage مرکزی باید متناسب با حجم داده طراحی شود.

برق و سرمایش

سرورهای AI ممکن است چندین کیلووات برق مصرف کنند. ظرفیت UPS، PDU، کابل‌کشی، رک و سیستم سرمایش باید پیش از خرید بررسی شود.

نرم‌افزار

سیستم‌عامل، درایورها، CUDA، کانتینرها، Kubernetes، ابزارهای MLOps و پلتفرم مدیریت کاربران باید در طراحی زیرساخت دیده شوند.

توسعه‌پذیری

سروری که امروز برای یک مدل مناسب است ممکن است در آینده به GPU، حافظه، Storage یا شبکه بیشتری نیاز داشته باشد.

چه سازمان‌هایی به NVIDIA DGX نیاز دارند؟

خرید NVIDIA DGX معمولاً برای مجموعه‌های زیر منطقی است:

شرکت‌های توسعه‌دهنده مدل‌های هوش مصنوعی
بانک‌ها و مؤسسات مالی
مراکز تحقیقاتی و دانشگاهی
شرکت‌های دارویی و پزشکی
صنایع نفت، گاز و انرژی
اپراتورهای مخابراتی
مراکز ارائه‌دهنده خدمات ابری
سازمان‌های دارای اطلاعات محرمانه
مجموعه‌های فعال در رباتیک و خودروهای هوشمند
شرکت‌های تولید محتوای هوش مصنوعی

برای تیم‌های کوچک یا پروژه‌هایی که هنوز در مرحله آزمایش هستند، ممکن است DGX Spark، ورک‌استیشن AI یا یک سرور GPU سفارشی انتخاب اقتصادی‌تری باشد. NVIDIA، DGX Spark را برای توسعه، آزمایش، Fine-Tuning و اجرای محلی مدل‌ها معرفی کرده است؛ این سیستم دارای ۱۲۸ گیگابایت حافظه یکپارچه است و برای مدل‌های کوچک‌تر و توسعه در مقیاس شخصی مناسب تر هستند

خرید سرور NVIDIA DGX از تدبیر پردازان ترنج

انتخاب سرور هوش مصنوعی باید بر اساس مدل مورد استفاده، حجم Dataset، تعداد کاربران، سرعت مورد انتظار، محدودیت برق و سرمایش و برنامه توسعه آینده انجام شود.

تدبیر پردازان ترنج امکان بررسی و ارائه راهکارهای مختلف را برای پروژه‌های هوش مصنوعی فراهم می‌کند؛ از سیستم‌های خانواده NVIDIA DGX و سرورهای GPU سفارشی گرفته تا سرورهای Edge و زیرساخت‌های ذخیره‌سازی و شبکه.

برای دریافت پیشنهاد فنی، استعلام قیمت سرور NVIDIA DGX و طراحی کانفیگ اختصاصی AI، مشخصات پروژه، نوع مدل و ظرفیت پردازش مورد نیاز خود را در اختیار کارشناسان فنی مجموعه قرار دهید و با شماره های ما با کارشناسان ما در تماس باشید.

جمع‌بندی

سرورهای هوش مصنوعی نقش اصلی را در آموزش و اجرای مدل‌های پیشرفته بر عهده دارند. خانواده NVIDIA DGX با ارائه سخت‌افزار، شبکه و نرم‌افزار یکپارچه، یکی از کامل‌ترین راهکارهای سازمانی برای ایجاد زیرساخت AI محسوب می‌شود.

با این حال، همه پروژه‌ها الزاماً به DGX نیاز ندارند. سرورهای GPU سفارشی مانند Supermicro SYS-521GE-TNRT یا سرورهای مقاوم Dell PowerEdge XR نیز می‌توانند بر اساس نوع کاربرد، گزینه مناسب‌تری باشند.

مهم‌ترین مرحله قبل از خرید، طراحی صحیح زیرساخت است؛ زیرا انتخاب GPU بدون توجه به حافظه، شبکه، Storage، برق، سرمایش و نرم‌افزار می‌تواند موجب افزایش هزینه و کاهش کارایی شود.

پرسش‌های متداول

این سرور برای آموزش و اجرای مدل‌های هوش مصنوعی، مدل‌های زبانی بزرگ، هوش مصنوعی مولد، تحلیل داده، بینایی ماشین و محاسبات HPC استفاده می‌شود.

بله. مدل‌های دیتاسنتری DGX برای آموزش، Fine-Tuning و استنتاج مدل‌های زبانی بزرگ و بارهای کاری توزیع‌شده طراحی شده‌اند.

DGX علاوه بر GPU، از ارتباط پرسرعت میان شتاب‌دهنده‌ها، شبکه دیتاسنتری، نرم‌افزارهای بهینه‌شده و اکوسیستم پشتیبانی سازمانی بهره می‌برد. یک سرور سفارشی انعطاف بیشتری دارد، اما به طراحی و یکپارچه‌سازی دقیق نیاز خواهد داشت.

قیمت به مدل، نسل GPU، ظرفیت حافظه، شبکه، خدمات، نحوه تأمین و تجهیزات جانبی وابسته است. برای اعلام قیمت دقیق باید مدل و نیاز پروژه مشخص شود.

بله. با استفاده از شاسی‌های GPU Server از برندهایی مانند Supermicro می‌توان پیکربندی‌هایی با چند GPU، حافظه DDR5، ذخیره‌سازی NVMe و شبکه پرسرعت طراحی کرد؛ با این تفاوت که این سیستم‌ها محصول رسمی GX محسوب نمی‌شوند.