CoreTech

NVIDIA Vera

پردازنده NVIDIA Vera با معماری یکپارچه معرفی شد؛ تا ۶ برابر سریع‌تر از x86 در هوش مصنوعی

ابوالفضل | ۱۱ ساعت پیش

انویدیا با انتشار جزئیات کامل عملکرد پردازنده NVIDIA Vera، این تراشه را به‌عنوان راهکاری ویژه برای بارهای کاری هوش مصنوعی Agentic معرفی کرده است. طبق اعداد منتشرشده، Vera در این نوع پردازش‌ها تا ۶ برابر عملکرد بالاتر و ۴۰ درصد تأخیر کمتر نسبت به پردازنده‌های x86 از جمله AMD EPYC Turin ارائه می‌دهد. این پردازنده با تنها ۸۸ هسته توانسته در برخی سناریوها از پردازنده ۱۲۸ هسته‌ای EPYC نیز پیشی بگیرد و به گفته انویدیا، از ابتدا برای پاسخ‌گویی به نیازهای نسل جدید مراکز داده هوش مصنوعی طراحی شده است.

انویدیا ارزیابی Vera را بر چهار محور اصلی انجام داده است؛ پهنای باند و تأخیر حافظه، عملکرد در بارهای کاری واقعی، توان IPC هسته‌ها و عملکرد در یادگیری تقویتی (RL) و هوش مصنوعی Agentic. به گفته این شرکت، این چهار بخش بیشترین اهمیت را در نسل جدید بارهای کاری هوش مصنوعی دارند و در تمام مقایسه‌ها نیز پردازنده AMD EPYC Turin مبتنی بر معماری Zen 5 به‌عنوان نماینده پردازنده‌های x86 انتخاب شده تا تفاوت طراحی یکپارچه Vera با معماری Chiplet رایج بهتر نمایش داده شود.

نخستین مجموعه بنچمارک‌ها روی توان معماری NVIDIA Vera متمرکز است، این آزمون‌ها بارهای کاری با حجم بالای دستورالعمل، جریان‌های کنترلی متراکم، رفتار کامپایلر و Runtime و همچنین زنجیره‌های وابستگی طولانی را شبیه‌سازی می‌کنند. نتایج نشان می‌دهد ریزمعماری Olympus در این شرایط تا ۱.۹ برابر IPC بالاتر نسبت به Zen 5 ارائه می‌دهد؛ موضوعی که به گفته انویدیا، یکی از عوامل کلیدی افزایش عملکرد در برنامه‌های Agentic AI و یادگیری تقویتی محسوب می‌شود.

واحد پیش‌بینی شاخه هسته‌های Olympus تا ۲.۳ برابر سریع‌تر از Zen 5 عمل می‌کند و میانگین عملکرد آن نیز حدود ۲ برابر بهتر است. تعداد شاخه‌های پردازش‌شده در هر سیکل نیز تا ۳.۵ برابر افزایش یافته است. انویدیا دلیل این برتری را استفاده از Neural Branch Predictor در کنار پیش‌بینی‌کننده‌های اختصاصی دیگر عنوان می‌کند؛ ترکیبی که ضمن حفظ برتری در شاخص MPKI یا تعداد پیش‌بینی‌های اشتباه در هر هزار دستورالعمل، جریان مفیدتری از دستورها را به مسیر Decode و اجرا ارسال کرده و باعث استفاده بهتر از Front End و کاهش سیکل‌های هدررفته می‌شود.

لیست بنچمارک‌های NVIDIA Vera:

هسته Olympus همچنین از کش دستورالعمل ۶۴ کیلوبایتی با توان دریافت ۱۲۸ بایت داده در هر سیکل و Decode ده‌مسیره بهره می‌برد و برخلاف پردازنده‌های x86 به کش uOP متکی نیست. نتیجه این طراحی دستیابی به عملکردی تا ۲.۴ برابر بهتر در شاخص واکشی دستورالعمل در هر سیکل است. در بخش Backend نیز منابع اجرایی توسعه‌یافته و اجرای عمیق خارج از ترتیب (Out-of-Order Execution) باعث شده‌اند عملکرد عملیات Backend تا ۴.۳ برابر و به‌طور میانگین بیش از ۳ برابر سریع‌تر از Zen 5 باشد.

انویدیا معتقد است معماری Chiplet هنگام افزایش درخواست‌های حافظه با محدودیت‌هایی روبه‌رو می‌شود، زیرا تبادل داده میان هسته‌ها باعث ایجاد گلوگاه در زیرسیستم حافظه و بستر هم‌بند می‌شود. در نتیجه افزایش تعداد پرش‌ها میان تراشه‌ها، تأخیر را بیشتر و پهنای باند مؤثر را کمتر می‌کند. طبق نمودار منتشرشده، تأخیر پردازنده EPYC Turin 9755 با افزایش فشار حافظه از حدود ۱۲۰ نانوثانیه به نزدیک ۳۵۰ نانوثانیه می‌رسد، اما Vera در سطح استفاده ۹۰ درصدی از حافظه، ۳ برابر پهنای باند بیشتر و ۴۰ برابر تأخیر اوج کمتر ارائه می‌دهد.

همچنین EPYC Turin با ۱۲۸ هسته برای هر هسته حدود ۳.۱ گیگابایت بر ثانیه پهنای باند حافظه فراهم می‌کند، در حالی که Vera با ۸۸ هسته حدود ۱۲.۷ گیگابایت بر ثانیه برای هر هسته در اختیار دارد و در برخی کاربردها این مقدار به ۱۴ گیگابایت بر ثانیه نیز می‌رسد. انویدیا تأکید می‌کند چنین پهنای باندی برای بارهای کاری Agentic AI که تعداد زیادی رشته روی داده‌های بزرگ و نامنظم اجرا می‌شوند، اهمیت زیادی دارد؛ زیرا محدودیت اصلی این پردازش‌ها معمولاً حافظه است، نه توان محاسباتی.

این شرکت همچنین به تأثیر ساختار Chiplet بر ارتباط میان هسته‌ها اشاره می‌کند. در چنین معماری‌هایی داده ممکن است از قالب هسته مبدأ خارج شود، از طریق قالب ورودی‌وخروجی به قالب هسته دیگر برسد و سپس همین مسیر را برای پاسخ‌های مربوط به Coherency طی کند. هر پرش میان قالب‌ها، تأخیر بیشتری ایجاد کرده، بخشی از پهنای باند بستر ارتباطی را مصرف می‌کند و عملکرد را بسته به موقعیت فیزیکی هسته‌ها تغییر می‌دهد، در نقشه حرارتی ارتباط هسته‌ها، Vera حدود ۵۰ درصد تأخیر کمتر از EPYC 9755 داشته.

انویدیا از مجموعه SPEC CPU 2006 برای اندازه‌گیری عملکرد هر هسته در یک سوکت کاملاً پر استفاده کرده است، این آزمون اجرای Python، کامپایل کد، تحلیل ایستا و جریان‌های کاری مبتنی بر ابزارهای توسعه نرم‌افزار را شامل می‌شود. معیار عملکرد هر هسته در بار کامل نشان می‌دهد هر هسته هنگام اشتراک‌گذاری توان، حافظه، کش و بستر ارتباطی تا چه اندازه می‌تواند توان عملیاتی خود را حفظ کند. نتایج نشان می‌دهد Vera در اجرای پایتون تا ۱.۸ برابر و در سایر آزمون‌ها تا ۱.۷ برابر سریع‌تر از AMD EPYC عمل می‌کند.

در آزمون‌های مرتبط با پردازش گراف نیز NVIDIA Vera عملکرد قابل‌توجهی از خود نشان داده د در الگوریتم‌های Graph Traversal که به پهنای باند حافظه و کش وابستگی زیادی دارند، پردازنده انویدیا تا ۲.۶ برابر سریع‌تر از AMD Turin ظاهر شده است. همچنین در آزمون PageRank که مسیر پردازشی هسته، بستر ارتباطی و پهنای باند حافظه را تحت فشار قرار می‌دهد، Vera با استفاده از ۳۲ هسته به افزایش عملکرد ۲۹.۳ برابری دست یافته است.

در آزمون پایگاه داده ClickHouse نیز این پردازنده حدود ۲۰ درصد عملکرد بهتر ارائه کرده و برای پردازش‌های تحلیلی، تجمیع داده و ETL حساس به هم‌زمانی مناسب توصیف شده است. انویدیا در جمع‌بندی اعلام می‌کند انویدیا Vera با طراحی یکپارچه خود توانسته بسیاری از محدودیت‌های پردازنده‌های Chiplet را در زمینه حافظه، ارتباط میان هسته‌ها و تأخیر برطرف کند و به همین دلیل برای بارهای کاری نامنظم، وابسته به پهنای باند و دارای هم‌زمانی بالا بهینه شده است.

همچنین گفته می‌شود NVIDIA Vera یکی از گزینه‌های اصلی رقابت پردازنده‌های ویژه هوش مصنوعی Agentic در سال ۲۰۲۶ خواهد بود و شرکت‌هایی مانند OpenAI، Anthropic، SpaceX و Perplexity از نخستین استفاده‌کنندگان آن هستند. این پردازنده علاوه بر ابررایانه‌ها، در مراکز داده ابری نیز به کار گرفته می‌شود و از پشتیبانی گسترده شرکای اکوسیستم برخوردار خواهد بود.

منبع

ابوالفضل | ۱۱ ساعت پیش

دیدگاهتان را بنویسید