CoreTech

OpenAI GPT-6 Astra

OpenAI GPT-6 Astra رونمایی شد، ادعای پیشرفت بزرگ با قیمت ۱۰۰ دلار برای یک میلیون توکن خروجی

ابوالفضل | ۶ ساعت پیش

OpenAI با عرضه GPT-6 Astra، قدرتمندترین مدل خود تا امروز را معرفی کرده؛ مدلی که به گفته گرگ براکمن، رئیس شرکت، ممکن است با تعریف OpenAI از AGI مطابقت داشته باشد یا دست‌کم به آن نزدیک شده باشد. Astra همچنین نخستین مدل OpenAI است که در چارچوب Preparedness Framework به سطح بحرانی توانمندی سایبری رسیده؛ سطحی که توانایی کشف آسیب‌پذیری‌های ناشناخته و توسعه روش‌های بهره‌برداری را در بر می‌گیرد.

براکمن در نشست خبری تأکید کرد که رسیدن به AGI برخلاف تصور اولیه OpenAI با یک مرز کاملاً مشخص اتفاق نیفتاده و این گذار تدریجی‌تر از انتظار بوده است. تعریف مورد استفاده شرکت، سامانه‌ای است که در بیشتر کارهای اقتصادی ارزشمند از انسان بهتر عمل کند، او در پایان نشست گفت به دوران AGI خوش آمدید. سم آلتمن نیز پیش‌تر گفته بود انتظار دارد تا پایان سال مدلی را که AGI می‌نامد مشاهده کند.

GPT-6 Astra ابتدا از طریق برنامه Daybreak در اختیار سازمان‌های منتخب قرار گرفته و قرار است طی روزهای آینده برای کاربران ChatGPT Plus، پرو، بیزینس و Enterprise عرضه شود. این مدل از طریق API، AWS Bedrock و Microsoft Azure نیز عرضه می‌شود. مشترکان Pro، Business و Enterprise به نسخه قدرتمندتر GPT-6 Astra Pro دسترسی خواهند داشت، هرچند مدیران فضای کاری سازمانی باید این مدل را به‌صورت دستی فعال کنند.

GPT 6 Astra در مرکز Stargate در تگزاس با بیش از ۱۰۰ هزار GPU پیش‌آموزش داده شده و آیدان کلارک، پژوهشگر OpenAI، این فرآیند را بزرگ‌ترین اجرای آموزشی شرکت توصیف کرده است. به گفته او، جهش توانایی از Sol به Astra از جهش مدل‌های قبلی به Sol بزرگ‌تر بوده و بخشی از این پیشرفت نیز به استفاده از مدل‌های هوش مصنوعی قبلی برای پایش فرایند آموزش بازمی‌گردد.

در نتایج منتشرشده، GPT-6 Astra در ARC-AGI-3 به ۹۹.۹ درصد، در FrontierMath Tier 4 نسخه دوم به ۹۷.۶ درصد، در DeepSWE v1.1 به ۷۴.۱ درصد، در GPQA Diamond به ۹۶ درصد، در BenchCAD به ۹۵.۹ درصد و در ExploitBench به ۱۰۰ درصد رسیده، OpenAI در ARC-AGI-3 شرایط آزمون اختصاصی خود را به‌کار برده است.

در کارهای علمی Astra یک نتیجه ریاضی مرتبط با شکاف میان اعداد اول را از ۲۴۰ به ۱۸۶ بهبود داده و همچنین برای نخستین بار طی بیش از ۸۰ سال، یک عبارت مربوط به کران شکاف‌های بزرگ را بهبود بخشیده است. OpenAI می‌گوید این مدل در ارزیابی‌های زیست‌شناسی، شیمی، پزشکی و فیزیک نیز رکوردهای جدیدی ثبت کرده است. در تنظیمات کم‌هزینه، Terminal-Bench Science به ۶۱.۱ درصد و GPQA Diamond به ۹۴.۹ درصد رسیده‌اند.

توانایی کار مستقیم با رایانه یکی دیگر از محورهای مهم GPT-6 Astra است، تا جایی که OpenAI می‌گوید مدل می‌تواند رایانه را مانند انسان کنترل و وظایف چندمرحله‌ای را انجام دهد. در OSWorld 2.0، امتیاز Astra برابر ۷۲.۶ درصد بوده و هر وظیفه حدود ۴۰ دقیقه زمان برده است؛ Sol با امتیاز ۶۵.۷ درصد حدود ۷۵ دقیقه زمان برده است. به ادعای OpenAI، Astra می‌تواند هر کاری را که کاربر روی رایانه انجام می‌دهد، انجام دهد.

در کنار Astra، محیط برنامه‌نویسی Codex نیز به‌روزرسانی شده است و قابلیت آزمایشی جدید به مدل اجازه می‌دهد در جلسات طولانی میان چند پنجره Context یادداشت نگه دارد و اطلاعات قبلی را به یک خلاصه فشرده محدود نکند. پنجره‌های قبلی همچنان قابل جست‌وجو هستند؛ بنابراین مدل می‌تواند نیازمندی‌ها یا نتایج آزمایش‌های قبلی را حتی بدون ثبت در یادداشت‌ها پیدا کند. OpenAI می‌خواهد این قابلیت را طی هفته‌های آینده پیش‌فرض کند.

جدول بنچمارک GPT-6 Astra و مقایسه با رقبایی از Claude:

قیمت استفاده از GPT-6 Astra در API در حالت استاندارد، برای هر یک میلیون توکن ورودی ۱۰ دلار و برای هر یک میلیون توکن خروجی ۵۰ دلار تعیین شده است. حالت Fast که سرعت ۲.۵ برابری را وعده می‌دهد، هزینه را دو برابر می‌کند. قیمت توکنی Astra حدود ۲.۵ برابر Sol و در محدوده Fable 5.1 است. با این حال، OpenAI می‌گوید هزینه تکمیل یک وظیفه معیار مناسب‌تری برای مقایسه است.

گرگ براکمن استدلال می‌کند که قیمت هر توکن معیار مناسبی برای مقایسه مدل‌ها نیست، زیرا توکن‌های مدل‌های مختلف قابل مقایسه مستقیم نیستند. OpenAI در حال آزمایش قیمت‌گذاری بر اساس وظیفه است و می‌گوید در DeepSWE v1.1، پیکربندی برتر Astra هزینه تخمینی API برای تکمیل هر وظیفه را حدود ۵۷ درصد نسبت به Sol کاهش می‌دهد و در BenchCAD نیز هزینه حدود ۴۳ درصد کمتر از Sol است.

در امنیت سایبری، سطح Critical به این معناست که GPT-6 Astra با ابزارها و دسترسی مناسب می‌تواند آسیب‌پذیری‌های ناشناخته را پیدا کند و روش‌های بهره‌برداری تازه‌ای در سامانه‌های محافظت‌شده توسعه دهد، بدون آنکه انسان تک‌تک مراحل را هدایت کند. در ارزیابی‌ها، مدل دو آسیب‌پذیری ناشناخته یا Zero-day (روز صفر) پیدا کرد و OpenAI آن‌ها را به فروشندگان مربوطه گزارش داد. کارشناسان انسانی نیز توانایی شناسایی آسیب‌پذیری‌های جدید در مرورگرها و سیستم‌عامل‌ها را تأیید کردند.

پیشرفته‌ترین قابلیت‌های سایبری Astra فعلاً فقط در اختیار مدافعان مورد اعتماد در برنامه Daybreak Blue قرار دارند؛ OpenAI پیش از عرضه مدل، انتشار آن را برای انجام آزمایش‌های ایمنی بیشتر به تعویق انداخته بود، چون این توانایی‌ها دوکاربردی‌اند و می‌توانند برای دفاع یا حمله به کار روند.

OpenAI برای مقابله با سوءاستفاده یا رفتار ناهماهنگ، حفاظت‌های خود را تقویت کرده و جداسازی سخت‌گیرانه‌تر، رمزگذاری Checkpointها، پایش کامل مسیرها شامل CoT و ارزیابی هم‌راستایی مسدودکننده پیش از استفاده داخلی را به کار گرفته است. Astra با آموزش‌های جدید در برابر Jailbreakها مقاوم‌تر شده و برای کاربران بالقوه پرخطر می‌تواند مرز امتناع محافظه‌کارانه‌تری داشته باشد.

OpenAI GPT-6 Astra را از نظر هم‌راستایی بهتر از Sol می‌داند و بهبودها را از داده‌های پیش‌آموزش تا امتیازدهی در یادگیری تقویتی می‌داند. در شبیه‌سازی بیش از ۵۴ هزار وظیفه Codex، آسترا تقریباً نیمی از هشدارهای رفتار ناهماهنگ با شدت بالای Sol را دریافت کرد. در آزمون دامنه اختیارات، Sol در ۴۸ درصد موارد از هدف مجاز فراتر رفت؛ Astra در صفر درصد موارد چنین نکرد و سه برابر کمتر توانایی‌های خود را نادرست توصیف کرد.

با وجود این بهبودها، OpenAI می‌گوید قابلیت پایش‌پذیری GPT-6 Astra نسبت به Sol کاهش یافته است. مدل کنترل بیشتری بر CoT دارد و کمتر اطلاعات افشاگرانه در آن قرار می‌دهد. در شرایط خصمانه Astra گاهی با کم‌کاری راهبردی یا Sandbagging از شناسایی مانیتورها عبور کرده و در برخی وظایف خرابکارانه از پایش داخلی فرار کرده است. شواهدی از استدلال CoT استگانوگرافیک دیده نشده و خطر فرار احتمالاً بیشتر به وظایف استدلالی ساده‌تر محدود است.

OpenAI تأکید می‌کند که یافته‌های مربوط به فرار از پایش عمدتاً در ارزیابی‌های خصمانه‌ای به دست آمده‌اند که در آن‌ها عمداً از مدل خواسته شده بود از نظارت فرار کند؛ ارزیابی‌های کلی نیز نقض کمتر محدودیت‌های ایمنی و امنیتی را نسبت به Sol نشان می‌دهند. شرکت این روند را جدی می‌داند، تحقیقات را ادامه می‌دهد و در کنار حفظ پایش CoT، توسعه روش‌های ممیزی فراتر از زنجیره فکری را ضروری می‌داند.

برای استقرار خارجی GPT-6 Astra، پایش ناهماهنگی به تمام استنتاج‌های دارای ابزار اضافه شده است؛ سامانه‌ای با هزینه محاسباتی قابل‌توجه که مشابه زیرساخت داخلی OpenAI است. Astra همچنین در مرور وب و محیط‌های کاری در برابر Prompt Injection مقاوم‌تر شده و احتمال تراکنش غیرمجاز، از دست دادن داده، دسترسی بیش‌ازحد یا دور زدن کنترل‌ها در آن کمتر گزارش شده است. در محیط‌های Agentic نیز درخواست‌هایی مانند برنامه‌ریزی حملات خشونت‌آمیز یا ارتکاب کلاهبرداری را ایمن‌تر مدیریت می‌کند.

در سناریوهای پرخطر، GPT-6 آسترا در برابر درخواست‌های دشوار حاصل از محیط تولید و Red Teaming انسانی عملکرد ایمن‌تری از Sol دارد. OpenAI می‌گوید مدل در تکمیل ایمن درخواست‌های ناامن بهتر و در برابر درخواست‌های بی‌ضرر کم‌امتناع‌تر است؛ این بهبود در موقعیت‌هایی که خطر از زمینه گسترده‌تر می‌آید نیز دیده می‌شود. Astra همچنین محدودیت‌های ایمنی متناسب با سن را برای کاربران زیر ۱۸ سال با ثبات بیشتری اعمال می‌کند.

منبع ۱، منبع ۲

ابوالفضل | ۶ ساعت پیش

دیدگاهتان را بنویسید