
OpenAI GPT-6 Astra رونمایی شد، ادعای پیشرفت بزرگ با قیمت ۱۰۰ دلار برای یک میلیون توکن خروجی
OpenAI با عرضه GPT-6 Astra، قدرتمندترین مدل خود تا امروز را معرفی کرده؛ مدلی که به گفته گرگ براکمن، رئیس شرکت، ممکن است با تعریف OpenAI از AGI مطابقت داشته باشد یا دستکم به آن نزدیک شده باشد. Astra همچنین نخستین مدل OpenAI است که در چارچوب Preparedness Framework به سطح بحرانی توانمندی سایبری رسیده؛ سطحی که توانایی کشف آسیبپذیریهای ناشناخته و توسعه روشهای بهرهبرداری را در بر میگیرد.
براکمن در نشست خبری تأکید کرد که رسیدن به AGI برخلاف تصور اولیه OpenAI با یک مرز کاملاً مشخص اتفاق نیفتاده و این گذار تدریجیتر از انتظار بوده است. تعریف مورد استفاده شرکت، سامانهای است که در بیشتر کارهای اقتصادی ارزشمند از انسان بهتر عمل کند، او در پایان نشست گفت به دوران AGI خوش آمدید. سم آلتمن نیز پیشتر گفته بود انتظار دارد تا پایان سال مدلی را که AGI مینامد مشاهده کند.
GPT-6 Astra ابتدا از طریق برنامه Daybreak در اختیار سازمانهای منتخب قرار گرفته و قرار است طی روزهای آینده برای کاربران ChatGPT Plus، پرو، بیزینس و Enterprise عرضه شود. این مدل از طریق API، AWS Bedrock و Microsoft Azure نیز عرضه میشود. مشترکان Pro، Business و Enterprise به نسخه قدرتمندتر GPT-6 Astra Pro دسترسی خواهند داشت، هرچند مدیران فضای کاری سازمانی باید این مدل را بهصورت دستی فعال کنند.
GPT 6 Astra در مرکز Stargate در تگزاس با بیش از ۱۰۰ هزار GPU پیشآموزش داده شده و آیدان کلارک، پژوهشگر OpenAI، این فرآیند را بزرگترین اجرای آموزشی شرکت توصیف کرده است. به گفته او، جهش توانایی از Sol به Astra از جهش مدلهای قبلی به Sol بزرگتر بوده و بخشی از این پیشرفت نیز به استفاده از مدلهای هوش مصنوعی قبلی برای پایش فرایند آموزش بازمیگردد.
در نتایج منتشرشده، GPT-6 Astra در ARC-AGI-3 به ۹۹.۹ درصد، در FrontierMath Tier 4 نسخه دوم به ۹۷.۶ درصد، در DeepSWE v1.1 به ۷۴.۱ درصد، در GPQA Diamond به ۹۶ درصد، در BenchCAD به ۹۵.۹ درصد و در ExploitBench به ۱۰۰ درصد رسیده، OpenAI در ARC-AGI-3 شرایط آزمون اختصاصی خود را بهکار برده است.
در کارهای علمی Astra یک نتیجه ریاضی مرتبط با شکاف میان اعداد اول را از ۲۴۰ به ۱۸۶ بهبود داده و همچنین برای نخستین بار طی بیش از ۸۰ سال، یک عبارت مربوط به کران شکافهای بزرگ را بهبود بخشیده است. OpenAI میگوید این مدل در ارزیابیهای زیستشناسی، شیمی، پزشکی و فیزیک نیز رکوردهای جدیدی ثبت کرده است. در تنظیمات کمهزینه، Terminal-Bench Science به ۶۱.۱ درصد و GPQA Diamond به ۹۴.۹ درصد رسیدهاند.
توانایی کار مستقیم با رایانه یکی دیگر از محورهای مهم GPT-6 Astra است، تا جایی که OpenAI میگوید مدل میتواند رایانه را مانند انسان کنترل و وظایف چندمرحلهای را انجام دهد. در OSWorld 2.0، امتیاز Astra برابر ۷۲.۶ درصد بوده و هر وظیفه حدود ۴۰ دقیقه زمان برده است؛ Sol با امتیاز ۶۵.۷ درصد حدود ۷۵ دقیقه زمان برده است. به ادعای OpenAI، Astra میتواند هر کاری را که کاربر روی رایانه انجام میدهد، انجام دهد.
در کنار Astra، محیط برنامهنویسی Codex نیز بهروزرسانی شده است و قابلیت آزمایشی جدید به مدل اجازه میدهد در جلسات طولانی میان چند پنجره Context یادداشت نگه دارد و اطلاعات قبلی را به یک خلاصه فشرده محدود نکند. پنجرههای قبلی همچنان قابل جستوجو هستند؛ بنابراین مدل میتواند نیازمندیها یا نتایج آزمایشهای قبلی را حتی بدون ثبت در یادداشتها پیدا کند. OpenAI میخواهد این قابلیت را طی هفتههای آینده پیشفرض کند.
جدول بنچمارک GPT-6 Astra و مقایسه با رقبایی از Claude:








قیمت استفاده از GPT-6 Astra در API در حالت استاندارد، برای هر یک میلیون توکن ورودی ۱۰ دلار و برای هر یک میلیون توکن خروجی ۵۰ دلار تعیین شده است. حالت Fast که سرعت ۲.۵ برابری را وعده میدهد، هزینه را دو برابر میکند. قیمت توکنی Astra حدود ۲.۵ برابر Sol و در محدوده Fable 5.1 است. با این حال، OpenAI میگوید هزینه تکمیل یک وظیفه معیار مناسبتری برای مقایسه است.
گرگ براکمن استدلال میکند که قیمت هر توکن معیار مناسبی برای مقایسه مدلها نیست، زیرا توکنهای مدلهای مختلف قابل مقایسه مستقیم نیستند. OpenAI در حال آزمایش قیمتگذاری بر اساس وظیفه است و میگوید در DeepSWE v1.1، پیکربندی برتر Astra هزینه تخمینی API برای تکمیل هر وظیفه را حدود ۵۷ درصد نسبت به Sol کاهش میدهد و در BenchCAD نیز هزینه حدود ۴۳ درصد کمتر از Sol است.
در امنیت سایبری، سطح Critical به این معناست که GPT-6 Astra با ابزارها و دسترسی مناسب میتواند آسیبپذیریهای ناشناخته را پیدا کند و روشهای بهرهبرداری تازهای در سامانههای محافظتشده توسعه دهد، بدون آنکه انسان تکتک مراحل را هدایت کند. در ارزیابیها، مدل دو آسیبپذیری ناشناخته یا Zero-day (روز صفر) پیدا کرد و OpenAI آنها را به فروشندگان مربوطه گزارش داد. کارشناسان انسانی نیز توانایی شناسایی آسیبپذیریهای جدید در مرورگرها و سیستمعاملها را تأیید کردند.
پیشرفتهترین قابلیتهای سایبری Astra فعلاً فقط در اختیار مدافعان مورد اعتماد در برنامه Daybreak Blue قرار دارند؛ OpenAI پیش از عرضه مدل، انتشار آن را برای انجام آزمایشهای ایمنی بیشتر به تعویق انداخته بود، چون این تواناییها دوکاربردیاند و میتوانند برای دفاع یا حمله به کار روند.
OpenAI برای مقابله با سوءاستفاده یا رفتار ناهماهنگ، حفاظتهای خود را تقویت کرده و جداسازی سختگیرانهتر، رمزگذاری Checkpointها، پایش کامل مسیرها شامل CoT و ارزیابی همراستایی مسدودکننده پیش از استفاده داخلی را به کار گرفته است. Astra با آموزشهای جدید در برابر Jailbreakها مقاومتر شده و برای کاربران بالقوه پرخطر میتواند مرز امتناع محافظهکارانهتری داشته باشد.
OpenAI GPT-6 Astra را از نظر همراستایی بهتر از Sol میداند و بهبودها را از دادههای پیشآموزش تا امتیازدهی در یادگیری تقویتی میداند. در شبیهسازی بیش از ۵۴ هزار وظیفه Codex، آسترا تقریباً نیمی از هشدارهای رفتار ناهماهنگ با شدت بالای Sol را دریافت کرد. در آزمون دامنه اختیارات، Sol در ۴۸ درصد موارد از هدف مجاز فراتر رفت؛ Astra در صفر درصد موارد چنین نکرد و سه برابر کمتر تواناییهای خود را نادرست توصیف کرد.
با وجود این بهبودها، OpenAI میگوید قابلیت پایشپذیری GPT-6 Astra نسبت به Sol کاهش یافته است. مدل کنترل بیشتری بر CoT دارد و کمتر اطلاعات افشاگرانه در آن قرار میدهد. در شرایط خصمانه Astra گاهی با کمکاری راهبردی یا Sandbagging از شناسایی مانیتورها عبور کرده و در برخی وظایف خرابکارانه از پایش داخلی فرار کرده است. شواهدی از استدلال CoT استگانوگرافیک دیده نشده و خطر فرار احتمالاً بیشتر به وظایف استدلالی سادهتر محدود است.
OpenAI تأکید میکند که یافتههای مربوط به فرار از پایش عمدتاً در ارزیابیهای خصمانهای به دست آمدهاند که در آنها عمداً از مدل خواسته شده بود از نظارت فرار کند؛ ارزیابیهای کلی نیز نقض کمتر محدودیتهای ایمنی و امنیتی را نسبت به Sol نشان میدهند. شرکت این روند را جدی میداند، تحقیقات را ادامه میدهد و در کنار حفظ پایش CoT، توسعه روشهای ممیزی فراتر از زنجیره فکری را ضروری میداند.
برای استقرار خارجی GPT-6 Astra، پایش ناهماهنگی به تمام استنتاجهای دارای ابزار اضافه شده است؛ سامانهای با هزینه محاسباتی قابلتوجه که مشابه زیرساخت داخلی OpenAI است. Astra همچنین در مرور وب و محیطهای کاری در برابر Prompt Injection مقاومتر شده و احتمال تراکنش غیرمجاز، از دست دادن داده، دسترسی بیشازحد یا دور زدن کنترلها در آن کمتر گزارش شده است. در محیطهای Agentic نیز درخواستهایی مانند برنامهریزی حملات خشونتآمیز یا ارتکاب کلاهبرداری را ایمنتر مدیریت میکند.
در سناریوهای پرخطر، GPT-6 آسترا در برابر درخواستهای دشوار حاصل از محیط تولید و Red Teaming انسانی عملکرد ایمنتری از Sol دارد. OpenAI میگوید مدل در تکمیل ایمن درخواستهای ناامن بهتر و در برابر درخواستهای بیضرر کمامتناعتر است؛ این بهبود در موقعیتهایی که خطر از زمینه گستردهتر میآید نیز دیده میشود. Astra همچنین محدودیتهای ایمنی متناسب با سن را برای کاربران زیر ۱۸ سال با ثبات بیشتری اعمال میکند.




