Ox Alpha چیست؟ مدل مرموزی که بینام آمد و همه را غافلگیر کرد
چند روز پیش یک مدل هوش مصنوعی عجیب روی اینترنت ظاهر شد. اسمش Ox Alpha بود — نه معلوم بود کدام شرکت ساخته، نه لوگویی داشت، نه حتی مشخص بود مال کدام کشور است. فقط گفته بودند قوی است برای کدنویسی، حل مسئله و کارهای چندمرحلهای با AI Agent. خیلی زود برنامهنویسها فهمیدند: این مدل ناشناس، عجیب خوب کد میزند.
تا ۲۶ اوت ۲۰۲۶ راز فاش شد: شرکت چینی Z.ai گفت Ox Alpha همان GLM-5.3-Flash بوده — تست مخفی قبل از معرفی رسمی، تا بدون تأثیر اسم برند بازخورد واقعی بگیرد. این صفحه همان داستان را کامل و خودمونی میگوید.
داستان Ox Alpha از کجا شروع شد؟
در ۲۰ اوت ۲۰۲۶ مدلی با شناسه stealth/ox-alpha روی سرویسهایی مثل OpenRouter و OpenCode آمد. کلمهی Stealth تقریباً یعنی «مخفی». OpenRouter هم نوشته بود سازنده نمیخواهد در دوران آزمایش هویتش مشخص شود.
کاربران — مخصوصاً در برنامهنویسی و پروژههایی که AI باید چند مرحله پشتسرهم کار کند — مدل را امتحان کردند. خیلی زود توجه جلب شد و سؤال بزرگ این شد: چه شرکتی پشت این مدل است؟
حدسها زیاد بود؛ بعضی از روی رفتار مدل احتمال میدادند به خانواده GLM مربوط باشد، ولی تا اعلام رسمی Z.ai چیزی قطعی نبود. چند روز بعد Z.ai گفت: Ox Alpha همان GLM-5.3-Flash بوده. حتی میگوید در آن هفته یکی از محبوبترین مدلها شد و ترافیکش روی زیرساخت مبتنی بر تراشههای هوش مصنوعی چینی سرو شده است.
نکته جذاب: Z.ai عمداً اسمش را پنهان کرده بود تا واکنش واقعی کاربران را ببیند — نه اینکه مدلی از ناکجاآباد آمده باشد.عدد «۳۲۰ میلیارد پارامتر» یعنی چه؟
گاهی گفته میشود مدل «۳۲۰ میلیارد قطعه دانش» دارد؛ این تعبیر دقیق نیست. پارامترها اعداد و وزنهایی هستند که مدل در زمان آموزش یاد گرفته — مثل میلیاردها تنظیم کوچک داخل یک مغز مصنوعی بزرگ.
GLM-5.3-Flash حدود ۳۲۰ میلیارد پارامتر دارد؛ ولی هنگام پاسخ، همه به یک اندازه درگیر نمیشوند. Z.ai میگوید در هر مرحله حدود ۱۸ میلیارد پارامتر فعال استفاده میشود.
مثال ساده: شرکت ۳۲۰ کارمند متخصص دارد. اگر سؤال حسابداری باشد، لازم نیست هر ۳۲۰ نفر وارد جلسه شوند — فقط تیمهای لازم. در AI به ایدهای شبیه این معمولاً Mixture of Experts (MoE) میگویند.
کانتکست یک میلیون توکنی یعنی چه؟
Context Window یعنی ظرفیت حافظهٔ کاری مدل هنگام جواب دادن: چقدر سند، کد، توضیح و پیام را میتواند یکجا «جلوی چشم» نگه دارد.
GLM-5.3-Flash حدود ۱٬۰۴۸٬۵۷۶ توکن — تقریباً یک میلیون — پشتیبانی میکند. برای پروژههای بزرگ برنامهنویسی، تحلیل مجموعه فایلها، مکالمههای طولانی، Agentهایی با دهها/صدها مرحله، و اسناد خیلی بلند مهم است.
کانتکست بزرگ ≠ حافظهٔ ۱۰۰٪ دقیق؛ فقط ظرفیت ورودی را میگوید. کیفیت پیدا کردن اطلاعات داخل این حجم، بحث جداست.فقط متن نیست؛ تصویر و ویدیو هم میگیرد
Z.ai این مدل را اولین مدل خانواده GLM-5 با ورودی نیتیو چندرسانهای (Multimodal) معرفی میکند. میتوانید متن، تصویر و ویدیو بدهید و پاسخ متنی بگیرید. OpenRouter هم برای Ox Alpha ورودی Text + Image + Video ثبت کرده بود.
در برنامهنویسی مهم میشود: بهجای «یک داشبورد بساز»، اسکرین میدهید و میگویید «صفحهای شبیه این بساز». مدل کد میسازد، ظاهر را بررسی میکند و در سیستم Agent دوباره اصلاح میکند. Z.ai روی فرانتاند، Browser Use و Computer Use تأکید کرده است.
چرا برنامهنویسها از Ox Alpha خوششان آمدند؟
قدرت اصلی فقط «جواب سؤال کدنویسی» نیست. وقتی به یک AI Agent میگویید «این پروژه را بررسی کن، باگ را پیدا کن و درستش کن»، چتبات ساده شاید چند خط پیشنهاد بدهد؛ اما Agent میتواند مسیر واقعی را طی کند:
این همان Agentic Coding است: دهها یا صدها مرحله بدون فراموش کردن هدف. OpenRouter از اول Ox Alpha را برای کار مهندسی نرمافزار طولانیمدت و Sustained Agentic Work معرفی کرده بود — بیشتر دستیار کدنویسی و Coding Agent تا یک چتبات معمولی.
بنچمارک DeepSWE چیست و عدد ۶۳٫۴ یعنی چه؟
وقتی شرکتها میگویند مدل در برنامهنویسی قوی است، فقط «کد پایتون بنویس» نمیپرسند. در DeepSWE مدل با مسئلههایی شبیه کار واقعی مهندس نرمافزار روبهرو میشود: ورود به پروژه، پیدا کردن علت، تغییر کد، پاس کردن تستها.
نتایج رسمی Z.ai برای DeepSWE v1.1:
یعنی در جدول خود Z.ai، مدل Flash نسبت به نسل قبلی جهش داشته و در این تست بالاتر از عدد گزارششده برای Opus 4.8 آمده. ولی این جمله را تبدیل نکنیم به «پس از Claude بهتر است» — یک بنچمارک فقط یک زاویه است.
تست مستقل کاربران چه نتیجهای داد؟
قبل از فاش شدن هویت، تست مستقلی روی نسخه ناشناس انجام شد: روی ۱۱۳ مسئله DeepSWE، مدل ۶۶ مورد را کاملاً حل کرد — یعنی حدود ۵۸٫۴٪ موفقیت کامل. در خیلی از موارد حلنشده هم به جواب نزدیک شده بود، ولی معیار سختگیرانه بود.
عدد مستقل ۵۸٫۴٪ و عدد رسمی ۶۳٫۴ را مثل دو نتیجه کاملاً همشرایط کنار هم نگذارید؛ روش اجرا، Agent Harness و تنظیمات میتواند فرق کند. برداشت منطقی: هم تست مستقل و هم رسمی نشان میدهند مدل در مهندسی نرمافزار جدی است — چند درصد اختلاف را بیش از حد تفسیر نکنید.
در بقیه آزمونها چه کرده؟
نتایج رسمی فقط DeepSWE نیست. چند نمونه از جدول Z.ai:
لازم نیست اسمها را حفظ کنید. پیام جدول این است: Z.ai مدل را فقط برای چت نساخته؛ تمرکز بزرگ روی کدنویسی، ابزار، محیط و کارهای چندمرحلهای است.
چطور یک میلیون توکن را با هزینه کمتر مدیریت میکند؟
در Transformer معمولی، هرچه متن طولانیتر شود، مدیریت ارتباط بین توکنها خیلی گران میشود — مثل مهمانی ۱۰ نفره در برابر صدها هزار نفر که همه باید وضعیت همه را چک کنند.
GLM-5.3-Flash از ترکیب Sparse Attention و Linear Attention استفاده میکند: همیشه مجبور نیست همه بخشهای متن را با شدت یکسان به همه ربط دهد؛ محاسبات را هوشمندانهتر متمرکز میکند. طبق اطلاعات منتشرشده، نسبت به GLM-5.3 میتواند محاسبات Attention را حدود ۳ برابر کم کند و اندازه KV Cache را حدود ۴٫۴ برابر کوچکتر کند — دقیقاً چیزی که برای کانتکست یکمیلیونی مهم است.
آیا GLM-5.3-Flash واقعاً «رایگان» است؟
در دوره Ox Alpha دسترسی رایگان و سخاوتمندانه بود؛ این را با وضعیت دائمی اشتباه نگیرید. GLM-5.3-Flash حالا مدل رسمی است و API لزوماً رایگان نیست.
از طرف دیگر وزنهای مدل منتشر شدهاند روی Hugging Face با شناسه zai-org/GLM-5.3-Flash و مجوز MIT. ولی هشدار: وزنباز بودن یعنی فایل در دسترس است — نه اینکه اجرای کامل روی لپتاپ معمولی ساده باشد. با بیش از ۳۲۰ میلیارد پارامتر، سختافزار خیلی قوی لازم است. برای اکثر کاربران، API یا سرویس میزبانیشده منطقیتر از Self-host نسخه کامل است.
وزن: zai-org/GLM-5.3-Flash (MIT)
کانتکست: ~1,048,576 tokens
پس چرا این مدل مهم است؟
جذابترین بخش فقط عدد بنچمارک نیست. مدل چند روز بدون اینکه کاربران بدانند چه برندی پشتش است آزمایش شد — نه لوگوی معروف، نه اسم Google و OpenAI و Anthropic. کاربران فقط خروجی را دیدند؛ بعد مشخص شد مال Z.ai است.
کاملاً مثل آزمایش دانشگاهی کنترلشده نیست؛ ولی بخشی از تأثیر اسم برند را از تجربه اولیه حذف میکند.
آیا باید GLM-5.3-Flash را امتحان کنیم؟
اگر فقط سؤال روزمره میپرسید، تفاوت مدلها همیشه محسوس نیست. ولی اگر Agent میسازید، با Agent کد مینویسید، پروژه بزرگ بررسی میکنید، با ترمینال کار میکنید، UI از روی تصویر میسازید، سند طولانی تحلیل میکنید یا سیستم چندمرحلهای طولانی میخواهید — ارزش آزمایش دارد.
بهترین روش فقط نگاه به جدول نیست: یک پروژه واقعی خودتان را به چند مدل بدهید — GLM-5.3-Flash در برابر Claude / GPT / Gemini / DeepSeek — و ببینید کدام کار شما را بهتر انجام میدهد. مهمترین بنچمارک همین است: آیا مدل کار واقعی شما را درست انجام میدهد یا نه؟