خبر هوش مصنوعی | به زبان ساده

Ox Alpha چیست؟ مدل مرموزی که بی‌نام آمد و همه را غافلگیر کرد

چند روز پیش یک مدل هوش مصنوعی عجیب روی اینترنت ظاهر شد. اسمش Ox Alpha بود — نه معلوم بود کدام شرکت ساخته، نه لوگویی داشت، نه حتی مشخص بود مال کدام کشور است. فقط گفته بودند قوی است برای کدنویسی، حل مسئله و کارهای چندمرحله‌ای با AI Agent. خیلی زود برنامه‌نویس‌ها فهمیدند: این مدل ناشناس، عجیب خوب کد می‌زند.

تا ۲۶ اوت ۲۰۲۶ راز فاش شد: شرکت چینی Z.ai گفت Ox Alpha همان GLM-5.3-Flash بوده — تست مخفی قبل از معرفی رسمی، تا بدون تأثیر اسم برند بازخورد واقعی بگیرد. این صفحه همان داستان را کامل و خودمونی می‌گوید.

۱

داستان Ox Alpha از کجا شروع شد؟

در ۲۰ اوت ۲۰۲۶ مدلی با شناسه stealth/ox-alpha روی سرویس‌هایی مثل OpenRouter و OpenCode آمد. کلمه‌ی Stealth تقریباً یعنی «مخفی». OpenRouter هم نوشته بود سازنده نمی‌خواهد در دوران آزمایش هویتش مشخص شود.

کاربران — مخصوصاً در برنامه‌نویسی و پروژه‌هایی که AI باید چند مرحله پشت‌سرهم کار کند — مدل را امتحان کردند. خیلی زود توجه جلب شد و سؤال بزرگ این شد: چه شرکتی پشت این مدل است؟

حدس‌ها زیاد بود؛ بعضی از روی رفتار مدل احتمال می‌دادند به خانواده GLM مربوط باشد، ولی تا اعلام رسمی Z.ai چیزی قطعی نبود. چند روز بعد Z.ai گفت: Ox Alpha همان GLM-5.3-Flash بوده. حتی می‌گوید در آن هفته یکی از محبوب‌ترین مدل‌ها شد و ترافیکش روی زیرساخت مبتنی بر تراشه‌های هوش مصنوعی چینی سرو شده است.

نکته جذاب: Z.ai عمداً اسمش را پنهان کرده بود تا واکنش واقعی کاربران را ببیند — نه اینکه مدلی از ناکجاآباد آمده باشد.
۲

عدد «۳۲۰ میلیارد پارامتر» یعنی چه؟

گاهی گفته می‌شود مدل «۳۲۰ میلیارد قطعه دانش» دارد؛ این تعبیر دقیق نیست. پارامترها اعداد و وزن‌هایی هستند که مدل در زمان آموزش یاد گرفته — مثل میلیاردها تنظیم کوچک داخل یک مغز مصنوعی بزرگ.

GLM-5.3-Flash حدود ۳۲۰ میلیارد پارامتر دارد؛ ولی هنگام پاسخ، همه به یک اندازه درگیر نمی‌شوند. Z.ai می‌گوید در هر مرحله حدود ۱۸ میلیارد پارامتر فعال استفاده می‌شود.

مثال ساده: شرکت ۳۲۰ کارمند متخصص دارد. اگر سؤال حسابداری باشد، لازم نیست هر ۳۲۰ نفر وارد جلسه شوند — فقط تیم‌های لازم. در AI به ایده‌ای شبیه این معمولاً Mixture of Experts (MoE) می‌گویند.

۳۲۰B کل ۱۸B فعال هر مرحله MoE پسوند Flash = سریع‌تر و اقتصادی‌تر
۳

کانتکست یک میلیون توکنی یعنی چه؟

Context Window یعنی ظرفیت حافظهٔ کاری مدل هنگام جواب دادن: چقدر سند، کد، توضیح و پیام را می‌تواند یک‌جا «جلوی چشم» نگه دارد.

GLM-5.3-Flash حدود ۱٬۰۴۸٬۵۷۶ توکن — تقریباً یک میلیون — پشتیبانی می‌کند. برای پروژه‌های بزرگ برنامه‌نویسی، تحلیل مجموعه فایل‌ها، مکالمه‌های طولانی، Agentهایی با ده‌ها/صدها مرحله، و اسناد خیلی بلند مهم است.

کانتکست بزرگ ≠ حافظهٔ ۱۰۰٪ دقیق؛ فقط ظرفیت ورودی را می‌گوید. کیفیت پیدا کردن اطلاعات داخل این حجم، بحث جداست.
۴

فقط متن نیست؛ تصویر و ویدیو هم می‌گیرد

Z.ai این مدل را اولین مدل خانواده GLM-5 با ورودی نیتیو چندرسانه‌ای (Multimodal) معرفی می‌کند. می‌توانید متن، تصویر و ویدیو بدهید و پاسخ متنی بگیرید. OpenRouter هم برای Ox Alpha ورودی Text + Image + Video ثبت کرده بود.

در برنامه‌نویسی مهم می‌شود: به‌جای «یک داشبورد بساز»، اسکرین می‌دهید و می‌گویید «صفحه‌ای شبیه این بساز». مدل کد می‌سازد، ظاهر را بررسی می‌کند و در سیستم Agent دوباره اصلاح می‌کند. Z.ai روی فرانت‌اند، Browser Use و Computer Use تأکید کرده است.

📝 متن 🖼️ تصویر 🎬 ویدیو
۵

چرا برنامه‌نویس‌ها از Ox Alpha خوششان آمدند؟

قدرت اصلی فقط «جواب سؤال کدنویسی» نیست. وقتی به یک AI Agent می‌گویید «این پروژه را بررسی کن، باگ را پیدا کن و درستش کن»، چت‌بات ساده شاید چند خط پیشنهاد بدهد؛ اما Agent می‌تواند مسیر واقعی را طی کند:

فایل بخوان جست‌وجو ترمینال تست اصلاح

این همان Agentic Coding است: ده‌ها یا صدها مرحله بدون فراموش کردن هدف. OpenRouter از اول Ox Alpha را برای کار مهندسی نرم‌افزار طولانی‌مدت و Sustained Agentic Work معرفی کرده بود — بیشتر دستیار کدنویسی و Coding Agent تا یک چت‌بات معمولی.

۶

بنچمارک DeepSWE چیست و عدد ۶۳٫۴ یعنی چه؟

وقتی شرکت‌ها می‌گویند مدل در برنامه‌نویسی قوی است، فقط «کد پایتون بنویس» نمی‌پرسند. در DeepSWE مدل با مسئله‌هایی شبیه کار واقعی مهندس نرم‌افزار روبه‌رو می‌شود: ورود به پروژه، پیدا کردن علت، تغییر کد، پاس کردن تست‌ها.

نتایج رسمی Z.ai برای DeepSWE v1.1:

GLM-5.3-Flash → ۶۳٫۴ GLM-5.2 → ۴۶٫۲ Claude Opus 4.8 → ۵۸٫۰

یعنی در جدول خود Z.ai، مدل Flash نسبت به نسل قبلی جهش داشته و در این تست بالاتر از عدد گزارش‌شده برای Opus 4.8 آمده. ولی این جمله را تبدیل نکنیم به «پس از Claude بهتر است»یک بنچمارک فقط یک زاویه است.

اسکرین‌شات رسمی DeepSWE از بلاگ Z.ai
اسکرین‌شات از بلاگ رسمی Z.ai — DeepSWE
۷

تست مستقل کاربران چه نتیجه‌ای داد؟

قبل از فاش شدن هویت، تست مستقلی روی نسخه ناشناس انجام شد: روی ۱۱۳ مسئله DeepSWE، مدل ۶۶ مورد را کاملاً حل کرد — یعنی حدود ۵۸٫۴٪ موفقیت کامل. در خیلی از موارد حل‌نشده هم به جواب نزدیک شده بود، ولی معیار سخت‌گیرانه بود.

عدد مستقل ۵۸٫۴٪ و عدد رسمی ۶۳٫۴ را مثل دو نتیجه کاملاً هم‌شرایط کنار هم نگذارید؛ روش اجرا، Agent Harness و تنظیمات می‌تواند فرق کند. برداشت منطقی: هم تست مستقل و هم رسمی نشان می‌دهند مدل در مهندسی نرم‌افزار جدی است — چند درصد اختلاف را بیش از حد تفسیر نکنید.

۸

در بقیه آزمون‌ها چه کرده؟

نتایج رسمی فقط DeepSWE نیست. چند نمونه از جدول Z.ai:

Terminal Bench 2.1 → ۸۴٫۳ Toolathlon → ۷۸٫۴ AutomationBench → ۴۸٫۸

لازم نیست اسم‌ها را حفظ کنید. پیام جدول این است: Z.ai مدل را فقط برای چت نساخته؛ تمرکز بزرگ روی کدنویسی، ابزار، محیط و کارهای چندمرحله‌ای است.

اسکرین‌شات کیفیت در برابر هزینه از سایت
اسکرین‌شات از سایت — کیفیت در برابر هزینه (Artificial Analysis)
۹

چطور یک میلیون توکن را با هزینه کمتر مدیریت می‌کند؟

در Transformer معمولی، هرچه متن طولانی‌تر شود، مدیریت ارتباط بین توکن‌ها خیلی گران می‌شود — مثل مهمانی ۱۰ نفره در برابر صدها هزار نفر که همه باید وضعیت همه را چک کنند.

GLM-5.3-Flash از ترکیب Sparse Attention و Linear Attention استفاده می‌کند: همیشه مجبور نیست همه بخش‌های متن را با شدت یکسان به همه ربط دهد؛ محاسبات را هوشمندانه‌تر متمرکز می‌کند. طبق اطلاعات منتشرشده، نسبت به GLM-5.3 می‌تواند محاسبات Attention را حدود ۳ برابر کم کند و اندازه KV Cache را حدود ۴٫۴ برابر کوچک‌تر کند — دقیقاً چیزی که برای کانتکست یک‌میلیونی مهم است.

اسکرین‌شات کارایی معماری از بلاگ Z.ai
اسکرین‌شات از بلاگ رسمی Z.ai — هزینه Attention و KV cache
۱۰

آیا GLM-5.3-Flash واقعاً «رایگان» است؟

در دوره Ox Alpha دسترسی رایگان و سخاوتمندانه بود؛ این را با وضعیت دائمی اشتباه نگیرید. GLM-5.3-Flash حالا مدل رسمی است و API لزوماً رایگان نیست.

از طرف دیگر وزن‌های مدل منتشر شده‌اند روی Hugging Face با شناسه zai-org/GLM-5.3-Flash و مجوز MIT. ولی هشدار: وزن‌باز بودن یعنی فایل در دسترس است — نه اینکه اجرای کامل روی لپ‌تاپ معمولی ساده باشد. با بیش از ۳۲۰ میلیارد پارامتر، سخت‌افزار خیلی قوی لازم است. برای اکثر کاربران، API یا سرویس میزبانی‌شده منطقی‌تر از Self-host نسخه کامل است.

API: glm-5.3-flash
وزن: zai-org/GLM-5.3-Flash (MIT)
کانتکست: ~1,048,576 tokens
۱۱

پس چرا این مدل مهم است؟

جذاب‌ترین بخش فقط عدد بنچمارک نیست. مدل چند روز بدون اینکه کاربران بدانند چه برندی پشتش است آزمایش شد — نه لوگوی معروف، نه اسم Google و OpenAI و Anthropic. کاربران فقط خروجی را دیدند؛ بعد مشخص شد مال Z.ai است.

کاملاً مثل آزمایش دانشگاهی کنترل‌شده نیست؛ ولی بخشی از تأثیر اسم برند را از تجربه اولیه حذف می‌کند.

۱۲

آیا باید GLM-5.3-Flash را امتحان کنیم؟

اگر فقط سؤال روزمره می‌پرسید، تفاوت مدل‌ها همیشه محسوس نیست. ولی اگر Agent می‌سازید، با Agent کد می‌نویسید، پروژه بزرگ بررسی می‌کنید، با ترمینال کار می‌کنید، UI از روی تصویر می‌سازید، سند طولانی تحلیل می‌کنید یا سیستم چندمرحله‌ای طولانی می‌خواهید — ارزش آزمایش دارد.

بهترین روش فقط نگاه به جدول نیست: یک پروژه واقعی خودتان را به چند مدل بدهید — GLM-5.3-Flash در برابر Claude / GPT / Gemini / DeepSeek — و ببینید کدام کار شما را بهتر انجام می‌دهد. مهم‌ترین بنچمارک همین است: آیا مدل کار واقعی شما را درست انجام می‌دهد یا نه؟

جمع‌بندی

Ox Alpha مدل اسرارآمیز از آزمایشگاه ناشناخته نبود. Z.ai مدل GLM-5.3-Flash را قبل از معرفی رسمی با نام Ox Alpha روی OpenRouter و OpenCode گذاشت تا کاربران بدون دانستن سازنده امتحانش کنند. بعد مشخص شد با مدل حدود ۳۲۰B / ۱۸B فعال طرفیم؛ کانتکست یک‌میلیونی، ورودی متن/تصویر/ویدیو، وزن منتشرشده، و تمرکز جدی روی کدنویسی و Agent.

خلاصه یک‌خطی: Ox Alpha همان GLM-5.3-Flash از Z.ai بود؛ چندرسانه‌ای و وزن‌باز، برای کدنویسی، Agentها و کانتکست خیلی طولانی.

جالب‌ترین بخش: اول مردم خروجی را دیدند؛ بعد فهمیدند چه برندی پشتش بوده. منبع: بلاگ Z.ai + گزارش‌های جامعه DeepSWE.