هر چند وقت یک‌بار یک مدل هوش مصنوعی جدید معرفی می‌شود که در نگاه اول شبیه یک به‌روزرسانی معمولی است، اما در عمل تصویر رقابت را جابه‌جا می‌کند. GLM-5.3 از همین جنس است؛ نه به این دلیل که مدل پایه‌ای بزرگ‌تر یا معماری تازه‌ای دارد، بلکه چون Z.ai توانسته با تمرکز بالا روی Post-training، در چند بنچمارک کلیدی کدنویسی و اتوماسیون جهش‌هایی چندین‌برابری ثبت کند.

در این مقاله، GLM-5.3 را از زاویه‌ی مشخصات، بنچمارک‌های رسمی Z.ai، اولین ارزیابی مستقل و بازخورد کاربران بررسی می‌کنیم و نقاط ضعف و قدرت این مدل را می‌بینیم.

GLM-5.3 چیست؟

تمام جهش عملکردی GLM-5.3 از مقیاس‌دهی و بهبود فرایند Post-training می‌آید

Z.ai، آزمایشگاه چینی جدا‌شده از دانشگاه تسینگهوا که پیش‌تر با نام Zhipu AI شناخته می‌شد، در ۱۴ آگوست ۲۰۲۶ از GLM-5.3 رونمایی کرد. نکته‌ی مهم این عرضه، مسیر متفاوت آن است: مدل جدید همان مدل پایه‌ی ۷۴۳ میلیارد پارامتری GLM-5.2 را حفظ کرده و هیچ تغییری در معماری یا اندازه‌ی آن داده نشده است.

به گفته‌ی Z.ai، تمام جهش عملکردی از مقیاس‌دهی و بهبود فرایند پس‌آموزش (Post-training) می‌آید؛ یعنی مدل روی محیط‌های اجرایی و وظایف واقعی‌تر مهندسی نرم‌افزار، از تشخیص گلوگاه در زیرساخت یادگیری ماشین گرفته تا تغییر کد، اجرای تست و تحویل نتیجه نهایی آموزش داده شده است.

تمرکز اصلی GLM-5.3 روی سه حوزه‌ی کدنویسی طولانی‌مدت در محیط ترمینال، کار عامل‌محور روی پروژه‌های چندفایلی و تحلیل امنیتی است. این ترکیب باعث شده Z.ai آن را با شعار «Built to Code. Ready for Cyber Defense» معرفی کند.

امنیت سایبری؛ قابلیت غافلگیرکننده GLM-5.3

Z.ai بخش قابل‌توجهی از Post-training مدل را به داده‌ها و محیط‌های مرتبط با کشف آسیب‌پذیری اختصاص داده است.

GLM-5.3 ابزاری جدی برای تحلیل امنیتی است

به گفته‌ی شرکت، هدف اولیه فقط بهتر شدن در پیدا کردن باگ‌های منفرد بود، اما در عمل مدل توانایی بیشتری برای دنبال‌کردن زنجیره‌ی چندمرحله‌ای بهره‌برداری از آسیب‌پذیری‌ها نشان داد؛ نتیجه‌ای که Z.ai می‌گوید از قبل برنامه‌ریزی‌شده نبود.

Z.ai همچنین اعلام کرده که در آزمایش روی ۲۶۹ پروژه‌ی متن‌باز، GLM-5.3 به ۲٬۴۳۶ آسیب‌پذیری رسیده که ۱٬۰۹۷ مورد از آن‌ها در دسته‌ی شدت متوسط تا بالا قرار داشته‌اند؛ از جمله در نرم‌افزارهایی مثل هسته‌های سیستم‌عامل، موتورهای مرورگر و زیرساخت‌های متن‌باز. این آسیب‌پذیری‌ها به‌طور میانگین ۲۶٫۶ سال در کدها باقی مانده بودند و قدیمی‌ترین مورد به سال ۱۹۸۱ برمی‌گردد.

GLM-5.3 در ۲۶۹ پروژه متن‌باز، ۲۴۳۶ آسیب‌پذیری پیدا کرد

این اعداد ادعای خود Z.ai هستند و همچنان نباید با یک آزمون امنیتی مستقل اشتباه گرفته شوند. با این حال، جهت‌گیری محصول روشن است؛ GLM-5.3 فقط یک مدل کدنویسی نیست و Z.ai آن را به‌عنوان یک ابزار جدی برای تحلیل امنیتی هم مطرح می‌کند و به همین دلیل انتشار عمومی وزن‌هایش هم با تأخیر و بررسی ایمنی بیشتری همراه شده است.

وزن‌های GLM-5.3 چه زمانی در دسترس قرار می‌گیرند؟

برخلاف نسل‌های قبلی GLM که با مجوز MIT و به‌صورت کاملاً باز عرضه شده بودند، وزن‌های GLM-5.3 در زمان رونمایی منتشر نشدند. Z.ai دلیل این تأخیر را نیاز به تکمیل ارزیابی‌های ایمنی، به‌ویژه با توجه به قابلیت‌های امنیت سایبری مدل، اعلام کرده و گفته انتشار عمومی وزن‌ها حدود دو هفته پس از رونمایی، یعنی حوالی پایان آگوست ۲۰۲۶، در نظر گرفته شده است.

انتشار عمومی وزن‌های GLM-5.3 به‌دلیل توانایی بالای مدل در کشف آسیب‌پذیری‌های امنیتی به تعویق افتاده است

تا زمان نگارش این مقاله، این وزن‌ها هنوز منتشر نشده‌اند و توصیف GLM-5.3 به‌عنوان یک مدل «کاملاً باز» باید فعلاً زمان آینده در نظر گرفته شود، نه وضعیت فعلی. در حال حاضر، تنها راه استفاده از این مدل، API رسمی Z.ai و طرح Coding Plan است.

مشخصات فنی GLM-5.3 چیست؟

GLM-5.3 در حال حاضر مدلی کاملاً متنی است و ورودی تصویری بومی ندارد. پنجره‌ی کانتکست آن یک میلیون توکن است و حداکثر طول خروجی به ۱۲۸ هزار توکن می‌رسد. یکی از تغییرات مهم نسبت به نسل قبل این است که در GLM-5.3 استدلال (reasoning) همیشه فعال است و دیگر امکان غیرفعال‌کردن کامل آن وجود ندارد.

GLM-5.3 در حال حاضر مدلی کاملاً متنی است و ورودی تصویری بومی ندارد

کاربر فقط می‌تواند شدت استدلال را در سه سطح low، high و max تنظیم کند که max به‌صورت پیش‌فرض انتخاب شده است.

توسعه‌دهندگانی که پیش‌تر درخواست‌هایشان را با غیرفعال‌کردن reasoning می‌فرستادند، هنگام مهاجرت باید این تنظیم را به سطح low تغییر دهند، وگرنه درخواست رد می‌شود.

ویژگی

GLM-5.3

مدل پایه

همان پایه‌ی ۷۴۳ میلیاردی GLM-5.2؛ بهبودها صرفاً از Post-training

نوع ورودی و خروجی

متن به متن

پنجره‌ی زمینه

۱ میلیون توکن

حداکثر خروجی

۱۲۸ هزار توکن

استدلال

همیشه فعال؛ سه سطح low / high / max (پیش‌فرض max)

فراخوانی ابزار، خروجی ساختاریافته، کش کردن زمینه، استریم

پشتیبانی می‌شود

تاریخ عرضه

۱۴ آگوست ۲۰۲۶

GLM-5.3 در کدام بخش واقعاً تغییر کرده است؟

بخش اصلی ادعای Z.ai مربوط به وظایف طولانی و عامل‌محور است. جدول زیر نتایج رسمی منتشرشده توسط خود شرکت را در برابر GLM-5.2 نشان می‌دهد.

بنچمارک

چه چیزی را می‌سنجد

GLM-5.3

GLM-5.2

Terminal-Bench 3.0

کدنویسی عامل‌محور در محیط ترمینال

۲۸٫۳٪

۴٫۶٪

DeepSWE v1.1

حل وظایف بلندمدت مهندسی نرم‌افزار

۶۶٫۹٪

۴۶٫۲٪

AutomationBench v1.0.6

اجرای گردش‌کارهای سازمانی چندمرحله‌ای

۴۸٫۲٪

۲۶٫۲٪

Agents' Last Exam (pass@1)

وظایف دشوار چندمرحله‌ای عامل هوش مصنوعی

۲۸٫۵٪

۲۳٫۸٪

Z.ai Code Bench (سطح Max، نرخ تکمیل)

عملکرد در محیط‌های توسعه‌ی محلی واقعی

۳۴٫۵٪ (~۷۵ هزار توکن خروجی)

۲۳٫۴٪ (~۹۶ هزار توکن خروجی)

GDPval-AA v2 (امتیاز Elo، ارزیابی مستقل Artificial Analysis)

انجام کارهای دانشی و حرفه‌ای

۱۷۶۹

۱۵۰۸

نکته‌ی جالب در همین جدول این است که Z.ai فقط از افزایش دقت صحبت نمی‌کند؛ در بنچمارک داخلیZ.ai Code Bench، مدل جدید در سطح Max با مصرف توکن کمتر (حدود ۷۵ هزار در برابر ۹۶ هزار توکن) به نتیجه‌ی بهتری رسیده است. با این حال، همان‌طور که در بخش بعد می‌بینیم، ارزیابی مستقل Artificial Analysis روایت دیگری از کارایی توکنی GLM-5.3 ارائه می‌دهد.

همه‌ی نتایج بالا (به‌جز GDPval-AA v2 که از Artificial Analysis گرفته شده) از ارزیابی‌های منتشرشده‌ی خود Z.ai هستند. Terminal-Bench 3.0 بنچمارکی عمومی است، اما Z.ai آن را با پیکربندی و هارنس اختصاصی خودش (Claude Code 2.1.207) اجرا کرده و Z.ai Code Bench هم کاملاً خصوصی است. بنابراین این اعداد جهت پیشرفت را به‌خوبی نشان می‌دهند، اما جای اجرای مستقل و قابل‌بازتولید را نمی‌گیرند.

GLM-5.3 در برابر رقبا

تصویر واقعی پیچیده‌تر از تیترهایی مثل قوی‌ترین مدل کدنویسی جهان است. در جدول منتشرشده توسط Z.ai، این مدل جدید در بعضی ارزیابی‌ها از مدل‌های بسته‌ی رقیب عقب می‌ماند.

بنچمارک (چه چیزی را می‌سنجد)

GLM-5.3

GPT-5.6 Sol

Claude Fable 5

Claude Mythos 5

Terminal-Bench 3.0 (کدنویسی عامل‌محور در محیط ترمینال)

۲۸٫۳٪

۳۴٫۶٪

۳۳٫۷٪

DeepSWE v1.1 (حل وظایف بلندمدت مهندسی نرم‌افزار)

۶۶٫۹٪

۷۲٫۷٪

۶۹٫۷٪

Z.ai Code Bench، سطح Max (نرخ تکمیل وظیفه در محیط توسعه‌ی محلی واقعی)

۳۴٫۵٪

۳۹٫۵٪

Z.ai Code Bench، سطح High

۳۱٫۴٪

— (Claude Opus 4.8: ۲۹٫۵٪)

CyberGym (پیداکردن و اثبات آسیب‌پذیری امنیتی در کد)

۸۴٫۵٪

۸۳٫۶٪

۸۳٫۸٪

ExploitBench (نوشتن یک اکسپلویت کاربردی از آسیب‌پذیری پیداشده)

۵۴٫۴٪

۷۶٫۵٪

۷۸٫۰٪

ExploitGym، بودجه‌ی شش‌ساعته (تعداد این کدهای اکسپلویت کامل‌شده در زمان محدود)

۱۳۰ وظیفه

۲۴۷ وظیفه

الگوی این جدول واضح است: هرچه یک آزمون در زنجیره‌ی «کشف آسیب‌پذیری تا ساخت اکسپلویت کامل» عمیق‌تر می‌شود، فاصله‌ی GLM-5.3 با مدل‌های بسته‌ی رقیب بیشتر می‌شود.

نتایج ارزیابی عملکرد مدل جدید GLM-5.3 در برابر مدل‌های رقیب مانند GPT-5.6 و Kimi K3 در آزمون‌های تخصصی کدنویسی و برنامه‌نویسی.

تمرکز GLM-5.3 روی دفاع سایبری است، نه تولید اکسپلویت

در CyberGym که کشف و اعتبارسنجی آسیب‌پذیری از روی کد منبع را می‌سنجد، GLM-5.3 بالاترین امتیاز را دارد؛ اما در ExploitBench و ExploitGym که ساخت اکسپلویت واقعی را ارزیابی می‌کنند، هم Claude Mythos 5 و هم GPT-5.6 Sol فاصله‌ی معناداری با آن دارند.

Z.ai این الگو را طبیعی می‌داند و می‌گوید تمرکز GLM-5.3 روی دفاع سایبری است، نه تولید اکسپلویت.

نتایج ارزیابی توانایی‌های امنیت سایبری مدل‌های مختلف هوش مصنوعی در بنچمارک‌های تخصصی

در مقابل، در AutomationBench که اجرای گردش‌کارهای سازمانی چندمرحله‌ای را می‌سنجد، GLM-5.3 با ۴۸٫۲ درصد از مدل‌های ذکرشده در جدول Z.ai جلوتر است. این نشان می‌دهد که عملکرد عامل هوش مصنوعی یک معیار واحد نیست و بسته به نوع تسک، رتبه‌بندی مدل‌ها می‌تواند کاملاً تغییر کند.

ارزیابی‌های مستقل در مورد GLM-5.3 چه می‌گویند؟

مهم‌ترین داده‌ی مستقلی که پس از عرضه‌ی GLM-5.3 منتشر شده، از Artificial Analysis است؛ مجموعه‌ای که مدل‌ها را با شاخص ترکیبی Intelligence Index و ارزیابی‌های خودش مقایسه می‌کند، نه با اعداد سازنده. طبق این ارزیابی، GLM-5.3 در حالت max امتیاز ۶۰ گرفته که هفت واحد بالاتر از GLM-5.2 است و آن را هم‌تراز با Kimi K3، در جایگاه مدل باز رتبه‌بالای فعلی، قرار می‌دهد. مدل‌های بسته‌ی رده‌بالا مانند Claude Opus 5 همچنان امتیاز بالاتری دارند.

رتبه‌بندی مدل‌های مختلف هوش مصنوعی بر اساس معیارهای ارزیابی شاخص تحلیل مصنوعی

GLM-5.3 پرحرف‌تر از GLM-5.2 شده است

نتایج جالب‌تر Artificial Analysis درباره‌ی هزینه و کارایی توکنی است. برخلاف ادعای Z.ai مبنی بر کارآمدتر شدن مصرف توکن، این ارزیابی مستقل نشان می‌دهد GLM-5.3 با وجود قیمت پایین‌تر، پرحرف‌تر شده است.

تحلیل عملکرد مدل‌های مختلف هوش مصنوعی از نظر میزان هوش، سرعت تولید توکن و هزینه انجام هر تسک در مقایسه با مدل GLM-5.3

مدل برای هر وظیفه به‌طور میانگین حدود ۱۸٬۷۰۰ توکن خروجی تولید می‌کند، در برابر حدود ۱۵٬۷۰۰ توکن برای GLM-5.2 و حدود ۱۴٬۷۰۰ توکن برای Kimi K3. با این حال، چون قیمت هر توکن GLM-5.3 پایین است، هزینه‌ی هر وظیفه (حدود ۰٫۶۸ دلار) هنوز کمتر از Kimi K3 (حدود ۰٫۸۴ دلار) و GPT-5.6 Sol (حدود ۱٫۲۳ دلار) است، هرچند نسبت به هزینه‌ی حدود ۰٫۳۳ دلاری GLM-5.2 گران‌تر شده است.

GLM-5.3 در کارهای دانشی و حرفه‌ای از Kimi K3 بیش از صد واحد جلوتر است

نکته‌ای که بیشتر پوشش رسانه‌ای گرفته، جهش GLM-5.3 در GDPval-AA v2 است؛ ارزیابی مستقل Artificial Analysis برای کارهای دانشی و حرفه‌ای واقعی. امتیاز مدل از ۱۵۲۴ به ۱۷۷۰ رسیده، یعنی تنها پشت سر Claude Opus 5 با ۱۸۵۵ قرار می‌گیرد و از Kimi K3 با ۱۶۶۸ هم بیش از صد واحد جلوتر است. این یکی از معدود شواهد مستقلی است که نشان می‌دهد جهش GLM-5.3 صرفاً یک ادعای بازاریابی نیست.

ارزیابی KingBench 3 را چقدر جدی بگیریم؟

عددی که بیشترین بازتاب را در ویدیوها و شبکه‌های اجتماعی داشته، امتیاز ۷۳ از ۸۰ (۹۱٫۲۵ درصد) در KingBench 3 است؛ نتیجه‌ای که AICodeKing در یک ارزیابی زودهنگام و شخصی از مدل گزارش کرده است. طبق همین گزارش، GLM-5.2 روی همان بنچمارک ۶۰ از ۸۰ گرفته بود، در حالی که Claude Fable 5 با ۶۶، Qwen3.8 Max با ۶۵ و Claude Opus 4.8 با ۶۴ امتیاز رتبه‌های بعدی را دارند.

امتیاز مدل‌ها در KingBench 3 بر اساس ارزیابی AICodeKing. این نتایج یک ارزیابی شخص ثالث و غیررسمی هستند و نباید با بنچمارک‌های استاندارد و مستقل مقایسه شوند.

اما KingBench 3 را نباید در کنار بنچمارک‌های رسمی و مستقل با همان سطح اعتبار قرار داد. این ارزیابی مجموعه‌ای ثابت از هشت وظیفه‌ی کدنویسی و شبیه‌سازی است که یک سازنده‌ی محتوا آن را طراحی و اجرا کرده، نه یک استاندارد صنعتی یا leaderboard مستقل و قابل‌بازتولید مانند ارزیابی‌های Artificial Analysis. بنابراین بهتر است از آن فقط به‌عنوان یک سیگنال اولیه و غیررسمی از عملکرد مدل یاد کرد، نه مدرکی برای برتری مطلق GLM-5.3.

قیمت GLM-5.3

قیمت رسمی API برای GLM-5.3 با GLM-5.2 یکسان مانده است.

نوع توکن

قیمت

ورودی

۱٫۴۰ دلار به ازای هر یک میلیون توکن

ورودی کش‌شده

۰٫۲۶ دلار به ازای هر یک میلیون توکن

خروجی

۴٫۴۰ دلار به ازای هر یک میلیون توکن

برای کاربرانی که ترجیح می‌دهند از طریق اشتراک ماهانه به GLM-5.3 دسترسی داشته باشند، Z.ai سرویس GLM Coding Plan را ارائه می‌کند. این سرویس در بازطراحی اخیر به سیستم سهمیه مبتنی بر اعتبار (Credit) تغییر کرده و پلن‌های آن از ۱۸ دلار در ماه شروع می‌شوند.

بازخورد اولیه کاربران از GLM-5.3

از عرضه‌ی GLM-5.3 بیش از یک هفته می‌گذرد؛ بنابراین بازخوردهای فعلی بیشتر تجربه‌های شخصی کاربران در انجمن‌هایی مثل ردیت ZaiGLM هستند تا نتیجه‌ی ارزیابی‌های مستقل و کنترل‌شده. بخشی از کاربران از افزایش استقلال مدل، کیفیت کدنویسی و پیشرفت آن نسبت به GLM-5.2 در ابزارهایی مثل OpenCode و ZCode رضایت دارند و می‌گویند مدل بهتر و پیوسته‌تر کار را تا پایان پیش می‌برد.

در مقابل، شکایت اصلی گروه دیگری از کاربران به مصرف بالای توکن و اتمام سریع سهمیه برمی‌گردد؛ نکته‌ای که با یافته‌های Artificial Analysis درباره‌ی پرحرفی بیشتر GLM-5.3 هم‌خوانی دارد. برخی کاربران هم گفته‌اند مدل گاهی کد را اجرا می‌کند، اما نتیجه به یک دور اصلاح دیگر نیاز دارد یا تست‌هایی می‌نویسد که به‌اندازه‌ی کافی مؤثر نیستند.

GLM-5.3 برای چه کسی مناسب است؟

GLM-5.3 با وجود پیشرفت‌هایش، همچنان یک مدل زبانی است و امکان تولید اطلاعات نادرست یا خطای منطقی در آن وجود دارد. بخش زیادی از اعداد اولیه‌ی این عرضه، از ارزیابی‌های خود Z.ai می‌آیند و تنها بخش کوچکی، مثل GDPval-AA v2 و شاخص Intelligence Index، از منبعی مستقل تأیید شده است.

همچنین نباید فراموش کرد که «عملکرد عامل هوش مصنوعی» یک معیار یکپارچه نیست. مدلی مثل GLM-5.3 ممکن است در کشف آسیب‌پذیری یا اتوماسیون گردش‌کار بسیار خوب عمل کند، اما در ساخت اکسپلویت کامل یا برخی وظایف بلندمدت کدنویسی همچنان از رقبای بسته عقب بماند

برای کارهایی که با کد اصلی، داده‌های حساس یا تصمیم‌گیری برای کاربران واقعی سروکار دارند، نظارت انسانی همچنان ضروری است.

اگر حوزه‌ی اصلی فعالیت شما به توسعه‌ی نرم‌افزار، رفع خطا، کار با مخزن‌های بزرگ یا اجرای وظایف چندمرحله‌ای توسط عامل کدنویسی مربوط می‌شود، مدل GLM-5.3 به‌ویژه به دلیل برخورداری از پنجره‌ی زمینه‌ی یک‌میلیون‌توکنی و قیمت API ارزان‌تر نسبت به بسیاری از مدل‌های رده‌بالا، ارزش بررسی دارد. در مقابل، از آنجا که این مدل ذاتا متنی است، گزینه‌ی مناسبی برای پردازش تصاویر یا تحلیل مستقیم اسکرین‌شات‌ها به شمار نمی‌رود. همچنین برای کسانی که به کمترین میزان نظارت انسانی نیاز دارند، نمی‌توان تنها بر پایه‌ی آمارهای Z.ai نتیجه گرفت که این مدل از تمام مدل‌های بسته بهتر عمل می‌کند.

GLM-5.3 نمونه‌ی خوبی از اهمیت روزافزون Post-training در مدل‌های زبانی است. Z.ai بدون تغییر مدل پایه توانسته در چند بنچمارک کدنویسی و عامل‌محور جهش‌های بزرگ ثبت کند و هم‌زمان قابلیت‌های امنیت سایبری مدل را به‌طور محسوس بالا ببرد؛ جهشی که حالا با امتیاز ۶۰ در شاخص مستقل Artificial Analysis و جهش قابل‌توجه در GDPval-AA v2 هم تا حدی تأیید شده است.

GLM-5.3 در ساخت اکسپلویت کامل و برخی بنچمارک‌های کدنویسی بلندمدت هنوز پشت سر Claude و GPT-5.6 Sol است، وزن‌هایش هنوز منتشر نشده و طبق داده‌های مستقل، نسبت به نسل قبل پرحرف‌تر شده است. ارزش اصلی این مدل شاید نه در یک رکورد واحد، بلکه در ترکیب عملکرد قوی در عامل‌های کدنویسی، قیمت نسبتاً پایین و تمرکز ویژه روی امنیت دفاعی باشد. وقتی وزن‌های مدل هم منتشر شوند، آن نقطه، آزمون واقعی و مستقل ادعاهای امروز GLM-5.3 خواهد بود.