هولدینگ چینی تنسنت (Tencent) با معرفی مدل متنباز Hy4 preview بار دیگر نشان داد رقابت در دنیای مدلهای وزنباز فقط به چند شرکت آمریکایی محدود نیست. این مدل از همان روزهای نخست انتشار، با ادعاهای قابلتوجهی درباره توانایی در کدنویسی، انجام وظایف چندمرحلهای و کار با ابزارها توجه توسعهدهندگان را جلب کرده است.
اما در مورد مدلی که بخش زیادی از نتایج اولیهاش از سوی خود سازنده منتشر شده، فاصله میان ادعا و عملکرد واقعی اهمیت زیادی دارد. آیا Hy4 preview واقعاً میتواند با مدلهای متنباز دیگری مانند Kimi K3 و GLM 5.3 رقابت کند؟ تجربه کاربران از آن چگونه بوده و آیا مزیتهایش ارزش سختافزار و هزینه اجرای آن را دارد؟
در این بررسی، عملکرد Hy4 preview، تفاوت آن با نسل قبل، نتایج مقایسه با رقبا، تجربههای اولیه کاربران و محدودیتهای این مدل را بررسی میکنیم تا ببینیم تازهوارد بزرگ تنسنت واقعاً چه جایگاهی در میان مدلهای قدرتمند وزنباز دارد.
Hy4 preview چیست و چرا مهم است؟
شرکت تنسنت، غول فناوری چینی، در ۲۸ آگوست ۲۰۲۶ از نسخه Hy4 preview پرده برداشت و آن را نسل تازهای از مدلهای تیم Tencent Hy در خانواده Hunyuan معرفی کرد.
Hy4 از معماری Mixture of Experts یا MoE استفاده میکند و backbone یا بدنه اصلی مدل در مجموع ۷۷۰ میلیارد پارامتر دارد؛ بااینحال، در پردازش هر توکن فقط ۴۹ میلیارد پارامتر فعال میشود. مدل ۷۸ لایه دارد که لایه اول آن FFN متراکم (Dense) است و ۷۷ لایه بعدی از ساختار MoE استفاده میکنند. هرکدام از این لایهها ۲۵۶ متخصص مسیریابیشده (routed expert) و یک متخصص مشترک (shared expert) دارند.
برای پردازش هر توکن، مدل ۸ متخصص از میان ۲۵۶ متخصص مسیریابیشده را انتخاب میکند و در کنار آن، متخصص اشتراکی را نیز فعال نگه میدارد. به این ترتیب، مدل ظرفیت بسیار بزرگی در اختیار دارد، اما برای پردازش هر توکن مجبور نیست تمام پارامترهای خود را فعال کند.
ویژگی | مشخصات |
|---|---|
متخصصهای مسیریابیشده | ۲۵۶ مورد در هر لایه MoE |
متخصص مشترک | یک مورد |
متخصصهای فعال برای هر توکن | ۸ متخصص مسیریابیشده + ۱ متخصص مشترک |
این معماری باعث میشود Hy4 از نظر ظرفیت بسیار بزرگ باشد، بدون اینکه در هر مرحله محاسباتی تمام پارامترهای مدل فعال شوند. بااینحال، «۴۹ میلیارد پارامتر فعال» به این معنا نیست که مدل از نظر حافظه شبیه یک مدل متراکم با ۴۹ میلیارد پارامتر است؛ وزنهای تمام متخصصها همچنان باید در حافظه سیستم یا زیرساخت استقرار مدل نگهداری شوند.
Hy4 علاوه بر بدنه اصلی، یک لایه Multi-Token Prediction یا MTP با ۱۰ میلیارد پارامتر دارد که حدود ۰٫۷ میلیارد پارامتر آن برای هر توکن فعال میشود.
این بخش برای speculative decoding به کار میرود تا مدل بتواند چند توکن احتمالی آینده را زودتر پیشبینی کند و در صورت تأیید، فرایند تولید پاسخ را سریعتر پیش ببرد.
مشخصات فنی Hy4 preview
ویژگی | مشخصات |
|---|---|
معماری | Mixture of Experts (MoE) |
پارامترهای backbone | ۷۷۰ میلیارد |
پارامترهای فعال | ۴۹ میلیارد |
تعداد لایهها | ۷۸ |
Routed expertها | ۲۵۶ در هر لایه MoE |
Shared expert | یک مورد |
Expertهای فعال برای هر توکن | ۸ routed + یک shared |
MTP | ۱۰ میلیارد پارامتر کل، ۰٫۷ میلیارد فعال |
Attention | Gated DeepSeek Sparse Attention |
Context window | ۱٬۰۴۸٬۵۷۶ توکن |
لایسنس | Apache 2.0 |
تنسنت در بخش attention از Gated DeepSeek Sparse Attention یا Gated DSA استفاده کرده و برای استفاده مجدد از شاخصهای sparse attention بین لایهها، فناوری IndexCache را به کار گرفته است. مسیر residual نیز از identity Hyper-Connections یا iHC استفاده میکند.
اندازه Hy4 اجرای محلی نسخه کامل را برای بیشتر کاربران عادی غیرعملی میکند
وزنهای Hy4 preview و نسخه FP8 آن بهصورت عمومی منتشر شدهاند و مدل تحت مجوز Apache 2.0 ارائه شده است. نسخه مدل در Hugging Face نیز در دسترس قرار دارد و امکان استفاده از ابزارهایی مانند Transformers، vLLM و SGLang برای اجرای آن فراهم شده است.
اندازه مدل اجرای محلی نسخه کامل را برای بیشتر کاربران عادی غیرعملی میکند. مخزن Hugging Face حجم حدود ۱٫۵۶ ترابایت را برای فایلهای مدل نشان میدهد؛ هرچند نسخههای FP8 و روشهای کوانتایزیشن میتوانند نیاز سختافزاری را کاهش دهند.
کانتکست یکمیلیونتوکنی Hy4 چه کاربردی دارد؟
یکی از مهمترین ویژگیهای Hy4 preview، پنجره زمینه ۱٬۰۴۸٬۵۷۶ توکنی آن است؛ یعنی مدل میتواند در یک نشست تقریباً یک میلیون توکن را در اختیار داشته باشد. این ظرفیت برای کارهایی مانند بررسی مخازن بزرگ کد، تحلیل مجموعهای از اسناد، پژوهش روی منابع طولانی و انجام وظایف چندمرحلهای اهمیت دارد.
ظرفیت کانتکست با کیفیت استفاده از آن یکی نیست
بااینحال، ظرفیت کانتکست را نباید با کیفیت استفاده از آن یکی دانست. اینکه یک مدل بتواند یک میلیون توکن را دریافت کند، بهخودیخود نشان نمیدهد که در سراسر این پنجره میتواند اطلاعات مرتبط را با دقت یکسان بازیابی کند یا در حداکثر طول کانتکست همچنان سرعت و هزینه مناسبی داشته باشد. چنین مواردی به آزمونهای کنترلشده نیاز دارند.
فناوریهای Hy4 برای پردازش کانتکست طولانی
تنسنت برای مدیریت محاسبات مربوط به کانتکست طولانی از Gated DSA و IndexCache استفاده کرده است؛ اولی sparse attention را ممکن میکند و دومی امکان بازاستفاده از شاخصهای sparse را در لایههای مختلف فراهم میکند.
به زبان ساده در روش Gated DeepSeek Sparse Attention یا Gated DSA، مدل ابتدا بخشهای مهمتر متن را پیدا میکند و بیشتر روی همان بخشها تمرکز میکند. این کار باعث میشود محاسبات کمتری انجام شود و پاسخگویی مدل سریعتر و ارزانتر باشد.
تنسنت برای جلوگیری از محاسبهی دوبارهی این بخشهای مهم از IndexCache استفاده میکند. مدل اطلاعات مربوط به بخشهایی را که قبلاً مهم تشخیص داده شدهاند ذخیره میکند و در مراحل بعد دوباره از همان اطلاعات استفاده میکند. بنابراین لازم نیست هر بار از ابتدا مشخص کند کدام قسمتهای متن مهم هستند.
این مدل همچنین از روشی به نام Identity Hyper-Connections یا iHC در مسیر انتقال اطلاعات بین لایهها استفاده میکند. این روش کمک میکند اطلاعات هنگام عبور از لایههای مختلف کمتر از بین بروند و ارتباط بین بخشهای مختلف مدل بهتر حفظ شود.
Hy4 preview برای چه کارهایی ساخته شده است؟
تمرکز Hy4 بیشتر از یک چتبات عمومی، روی کارهای حرفهای و چندمرحلهای است. تنسنت میگوید مدل با همکاری متخصصان داخلی این شرکت در حوزههایی مانند مهندسی نرمافزار، توسعه بازی، امور مالی و امنیت آموزش و ارزیابی شده است. در نتیجه، کاربردهای اصلی آن شامل موارد زیر است:
تمرکز Hy4 بیشتر از یک چتبات عمومی، روی کارهای حرفهای و چندمرحلهای است
- برنامهنویسی، دیباگ و توسعه نرمافزار
- انجام وظایف طولانیمدت مهندسی نرمافزار
- استفاده از ابزارها و اجرای ورکفلوهای عاملمحور
- تحلیل داده و اسناد
- ساخت فایلهای اداری مانند سند، اسپردشیت و ارائه
- توسعه بازی
- پژوهش علمی و حل مسائل پیچیده
تنسنت همچنین به بهبود عملکرد مدل در کارهای فرانتاند و تعاملات چندمرحلهای اشاره کرده است.
پخش از رسانه
در مستندات رسمی، Hy4 preview بهعنوان یک مدل تولید متن معرفی شده و ورودی تصویری برای خود مدل مستند نشده است. بااینحال، Tencent در نمونههای کاربردی خود خروجیهایی مانند بازی و پروژههای بصری را نمایش میدهد؛ این نمونهها میتوانند حاصل تعامل Hy4 با ابزارها و نرمافزارهای دیگر باشند و بهتنهایی نشان نمیدهند که خود مدل یک مولد تصویر چندوجهی است.
Hy4 preview چقدر قدرتمند است؟
در ادامه با نگاهی به تفاوتهای Hy4 نسبت به نسل قبل و مقایسهی آن با قدرتمندترین رقبا به این پرسش پاسخ میدهیم.
Hy4 در مقایسه با Hy3
تنسنت برای نشاندادن پیشرفت Hy4 نسبت به نسل قبل، مجموعهای از بنچمارکها را منتشر کرده است. نتایج نشان میدهند جهش مدل در برخی وظایف مهندسی نرمافزار و استدلال بسیار قابلتوجه بوده است.
بنچمارک | Hy3 | Hy4 preview | تغییر |
|---|---|---|---|
SWE-bench Pro | ۵۷٫۹٪ | ۶۵٫۷٪ | +۷٫۸ |
DeepSWE | ۲۸٪ | ۶۴٫۳٪ | +۳۶٫۳ |
Terminal-Bench 2.1 | ۷۰٫۸٪ | ۸۵٫۴٪ | +۱۴٫۶ |
SWE Atlas؛ Refactoring | ۳۲٫۹٪ | ۵۳٫۳٪ | +۲۰٫۴ |
MathArena Apex 2025 | ۳۸٫۷٪ | ۷۴٫۲٪ | +۳۵٫۵ |
این اعداد از ارزیابیهای منتشرشده همراه مدل به دست آمدهاند و باید آنها را نتایج گزارششده توسط تنسنت دانست، نه آزمونهای مستقلی که همه مدلها در شرایط کاملاً یکسان در آن شرکت کرده باشند. خود تنسنت در جدول بنچمارکها اعلام میکند که بخشی از اعداد رقبا نیز بر اساس آزمونهای این شرکت گزارش شدهاند و شرایط، هارنس و تنظیمات مدلها در همه ردیفها یکسان نیستند.
تنسنت در نسل جدید روی استدلال و وظایف مهندسی نرمافزار تمرکز جدی داشته است. بزرگترین جهشها در حوزههایی مانند DeepSWE و MathArena دیده میشوند؛ یعنی حوزههایی که به استدلال چندمرحلهای و انجام وظایف پیچیده وابستهاند.
Hy4 در برابر رقبای اصلی
در بنچمارکهای منتشرشده، Hy4 Preview در چند آزمون مهم عملکرد رقابتی دارد. برای نمونه، مدل در SWE-bench Pro امتیاز ۶۵٫۷ درصد، در DeepSWE امتیاز ۶۴٫۳ درصد، در Terminal-Bench 2.1 امتیاز ۸۵٫۴ درصد و در GPQA Diamond امتیاز ۹۲٫۳ درصد به دست آورده است.
در GDPval-AA V2 نیز امتیاز Hy4 به ۱۶۷۸ Elo رسیده و در MathArena Apex 2025 امتیاز ۷۴٫۲ درصد ثبت شده است.
Hy4 در مهندسی نرمافزار و وظایف عاملمحور به سطح رقابتی بالایی رسید است
بااینحال، نتایج نشان نمیدهند Hy4 در همه آزمونها بهترین مدل است. برای مثال، در Terminal-Bench 2.1 مدلهایی مانند DeepSeek V4 Pro 0813، GLM 5.3 و Kimi K3 در جدول مقایسهای تنسنت امتیاز بالاتری دارند؛ در DeepSWE نیز Kimi K3 و GLM 5.3 در برخی تنظیمات از Hy4 جلو میافتند.
به همین دلیل، بهتر است Hy4 را بهعنوان مدلی ببینیم که در چند حوزه مهم، بهخصوص مهندسی نرمافزار و وظایف عاملمحور، خود را به سطح رقابتی بالایی رسانده است.
Hy4 در برابر GLM 5.3 و Kimi K3
تنسنت در ارزیابی هایش Hy4 را مستقیماً با دو مدل وزنباز دیگر، یعنی GLM 5.3 و Kimi K3 مقایسه کرده است. برای مقایسه یک ارزیابی مقایسهای کور (blind side-by-side) انجام داد؛ به این معنا که متخصصان بدون اطلاع از اینکه هر خروجی متعلق به کدام مدل است، پاسخها را با یکدیگر مقایسه کردند. در مجموع، ۱۶۳ متخصص داخلی تنستنت عملکرد مدلها را در ۲۰۳ وظیفه مهندسی ارزیابی کردند.
شاخص مقایسه داخلی تنسنت | GLM 5.3 | Kimi K3 |
|---|---|---|
میانگین امتیاز Hy4 در مقایسه با مدل رقیب | ۲٫۹۹ در برابر ۲٫۹۲ | ۲٫۹۹ در برابر ۲٫۹۴ |
نرخ برد Hy4 | ۴۶٫۸٪ | ۵۱٫۲٪ |
نرخ تساوی | ۱۲٫۸٪ | ۷٫۹٪ |
نرخ شکست Hy4 | ۴۰٫۴٪ | ۴۰٫۹٪ |
Hy4 در این ارزیابی میانگین امتیاز ۲٫۹۹ از ۴ را به دست آورد؛ درحالیکه میانگین امتیاز GLM 5.3 برابر با ۲٫۹۲ و Kimi K3 برابر با ۲٫۹۴ بود. در مقایسه با GLM 5.3، Hy4 در ۴۶٫۸ درصد موارد برنده شد، در ۱۲٫۸ درصد موارد نتیجه مساوی بود و در ۴۰٫۴ درصد موارد شکست خورد. در مقایسه با Kimi K3 نیز Hy4 در ۵۱٫۲ درصد موارد برنده شد، ۷٫۹ درصد نتایج مساوی بود و در ۴۰٫۹ درصد موارد شکست خورد.
Hy4 در آزمون ارزیابی کور مدل در ۵۱٫۲ درصد موارد برنده شد
این نتایج از این جهت قابل توجهاند که برخلاف بنچمارکهای صرفاً خودکار، در این ارزیابی قضاوت انسانی روی خروجی مدلها نیز وارد شده است.
بااینحال، باید در تفسیر نتایج محتاط بود؛ زیرا تمام ارزیابان از متخصصان داخلی تنسنت بودهاند و آزمون نیز توسط خود این شرکت انجام شده است. بنابراین، این دادهها را باید نتایج یک ارزیابی داخلی با داوری انسانی دانست، نه شواهدی از یک ارزیابی مستقل یا بیطرفانه.
ارزیابیهای مستقلتر چه میگویند؟
در زمان انتشار Hy4 preview، دادههای مستقل و همشرایط هنوز بسیار محدود بودند. یکی از دادههای قابل استناد اولیه، ارزیابی WebDev سایت Arena است که Hy4 امتیاز ۱۶۲۷ را با حاشیه خطای ۱۷ امتیاز به دست آورده و نتیجه آن هنوز در وضعیت مقدماتی قرار دارد. در همان مجموعه، Hy3 امتیاز ۱۵۱۱ را داشته است؛ بنابراین Hy4 در این ارزیابی مستقلتر از دادههای تنسنت نیز نسبت به نسل قبل عملکرد بهتری نشان میدهد.
این ارزیابی از نوع AutoEval بوده و برای Hy4 در زمان گزارش رأی انسانی ثبت نشده بود. بنابراین نمیتوان از آن نتیجه گرفت که تمام جهشهای گزارششده در بنچمارکهای رسمی تنسنت بهطور مستقل تکرار شدهاند. همانطور که در تصویر زیر میبینید نتایج از زمان انتشار تا زمان نگارش مقاله در ۲ سپتامبر تغییر کردهاند.
در مجموع، شواهد مستقل موجود تا حدی از ادعای تنسنت درباره بهبود عملکرد Hy4 نسبت به نسل قبل پشتیبانی میکنند. این مدل در ارزیابیهای شخص ثالث نیز عملکرد بهتری از Hy3 نشان داده و در آزمونهای عمومی کدنویسی نتایج قابلتوجهی ثبت کرده است. بااینحال، هنوز شواهد کافی برای تأیید مستقل نتایج رسمی تنسنت وجود ندارد و نمیتوان با اطمینان گفت که این اعداد در آزمونهایی با شرایط و تنظیمات کاملاً یکسان نیز تکرار خواهند شد.
اهمیت این تمایز در آن است که هنگام سنجش مدلهای هوش مصنوعی، عواملی چون تنظیمات استدلال، شمار تلاشها، ابزارهای در دسترس مدل، سقف توکن و حتی هارنس مورد استفاده میتوانند نتایج را دگرگون کنند. از این جهت، جدول تنسنت را باید صرفاً گزارش عملکرد ارائهشده از سوی خود توسعهدهنده دانست، نه یک رتبهبندی مستقل در بازار.
محدودیتهای Hy4 preview و تجربههای اولیه کاربران
یکی از مهمترین محدودیتهای Hy4 preview را خود تنسنت در مستندات مدل مطرح کرده است؛ مدل در بعضی وظایف پیچیده ممکن است بیشتر از حد لازم استدلال انجام دهد و تمایل داشته باشد خروجی خود را بیش از اندازه بررسی و تأیید کند. چنین رفتاری میتواند حتی در شرایطی که قیمت هر توکن پایین است، زمان پاسخ و مصرف توکن را افزایش دهد.
Hy4 در وظایف پیچیده ممکن است بیش از حد لازم وارد فرایند استدلال شود
گزارشهای اولیه کاربران نیز تصویری کاملاً یکدست ارائه نمیکنند. برخی کاربران سراغ اجرای محلی و کوانتایزکردن مدل رفتهاند و نمونههایی از کاهش شدید حجم مدل و اجرای آن روی سیستمهای پرحافظه گزارش شده است.
برای مثال، در یک آزمایش شخصی، حجم مدل از حدود ۱٫۵ ترابایت به نزدیک ۲۰۰ گیگابایت کاهش داده شده و در آزمایشی دیگر سرعتی حدود ۴٫۱ توکن بر ثانیه روی سیستمی با ۲۵۶ گیگابایت RAM و ۳۲ گیگابایت VRAM گزارش شده است.
این نتایج باید صرفاً تجربههای شخصی کاربران تلقی شوند، نه ارزیابیهای مستقل و کنترلشده. ارزش اصلی آنها این است که نشان میدهند جامعه توسعهدهندگان از همان روزهای اول در حال بررسی امکان اجرای محلی Hy4 بوده است.
تنسنت Hy4 را نسخه نهایی و تثبیتشده معرفی نمیکند
همچنین گزارشهایی از مصرف بسیار زیاد توکن در کارهای پژوهشی طولانی منتشر شده است. چنین تجربههایی با هشدار رسمی تنسنت درباره استدلال طولانی همراستا هستند، اما برای نتیجهگیری قطعی درباره میانگین رفتار مدل کافی نیستند.
قیمت و نحوه دسترسی به Hy4 preview
Hy4 preview در زمان عرضه با قیمت زیر ارائه شده است:
| ورودی / ۱ میلیون توکن | ورودی کششده / ۱ میلیون توکن | خروجی / ۱ میلیون توکن |
|---|---|---|---|
Hy4 preview | ۰٫۸۳۴ دلار | ۰٫۰۴۲ دلار | ۲٫۵۰۱ دلار |
این قیمتها در تنسنت و OpenRouter برای عرضه اولیه ثبت شدهاند و ممکن است تغییر کنند.
برای مقایسه، قیمت Hy3 برابر با ۰٫۱۳۲ دلار برای ورودی و ۰٫۵۲۸ دلار برای خروجی است؛ بنابراین Hy4 preview مدل ارزانتری نسبت به نسل قبل نیست و هزینه توکنهای ورودی و خروجی آن بهترتیب حدود ۶٫۳ و ۴٫۷ برابر بیشتر است. همچنین قیمت رسمی Kimi K3 در زمان بررسی ۳ دلار برای هر میلیون توکن ورودی، ۰٫۳۰ دلار برای ورودی کششده و ۱۵ دلار برای خروجی بوده است که نشان میدهد Hy4 از نظر هزینه API فاصله محسوسی با Kimi K3 دارد.
Hy4 preview از طریق سرویسهای تنسنت و API ابری آن در دسترس قرار دارد و نسخه عمومی مدل نیز در Hugging Face منتشر شده است. همچنین OpenRouter مدل را با شناسه tencent/hy4-preview ارائه میکند.
آیا Hy4 preview ارزش بررسی دارد؟
Hy4 preview را نمیتوان صرفاً نسخهای بزرگتر از Hy3 دانست. تنسنت در این نسل علاوه بر افزایش اندازه مدل و طول کانتکست، تمرکز بیشتری بر مهندسی نرمافزار، استفاده از ابزارها و وظایف عاملمحور گذاشته است.
Hy4 یکی از مدلهای وزنباز قابلتوجه برای کدنویسی و وظایف عاملمحور است
نتایج رسمی تنسنت از بهبود چشمگیر Hy4 نسبت به Hy3، بهویژه در DeepSWE و Terminal-Bench، حکایت دارند و دادههای مستقل اولیه نیز در همین جهت هستند؛ بااینحال، برای تأیید مستقل تمام این نتایج هنوز شواهد کافی وجود ندارد.
با توجه به ۷۷۰ میلیارد پارامتر، ۴۹ میلیارد پارامتر فعال، کانتکست یکمیلیونتوکنی و انتشار عمومی وزنها، Hy4 preview را میتوان یکی از مدلهای وزنباز قابلتوجه برای کدنویسی و وظایف عاملمحور دانست. بااینحال، این مدل هنوز در مرحله پیشنمایش است و محدودیتهایی مانند استدلال طولانی و مصرف بالای منابع دارد.
در حال حاضر، Hy4 از جدیترین گامهای مدلهای وزنباز برای رقابت با سیستمهای تجاری در انجام وظایف پیچیده به شمار میرود؛ با این حال، تعیین دقیق موقعیت آن نیازمند ارزیابیهای مستقل بیشتری است. اگر نسخههای آینده بتوانند هزینه و زمان فرایند استدلال را کاهش دهند و بررسیهای مستقل تازهای نیز منتشر شود، تصویر شفافتری از جایگاه واقعی Hy4 در مقایسه با مدلهای بسته و دیگر رقبای وزنباز شکل خواهد گرفت.
نظر شما درباره Hy4 preview چیست؟ آیا این مدل میتواند رقابت در دنیای مدلهای وزنباز را وارد مرحله تازهای کند؟