شرکت دیپسیک مدل جدید V4.1-Flash را معرفی کرد؛ مدلی که با معماری متفاوت و تعداد پارامترهای فعال بسیار کمتر، برای اجرای سریعتر و ارزانتر وظایف هوش مصنوعی، بهخصوص کاربردهای عاملمحور طراحی شده است. این مدل همچنین بهصورت بومی از درک تصویر پشتیبانی میکند.
دیپسیک این مدل را از طریق API با تعرفهی مشخص عرضه میکند و هزینه بر اساس تعداد توکنهای ورودی و خروجی محاسبه میشود. قیمت API در ساعات کممصرف نصف ساعات اوج است، اما دسترسی به آن از طریق Freebuff در یک سطح مشخص رایگان خواهد بود؛ سرویسی که عاملهای هوش مصنوعی را در ازای نمایش تبلیغات، بهصورت رایگان عرضه میکند.
V4.1-Flash در مجموع ۵۵۲ میلیارد پارامتر دارد و از معماری MoE استفاده میکند؛ اما برخلاف مدلهای معمول، همهی این پارامترها همزمان فعال نیستند. معماری جدید Causal Encoder-Decoder در زمان پردازش ورودی فقط ۸ میلیارد پارامتر و هنگام تولید خروجی ۱۶ میلیارد پارامتر را فعال میکند. دیپسیک میگوید همین طراحی به کاهش هزینهی پردازش و افزایش سرعت کمک میکند.
مشخصات دیپسیک ۴٫۱ فلش
مشخصات | DeepSeek V4.1 Flash |
|---|---|
معماری | MoE با ۵۵۲ میلیارد پارامتر |
پارامتر فعال | ۸ میلیارد برای ورودی، ۱۶ میلیارد برای خروجی |
درک تصویر | دارد |
طول کانتکست | یک میلیون توکن |
حداکثر خروجی | ۳۸۴ هزار توکن |
حالت استدلال | Thinking و Non-thinking |
فراخوانی ابزار | دارد |
خروجی JSON | دارد |
API | سازگار با OpenAI و Anthropic |
مجوز مدل | MIT |
دیپسیک ۴٫۱ فلش در بنچمارکهای مختلف عملکرد بالایی نشان داده است. طبق آمار رسمی، V4.1-Flash در آزمونهایی مانند GPQA Diamond امتیاز ۹۰٫۹، Codeforces امتیاز ۳۴۷۱ و Terminal-Bench 2.1 امتیاز ۹۰٫۶ و DeepSWE v1.1 امتیاز ۷۴٫۲ گرفته است.
خود دیپسیک ادعا میکند مدل جدید در عملکرد، سرعت، هزینه و زمان اجرای کلی از V4-Pro بهتر عمل میکند.
تمرکز اصلی روی عاملهای هوش مصنوعی
یکی از مهمترین تغییرات V4.1-Flash به KV Cache مربوط میشود؛ حافظهای که هنگام پردازش مکالمات طولانی و وظایف عاملمحور اهمیت زیادی دارد. دیپسیک میگوید مدل جدید نسبتبه نسل قبل فقط به یکچهارم HBM و یکهشتم فضای SSD برای این حافظه نیاز دارد. این کاهش میتواند هزینهی اجرای عاملهایی را که چندین مرحله پشت سر هم انجام میدهند، پایین بیاورد.
V4.1-Flash از پنجرهی کانتکست یک میلیون توکنی و حداکثر ۳۸۴ هزار توکن خروجی پشتیبانی میکند و امکان استفاده از ابزارها، خروجی JSON و هر دو حالت Thinking و Non-thinking را دارد. نسخهی API نیز با نام deepseek-flash در دسترس است و قابلیت پردازش تصویر را بهصورت بومی ارائه میدهد.
DeepSeek همچنین قیمت API را کاهش داده است. هزینهی هر یک میلیون توکن ورودی در حالت Cache Miss از ۰٫۱۵ دلار در ساعات کممصرف و ۰٫۳۰ دلار در ساعات اوج شروع میشود و هر یک میلیون توکن خروجی نیز بهترتیب ۰٫۶ و ۱٫۲ دلار قیمت دارد. هزینهی ورودیهای Cache Hit حتی پایینتر و بین ۰٫۰۰۳ تا ۰٫۰۰۶ دلار است.
V4.1-Flash اکنون در هاگینگ فیس نیز با مجوز MIT منتشر شده و دیپسیک اعلام کرده است که برای پشتیبانی از اجرای مدل در جامعهی متنباز و توسعهی گزینههای استقرار بیشتر همکاری خواهد کرد.