قطعی اینترنت برای بسیاری از کاربران ایرانی یک سناریوی فرضی نیست؛ تجربه‌ای تکرارشونده است. پیش‌تر در چنین شرایطی دسترسی به سرویس‌های هوش مصنوعی هم عملاً از بین می‌رفت، اما این تصور دیگر کاملاً درست نیست. امروز بخشی از مدل‌های زبانی به‌گونه‌ای طراحی شده‌اند که بدون اتصال به سرورهای ابری، مستقیماً روی خود دستگاه اجرا شوند.

اجرای محلی (Local) هوش مصنوعی به شما اجازه می‌دهد حتی در حالت کاملاً آفلاین با مدل کار کنید. از طرف دیگر، در این حالت چون داده‌ها برای پردازش از دستگاه خارج نمی‌شوند، می‌تواند به حفظ حریم خصوصی نیز کمک کند. مهم‌تر این که در بسیاری از موارد می‌توانید به‌طور رایگان از مدل‌های هوش مصنوعی آفلاین استفاده کنید. البته منظور از رایگان در اینجا، مدل‌های سبک و متن‌بازی است که شرکت‌هایی مانند گوگل برای اجرای روی سخت‌افزارهای شخصی منتشر کرده‌اند، نه نسخه‌های کامل و پولی سرویس‌های ابری.

این مدل‌های سبک که با عنوان SLM یا مدل‌های زبانی کوچک شناخته می‌شوند، با هدف اجرای مدل‌های هوش مصنوعی روی سخت‌افزارهای معمولی توسعه یافته‌اند؛ به‌طوری که برای استفاده از آن‌ها به ابرکامپیوتر نیاز ندارید و در برخی موارد می‌توانید یک مدل را روی لپ‌تاپ یا حتی گوشی هوشمند خود اجرا کنید.

این ابزارها قرار نیست جایگزین دستیارهای قدرتمند ابری شوند، اما برای لحظاتی که اینترنت قطع است، یا برای کارهایی که حریم خصوصی داده در آن‌ها اهمیت دارد، گزینه‌ای واقعی و در دسترس‌اند. در ادامه، روش نصب و اجرای هوش مصنوعی بدون نیاز به اینترنت را آموزش می‌دهیم و راهنمای کاملی برای نصب و استفاده از آن روی لپ‌تاپ و گوشی ارائه می‌کنیم.

آیا سیستم شما توان اجرای محلی هوش مصنوعی را دارد؟

پیش از نصب هر نرم‌افزاری، باید بدانید دستگاه‌تان از پس چه مدلی برمی‌آید. اجرای هوش مصنوعی (یا به‌اصطلاح Inference) به‌شدت به حافظه وابسته است؛ اما نه حافظه‌ی ذخیره‌سازی، بلکه رم و به‌خصوص VRAM

رم همان حافظه‌ی موقتی است که پردازنده‌ی اصلی (CPU) روی آن کار می‌کند. اما هوش مصنوعی عاشق پردازش موازی است و کارت گرافیک (GPU)، با هزاران هسته‌ی ریز خود، این کار را بسیار سریع‌تر از CPU انجام می‌دهد.

کارت گرافیک هم حافظه‌ی اختصاصی خودش را دارد که به آن VRAM می‌گویند. حالت ایده‌آل این است که کل مدل در همین VRAM جا شود؛ اگر جا نشود، بخشی از آن به رم منتقل می‌شود که سرعت را به‌شدت پایین می‌آورد.

لپ‌تاپ‌های گیمینگ با کارت گرافیک مجزا برای این کار مناسب‌اند؛ اما مک‌بوک‌های اپل با تراشه‌های سری M (و لپ‌تاپ‌های ویندوزی جدید با معماری مشابه) یک استثنای جالب به نام حافظه‌ی یکپارچه یا Unified Memory دارند که در آن CPU و GPU از یک استخر رم مشترک استفاده می‌کنند؛ یعنی یک مک‌بوک با ۳۲ یا ۶۴ گیگابایت رم، عملاً همان مقدار VRAM هم در اختیار دارد.

کوانتیزیشن و انتخاب مدل

اگر سخت‌افزار قوی ندارید، جای نگرانی نیست؛ اینجا تکنیکی به اسم کوانتیزیشن (Quantization) به کمک می‌آید. این فرایند دقت اعداد داخل مدل را پایین می‌آورد؛ مثلاً از ۱۶ بیت به ۴ بیت. نتیجه این است که مدلی با ۷ یا ۸ میلیارد پارامتر که معمولاً حدود ۱۴ تا ۱۶ گیگابایت حجم دارد، به چهار تا پنج گیگابایت فشرده می‌شود و روی یک سیستم معمولی با ۸ گیگابایت رم هم قابل‌اجراست اما به قیمت افت جزئی در دقت پاسخ‌ها.

برای این‌که مجبور نباشید هر بار محاسبه کنید، جدول زیر یک راهنمای کلی و تقریبی برای انتخاب مدل مناسب است:

رم + VRAM در دسترس

دستگاه مناسب

اندازه‌ی مدل پیشنهادی

مثال

کمتر از ۴ گیگابایت

گوشی میان‌رده یا قدیمی

زیر ۱ میلیارد پارامتر (مثلاً Gemma 4 E2B)

Gemma 4 نسخه‌ی E2B

۴ تا ۸ گیگابایت

گوشی پرچم‌دار / لپ‌تاپ بدون گرافیک مجزا

حدود ۲ تا ۴ میلیارد پارامتر (کوانتایزشده)

Gemma 4 نسخه‌ی E4B

۸ تا ۱۶ گیگابایت

لپ‌تاپ معمولی یا گیمینگ سبک

حدود ۷ تا ۸ میلیارد پارامتر (کوانتایزشده)

Llama یا Qwen در رده‌ی ۷ تا ۸ میلیارد پارامتر

۱۶ گیگابایت یا بیشتر

لپ‌تاپ گیمینگ یا مک‌بوک با رم بالا

۱۲ میلیارد پارامتر به بالا

نسخه‌های بزرگ‌تر خانواده‌ی Gemma یا Qwen

این اعداد تقریبی‌اند و به نوع کوانتیزیشن و بهینه‌سازی هر اپلیکیشن هم بستگی دارند؛ اما به‌عنوان نقطه‌ی شروع، از هدررفت وقت برای دانلود مدلی که اصلاً روی دستگاه‌تان جا نمی‌شود جلوگیری می‌کند.

چک‌کردن مشخصات در ویندوز

  • کلیدهای Ctrl + Shift + Esc را همزمان بزنید تا Task Manager باز شود.
  • به تب Performance بروید، ابتدا مقدار رم را ببینید، سپس در بخش GPU دنبال عبارت Dedicated GPU Memory بگردید؛ این عدد VRAM واقعی است.
جزئیات میزان مصرف و وضعیت دمای کارت گرافیک در مدیریت وظایف ویندوز برای اجرای مدل‌های هوش مصنوعی.

اگر در فهرست ارائه‌شده چند پردازنده گرافیکی (GPU) وجود دارد، توجه داشته باشید که معمولا یکی از آن‌ها گرافیک یکپارچه پردازنده و بدون VRAM اختصاصی است؛ بنابراین باید کارت گرافیک مجزا را انتخاب کنید.

چک‌کردن مشخصات در مک

  • روی لوگوی اپل کلیک کنید و About This Mac را بزنید.
  • اگر جلوی Chip نام تراشه‌های اختصاصی اپل (سری M یا جدیدتر) نوشته شده، عدد کنار Memory هم رم شماست و هم VRAM.
نمای مشخصات سیستم و سخت‌افزار لپ‌تاپ مک‌بوک ایر مدل ۲۰۲۲ برای بررسی توان پردازشی در اجرای هوش مصنوعی
  • اگر مک قدیمی و مبتنی‌بر پردازنده‌ی اینتل دارید، آن عدد فقط رم است و باید برای VRAM به بخش Graphics نگاه کنید.

روش میانبر ساده‌تر

برای شناسایی مدل‌های آفلاین سازگار با سیستم خود، می‌توانید از وب‌سایت TurboLLM به‌عنوان روشی ساده‌تر کمک بگیرید. این ابزار رایگان و متن‌باز را یک توسعه‌دهنده‌ی مستقل برای همین هدف ساخته است. با وارد کردن میزان رم و VRAM سیستم (یا استفاده از قابلیت تشخیص خودکار ابزار)، فهرستی دقیق از مدل‌هایی که بدون نقص یا با کمترین مشکل روی دستگاهتان اجرا می‌شوند در اختیارتان قرار می‌گیرد.

نصب و اجرای محلی هوش مصنوعی روی لپ‌تاپ (ویندوز و مک)

تا چند وقت پیش، اجرای هوش مصنوعی به‌صورت محلی نیازمند کار با خط فرمان بود. با این حال، اکنون دو ابزار رایگان این فرایند را بدون نیاز به محیط ترمینال تسهیل کرده‌اند که هرکدام برای کاربردی متفاوت مناسب‌تر است.

گزینه‌ی اول: Ollama

اولاما (Ollama) که پرطرفدارترین ابزار متن‌باز در این زمینه به شمار می‌رود، از نسخه ۰.۱۰ به بعد یک برنامه رسمی با رابط گرافیکی ارائه کرده است که امکان دریافت مدل‌ها و گفت‌و‌گو با آن‌ها را بدون نیاز به محیط ترمینال فراهم می‌کند.

برای نصب و استفاده از Ollama طبق مراحل زیر پیش بروید:

  • به وب‌سایت ollama.com بروید و نسخه‌ی متناسب با سیستم‌عامل خود را دانلود کنید.
  • مثل هر نرم‌افزار معمولی دیگر آن را نصب کنید.
  • اپلیکیشن را باز کنید. یک محیط چت مشابه ChatGPT یا Gemini خواهید دید.
  • از همان صفحه یک مدل آقلاین مثل مدل جمای گوگل را برای دانلود انتخاب کنید.

در فهرست مدل‌های اولاما، کنار برخی گزینه‌ها مانند GLM 5.2 و MiniMax M3 برچسب Cloud درج شده است. این موارد جزو مدل‌های محلی به شمار نمی‌روند و از آنجا که پردازش آن‌ها به‌جای سیستم شما روی سرورهای اولاما انجام می‌شود، استفاده از آن‌ها به اتصال اینترنت و حساب کاربری رایگان اولاما نیاز دارد. برای اجرای کاملاً آفلاین، باید مدل‌های فاقد برچسب Cloud را دریافت کنید؛ مدل‌های خانواده‌ی Gemma در این گروه جای می‌گیرند.

نکته‌ای برای توسعه‌دهندگان: پلتفرم Ollama از نسخه ۰.۱۴ به بعد با API پیام‌رسانی آنتروپیک سازگار شده و از نسخه ۰.۱۵ نیز قابلیت اتصال مستقیم Claude Code به مدل‌های محلی را از طریق دستور ollama launch claude فراهم کرده است. بر این اساس، پس از راه‌اندازی Claude Code، اجرای این دستور در محیط ترمینال فهرستی از مدل‌های نصب‌شده را نمایش می‌دهد که با انتخاب مدل مدنظر، امکان استفاده از یک دستیار برنامه‌نویسی کاملا آفلاین و محلی مهیا می‌شود.

گزینه‌ی دوم: LM Studio

این اپلیکیشن رایگان، روی ویندوز، مک و لینوکس نصب می‌شود و نیازی به ثبت‌نام ندارد. تفاوت اصلی‌اش با Ollama این است که یک فروشگاه مدل داخلی و متصل به Hugging Face دارد؛ یعنی به‌جای وارد‌کردن نام مدل، می‌توانید در همان اپلیکیشن جست‌وجو کنید و با یک کلیک مدل موردنظرتان را دانلود و اجرا کنید.

صفحه رسمی دانلود Ollama جهت نصب و اجرای مدل‌های هوش مصنوعی به صورت آفلاین روی سیستم‌های مک، لینوکس و ویندوز

برای نصب و استفاده از LM Studio طبق مراحل زیر پیش بروید:

  • به وب‌سایت lmstudio.ai بروید و نسخه‌ی متناسب با سیستم‌عامل خود را را دریافت کنید.
  • در اولین اجرا، صفحه‌ای برای تنظیمات پیشرفته می‌بینید که ابتدا بهترین گزینه برای مدل هوش مصنوعی متناسب با سیستم شما را برای دانلود پیشنهاد می‌کند. می‌توانید همنیجا مدل را دانلود کنید یا آن را به مراحل بعد موکول کنید.
  • سپس از شما می‌پرسد که می‌خواهید Developer Mode را روش کنید یا اجازه می‌دهید که هنگام ورود به سیستم سرویس مدل محلی (Start LLM service on login) اجرا شود. برای استفاده‌ی ساده و چت‌کردن، هر دو گزینه را می‌توانید خاموش بگذارید و رد شوید؛ این تنظیمات فقط برای کسانی لازم است که می‌خواهند مدل را به‌عنوان یک API یا سرویس پس‌زمینه به برنامه‌های دیگر متصل کنند.
رابط کاربری تنظیمات پیشرفته (Advanced settings) در نرم‌افزار LM Studio
بخش تنظیمات پیشرفته در برنامه LM Studio برای مدیریت سرویس‌های هوش مصنوعی محلی
رابط کاربری دانلود مدل هوش مصنوعی Gemma 4 (Gemma 4) برای اجرای آفلاین
لوگوی نرم‌افزار LM Studio (LM Studio) در کنار کاراکتر گرافیکی و کره زمین
رابط کاربری برنامه LM Studio برای اجرای مدل‌های هوش مصنوعی به‌صورت آفلاین روی کامپیوتر شخصی
  • اگر در ابتدا مدلی را دانلود نکردید، حالا اپلیکیشن را باز کنید و از تب عمودی کناری روی آخرین گزینه از بالا یعنیModel Search بزنید. نام مدل موردنظر را جست‌وجو کنید و روی دکمه‌ی دانلود بزنید. می‌توانید برای راحت تر شدن کار مدل‌ها را براساس بهترین انتخاب (best match) سورت کنید.
  • پس از پایان دانلود، به تب چت بروید، مدل دانلودشده را انتخاب کنید تا بارگذاری شود و شروع به گفت‌وگو کنید.

نکته‌ای که LM Studio را برای کاربران مک‌بوک جذاب می‌کند این است که از چهارچوب اختصاصی اپل به اسم MLX پشتیبانی می‌کند؛ چهارچوبی که مخصوص بهینه‌سازی روی پردازنده‌های سری M طراحی شده. اگر هنگام دانلود مدل، نسخه‌ی MLX همان مدل (دارای پسوند mlx.) را انتخاب کنید (به‌جای نسخه‌ی معمولی GGUF)، سرعت پاسخ‌دهی روی مک‌بوک به شکل محسوسی بهتر از Ollama خواهد بود؛ در مقابل، اولاما برای کسانی که کار سریع و بی‌دردسر با خط فرمان و اتصال ابزارهایی مثل Claude Code را می‌خواهند، گزینه‌ی ساده‌تری است.

اجرای محلی هوش مصنوعی روی گوشی (آیفون و اندروید)

برای اجرای محلی هوش مصنوعی روی گوشی هم دو گزینه در درسترس است. در هر دو گزینه، فقط برای اولین اجرا و دانلود مدل به اینترنت نیاز دارید؛ از آن به بعد، اپلیکیشن حتی در حالت هواپیما هم بدون هیچ مشکلی کار می‌کند.

گزینه‌ی اول: Google AI Edge Gallery

این اپلیکیشن رسمی و رایگان گوگل، برای اندروید و آیفون در دسترس است و برای استفاده نیازی به ثبت‌نام ندارد. اپلیکیشن Google AI Edge Gallery از قابلیت‌های زیر پشتیبانی می‌کند:

  • AI Chat برای گفت‌وگوی چندمرحله‌ای با مدل‌های متن‌باز، همراه با حالت Thinking Mode برای دیدن روند استدلال مدل
  • Ask Image برای تحلیل و توصیف عکس
  • Audio Scribe برای رونویسی و ترجمه‌ی هم‌زمان صدا به متن، کاملاً آفلاین
  • Prompt Lab محیطی برای آزمایش پرامپت‌ها با تنظیم دقیق پارامترها
  • Agent Skills که مدل را از یک چت‌بات ساده به دستیاری فعال‌تر تبدیل می‌کند؛ با ابزارهای داخلی مثل جست‌وجوی ویکی‌پدیا، نقشه‌ی تعاملی، تولید کد QR و حتی امکان بارگذاری مهارت‌های سفارشی از یک آدرس اینترنتی یا انجمن گیت‌هاب
  • Mobile Actions که با دستور صوتی یا متنی ساده، کارهایی مثل روشن‌کردن چراغ‌قوه یا ساخت رویداد تقویمی را بدون اینترنت انجام می‌دهد.

برای نصب و استفاده از Google AI Edge Gallery طبق مراحل زیر پیش بروید:

  • اپ Google AI Edge Gallery را نصب کنید.
  • پس از باز کردن اپ، صفحه‌ی اصلی یک شبکه از قابلیت‌ها (مثل AI Chat، Ask Image، Prompt Lab) را نشان می‌دهد. روی یکی از آن‌ها، مثلاً AI Chat، ضربه بزنید.
فهرست مدل‌های زبانی Gemma-4 برای دانلود در محیط اپلیکیشن AI Chat
رابط کاربری وب‌سایت Google AI Edge Gallery و گزینه‌های استفاده از مدل Gemma 4
  • فهرست مدل‌های سازگار با آن قابلیت باز می‌شود. از خانواده‌ی Gemma، مدل موردنظر را انتخاب و دانلود کنید. به‌طور مشخص، مدل سبک‌تر (E2B) با کمتر از ۱.۵ گیگابایت حافظه روی اکثر گوشی‌ها اجرا می‌شود، اما برای تجربه‌ی روان مدل قوی‌تر (E4B) با هر سه ورودی متن، تصویر و صدا، بهتر است گوشی‌تان حداقل ۸ گیگابایت رم داشته باشد.
  • پس از پایان دانلود، از صفحه‌ی اصلی یکی از تسک‌ها (مثلاً AI Chat) را انتخاب کنید، مدل دانلودشده را از فهرست انتخاب و شروع به گفت‌وگو کنید.

گزینه‌ی دوم: Locally AI برای کاربران اپل

اگر دنبال محیطی ساده‌تر برای اجرای مدل‌هایی مثل Llama یا Qwen هستید، اپلیکیشن رایگان و بدون نیاز به ثبت‌نام Locally AI برای عملکرد بهتر روی تراشه‌های اپل سیلیکون بهینه شده و مخصوص آیفون، آیپد و مک است.

این اپلیکیشن تا اوایل ۲۰۲۶ توسط LM Studio خریداری و به‌عنوان اپلیکیشن رسمی موبایل این شرکت بازعرضه شد؛ یعنی اگر روی مک‌بوک‌تان LM Studio نصب کرده باشید، این دو اپلیکیشن مکمل هم هستند.

Locally AI به دو روش عمل می‌کند:

  • کاملاً آفلاین و بدون حساب کاربری: مدل‌های کوچک با فرمت MLX مستقیم روی خود گوشی دانلود و اجرا می‌شوند.
  • اتصال به مک از راه دور (LM Link): اگر مدل بزرگ‌تری روی مک‌بوک‌تان در LM Studio نصب کرده باشید، می‌توانید با لاگین‌کردن به یک حساب مشترک LM Studio روی هر دو دستگاه، از همان مدل روی آیفون هم استفاده کنید. این حالت هنوز داده را به سرور ابری نمی‌فرستد (ارتباط مستقیم و رمزنگاری‌شده بر پایه‌ی Tailscale بین دو دستگاه شماست)، اما دیگر کاملاً آفلاین نیست؛ چون مک‌تان باید روشن و در دسترس باشد. این لاگین اختیاری است و فقط برای دسترسی به قابلیت ریموت لازم است؛ برای استفاده‌ی معمولی و کاملاً آفلاین از Locally AI (بدون اتصال به مک) همچنان نیازی به حساب یا ثبت‌نام نیست.
راهنمای استفاده از مدل‌های زبانی بزرگ به صورت محلی و آفلاین در دستگاه‌های هوشمند برای حفظ حریم خصوصی.

برای نصب و استفاده از Locally AI طبق مراحل زیر پیش بروید:

  • اپ Locally AI را نصب کنید.
  • اپلیکیشن را باز کنید؛ نیازی به ساخت حساب کاربری یا ورود نیست.
  • در همان ابتدا چند مدل برای دانلود پیشنهاد می‌شود. Skip کنید تا بعدا بتوانید از بین مدل‌های بیشتری انتخاب کنید.
  • بعد از گذراندن تنظیمات اولیه وقتی وارد حالت چت شدید، روی دکمه Try it در وسط صفحه بزنید. حالا از فهرست مدل‌های موجود مدل موردنظر را انتخاب و دانلود کنید.
  • پس از پایان دانلود، مدل به‌صورت خودکار بارگذاری می‌شود و می‌توانید مستقیماً چت را شروع کنید.

چون پردازنده‌ی گوشی هنگام اجرای این مدل‌ها با تمام توان کار می‌کند، ممکن است دستگاه‌تان کمی گرم شود که کاملاً طبیعی است.

اگر خواستید بعداً از قابلیت LM Link استفاده کنید، کافی است در اپلیکیشن با همان ایمیلی که روی LM Studio نصب‌شده روی مک‌بوک‌تان لاگین کرده‌اید، وارد شوید.

آیا اجرای آفلاین هوش مصنوعی ارزشش را دارد؟

همان‌طور که مشخص است، اجرای محلی هوش مصنوعی دیگر فرایندی پیچیده و منحصر به برنامه‌نویسان نیست. اکنون با استفاده از یک نرم‌افزار رسمی و رایگان روی لپ‌تاپ یا گوشی همراه، می‌توان مدلی را به کار گرفت که کاملاُ مستقل از اینترنت و بدون ارسال اطلاعات به هیچ سروری فعالیت می‌کند. در این میان، تنها پیش‌نیاز، شناخت توان سخت‌افزاری دستگاه برای انتخاب مدل متناسب با آن است.

سرعت پاسخ‌دهی مدل‌های آفلاین معمولا کمی از حالت آنلاین کندتر است

هرچند این مدل‌های کم‌حجم قادر به خطایابی کامل یک پروژه هزارخطی از ابتدا نیستند، اما در وظایفی مانند خلاصه‌سازی متن‌ها، ایده‌پردازی برای محتوا، نگارش نامه‌های رسمی و هر فرآیندی که حفظ محرمانگی اطلاعات در آن اهمیت دارد، عملکرد مناسبی دارند. علاوه بر این، به دلیل انجام مستقیم تمامی مراحل پردازش روی خود دستگاه، سرعت پاسخ‌دهی آن‌ها معمولا کمی از حالت آنلاین کندتر است.

سرعت بالای توسعه در این حوزه امیدوارکننده است؛ بنابراین مدل‌های کنونی ممکن است ظرف چند ماه آینده، بدون نیاز به ارتقای سخت‌افزاری، جای خود را به نسخه‌هایی به‌مراتب قدرتمندتر بدهند.

اگر بخواهید هوش مصنوعی آفلاینی را روی گوشی یا لپ‌تاپ‌تان نصب کنید، مهم‌ترین دلیل‌تان چیست؛ قطعی مکرر اینترنت، حساسیت روی حریم خصوصی داده‌ها، یا صرفاً کنجکاوی برای امتحان‌کردن یک فناوری تازه؟ در بخش دیدگاه‌ها برایمان بنویسید.