قطعی اینترنت برای بسیاری از کاربران ایرانی یک سناریوی فرضی نیست؛ تجربهای تکرارشونده است. پیشتر در چنین شرایطی دسترسی به سرویسهای هوش مصنوعی هم عملاً از بین میرفت، اما این تصور دیگر کاملاً درست نیست. امروز بخشی از مدلهای زبانی بهگونهای طراحی شدهاند که بدون اتصال به سرورهای ابری، مستقیماً روی خود دستگاه اجرا شوند.
اجرای محلی (Local) هوش مصنوعی به شما اجازه میدهد حتی در حالت کاملاً آفلاین با مدل کار کنید. از طرف دیگر، در این حالت چون دادهها برای پردازش از دستگاه خارج نمیشوند، میتواند به حفظ حریم خصوصی نیز کمک کند. مهمتر این که در بسیاری از موارد میتوانید بهطور رایگان از مدلهای هوش مصنوعی آفلاین استفاده کنید. البته منظور از رایگان در اینجا، مدلهای سبک و متنبازی است که شرکتهایی مانند گوگل برای اجرای روی سختافزارهای شخصی منتشر کردهاند، نه نسخههای کامل و پولی سرویسهای ابری.
این مدلهای سبک که با عنوان SLM یا مدلهای زبانی کوچک شناخته میشوند، با هدف اجرای مدلهای هوش مصنوعی روی سختافزارهای معمولی توسعه یافتهاند؛ بهطوری که برای استفاده از آنها به ابرکامپیوتر نیاز ندارید و در برخی موارد میتوانید یک مدل را روی لپتاپ یا حتی گوشی هوشمند خود اجرا کنید.
این ابزارها قرار نیست جایگزین دستیارهای قدرتمند ابری شوند، اما برای لحظاتی که اینترنت قطع است، یا برای کارهایی که حریم خصوصی داده در آنها اهمیت دارد، گزینهای واقعی و در دسترساند. در ادامه، روش نصب و اجرای هوش مصنوعی بدون نیاز به اینترنت را آموزش میدهیم و راهنمای کاملی برای نصب و استفاده از آن روی لپتاپ و گوشی ارائه میکنیم.
آیا سیستم شما توان اجرای محلی هوش مصنوعی را دارد؟
پیش از نصب هر نرمافزاری، باید بدانید دستگاهتان از پس چه مدلی برمیآید. اجرای هوش مصنوعی (یا بهاصطلاح Inference) بهشدت به حافظه وابسته است؛ اما نه حافظهی ذخیرهسازی، بلکه رم و بهخصوص VRAM
رم همان حافظهی موقتی است که پردازندهی اصلی (CPU) روی آن کار میکند. اما هوش مصنوعی عاشق پردازش موازی است و کارت گرافیک (GPU)، با هزاران هستهی ریز خود، این کار را بسیار سریعتر از CPU انجام میدهد.
کارت گرافیک هم حافظهی اختصاصی خودش را دارد که به آن VRAM میگویند. حالت ایدهآل این است که کل مدل در همین VRAM جا شود؛ اگر جا نشود، بخشی از آن به رم منتقل میشود که سرعت را بهشدت پایین میآورد.
لپتاپهای گیمینگ با کارت گرافیک مجزا برای این کار مناسباند؛ اما مکبوکهای اپل با تراشههای سری M (و لپتاپهای ویندوزی جدید با معماری مشابه) یک استثنای جالب به نام حافظهی یکپارچه یا Unified Memory دارند که در آن CPU و GPU از یک استخر رم مشترک استفاده میکنند؛ یعنی یک مکبوک با ۳۲ یا ۶۴ گیگابایت رم، عملاً همان مقدار VRAM هم در اختیار دارد.
کوانتیزیشن و انتخاب مدل
اگر سختافزار قوی ندارید، جای نگرانی نیست؛ اینجا تکنیکی به اسم کوانتیزیشن (Quantization) به کمک میآید. این فرایند دقت اعداد داخل مدل را پایین میآورد؛ مثلاً از ۱۶ بیت به ۴ بیت. نتیجه این است که مدلی با ۷ یا ۸ میلیارد پارامتر که معمولاً حدود ۱۴ تا ۱۶ گیگابایت حجم دارد، به چهار تا پنج گیگابایت فشرده میشود و روی یک سیستم معمولی با ۸ گیگابایت رم هم قابلاجراست اما به قیمت افت جزئی در دقت پاسخها.
برای اینکه مجبور نباشید هر بار محاسبه کنید، جدول زیر یک راهنمای کلی و تقریبی برای انتخاب مدل مناسب است:
رم + VRAM در دسترس | دستگاه مناسب | اندازهی مدل پیشنهادی | مثال |
|---|---|---|---|
کمتر از ۴ گیگابایت | گوشی میانرده یا قدیمی | زیر ۱ میلیارد پارامتر (مثلاً Gemma 4 E2B) | Gemma 4 نسخهی E2B |
۴ تا ۸ گیگابایت | گوشی پرچمدار / لپتاپ بدون گرافیک مجزا | حدود ۲ تا ۴ میلیارد پارامتر (کوانتایزشده) | Gemma 4 نسخهی E4B |
۸ تا ۱۶ گیگابایت | لپتاپ معمولی یا گیمینگ سبک | حدود ۷ تا ۸ میلیارد پارامتر (کوانتایزشده) | Llama یا Qwen در ردهی ۷ تا ۸ میلیارد پارامتر |
۱۶ گیگابایت یا بیشتر | لپتاپ گیمینگ یا مکبوک با رم بالا | ۱۲ میلیارد پارامتر به بالا | نسخههای بزرگتر خانوادهی Gemma یا Qwen |
این اعداد تقریبیاند و به نوع کوانتیزیشن و بهینهسازی هر اپلیکیشن هم بستگی دارند؛ اما بهعنوان نقطهی شروع، از هدررفت وقت برای دانلود مدلی که اصلاً روی دستگاهتان جا نمیشود جلوگیری میکند.
چککردن مشخصات در ویندوز
- کلیدهای Ctrl + Shift + Esc را همزمان بزنید تا Task Manager باز شود.
- به تب Performance بروید، ابتدا مقدار رم را ببینید، سپس در بخش GPU دنبال عبارت Dedicated GPU Memory بگردید؛ این عدد VRAM واقعی است.
اگر در فهرست ارائهشده چند پردازنده گرافیکی (GPU) وجود دارد، توجه داشته باشید که معمولا یکی از آنها گرافیک یکپارچه پردازنده و بدون VRAM اختصاصی است؛ بنابراین باید کارت گرافیک مجزا را انتخاب کنید.
چککردن مشخصات در مک
- روی لوگوی اپل کلیک کنید و About This Mac را بزنید.
- اگر جلوی Chip نام تراشههای اختصاصی اپل (سری M یا جدیدتر) نوشته شده، عدد کنار Memory هم رم شماست و هم VRAM.
- اگر مک قدیمی و مبتنیبر پردازندهی اینتل دارید، آن عدد فقط رم است و باید برای VRAM به بخش Graphics نگاه کنید.
روش میانبر سادهتر
برای شناسایی مدلهای آفلاین سازگار با سیستم خود، میتوانید از وبسایت TurboLLM بهعنوان روشی سادهتر کمک بگیرید. این ابزار رایگان و متنباز را یک توسعهدهندهی مستقل برای همین هدف ساخته است. با وارد کردن میزان رم و VRAM سیستم (یا استفاده از قابلیت تشخیص خودکار ابزار)، فهرستی دقیق از مدلهایی که بدون نقص یا با کمترین مشکل روی دستگاهتان اجرا میشوند در اختیارتان قرار میگیرد.
نصب و اجرای محلی هوش مصنوعی روی لپتاپ (ویندوز و مک)
تا چند وقت پیش، اجرای هوش مصنوعی بهصورت محلی نیازمند کار با خط فرمان بود. با این حال، اکنون دو ابزار رایگان این فرایند را بدون نیاز به محیط ترمینال تسهیل کردهاند که هرکدام برای کاربردی متفاوت مناسبتر است.
گزینهی اول: Ollama
اولاما (Ollama) که پرطرفدارترین ابزار متنباز در این زمینه به شمار میرود، از نسخه ۰.۱۰ به بعد یک برنامه رسمی با رابط گرافیکی ارائه کرده است که امکان دریافت مدلها و گفتوگو با آنها را بدون نیاز به محیط ترمینال فراهم میکند.
برای نصب و استفاده از Ollama طبق مراحل زیر پیش بروید:
- به وبسایت ollama.com بروید و نسخهی متناسب با سیستمعامل خود را دانلود کنید.
- مثل هر نرمافزار معمولی دیگر آن را نصب کنید.
- اپلیکیشن را باز کنید. یک محیط چت مشابه ChatGPT یا Gemini خواهید دید.
- از همان صفحه یک مدل آقلاین مثل مدل جمای گوگل را برای دانلود انتخاب کنید.
در فهرست مدلهای اولاما، کنار برخی گزینهها مانند GLM 5.2 و MiniMax M3 برچسب Cloud درج شده است. این موارد جزو مدلهای محلی به شمار نمیروند و از آنجا که پردازش آنها بهجای سیستم شما روی سرورهای اولاما انجام میشود، استفاده از آنها به اتصال اینترنت و حساب کاربری رایگان اولاما نیاز دارد. برای اجرای کاملاً آفلاین، باید مدلهای فاقد برچسب Cloud را دریافت کنید؛ مدلهای خانوادهی Gemma در این گروه جای میگیرند.
نکتهای برای توسعهدهندگان: پلتفرم Ollama از نسخه ۰.۱۴ به بعد با API پیامرسانی آنتروپیک سازگار شده و از نسخه ۰.۱۵ نیز قابلیت اتصال مستقیم Claude Code به مدلهای محلی را از طریق دستور ollama launch claude فراهم کرده است. بر این اساس، پس از راهاندازی Claude Code، اجرای این دستور در محیط ترمینال فهرستی از مدلهای نصبشده را نمایش میدهد که با انتخاب مدل مدنظر، امکان استفاده از یک دستیار برنامهنویسی کاملا آفلاین و محلی مهیا میشود.
گزینهی دوم: LM Studio
این اپلیکیشن رایگان، روی ویندوز، مک و لینوکس نصب میشود و نیازی به ثبتنام ندارد. تفاوت اصلیاش با Ollama این است که یک فروشگاه مدل داخلی و متصل به Hugging Face دارد؛ یعنی بهجای واردکردن نام مدل، میتوانید در همان اپلیکیشن جستوجو کنید و با یک کلیک مدل موردنظرتان را دانلود و اجرا کنید.
برای نصب و استفاده از LM Studio طبق مراحل زیر پیش بروید:
- به وبسایت lmstudio.ai بروید و نسخهی متناسب با سیستمعامل خود را را دریافت کنید.
- در اولین اجرا، صفحهای برای تنظیمات پیشرفته میبینید که ابتدا بهترین گزینه برای مدل هوش مصنوعی متناسب با سیستم شما را برای دانلود پیشنهاد میکند. میتوانید همنیجا مدل را دانلود کنید یا آن را به مراحل بعد موکول کنید.
- سپس از شما میپرسد که میخواهید Developer Mode را روش کنید یا اجازه میدهید که هنگام ورود به سیستم سرویس مدل محلی (Start LLM service on login) اجرا شود. برای استفادهی ساده و چتکردن، هر دو گزینه را میتوانید خاموش بگذارید و رد شوید؛ این تنظیمات فقط برای کسانی لازم است که میخواهند مدل را بهعنوان یک API یا سرویس پسزمینه به برنامههای دیگر متصل کنند.



- اگر در ابتدا مدلی را دانلود نکردید، حالا اپلیکیشن را باز کنید و از تب عمودی کناری روی آخرین گزینه از بالا یعنیModel Search بزنید. نام مدل موردنظر را جستوجو کنید و روی دکمهی دانلود بزنید. میتوانید برای راحت تر شدن کار مدلها را براساس بهترین انتخاب (best match) سورت کنید.
- پس از پایان دانلود، به تب چت بروید، مدل دانلودشده را انتخاب کنید تا بارگذاری شود و شروع به گفتوگو کنید.
نکتهای که LM Studio را برای کاربران مکبوک جذاب میکند این است که از چهارچوب اختصاصی اپل به اسم MLX پشتیبانی میکند؛ چهارچوبی که مخصوص بهینهسازی روی پردازندههای سری M طراحی شده. اگر هنگام دانلود مدل، نسخهی MLX همان مدل (دارای پسوند mlx.) را انتخاب کنید (بهجای نسخهی معمولی GGUF)، سرعت پاسخدهی روی مکبوک به شکل محسوسی بهتر از Ollama خواهد بود؛ در مقابل، اولاما برای کسانی که کار سریع و بیدردسر با خط فرمان و اتصال ابزارهایی مثل Claude Code را میخواهند، گزینهی سادهتری است.
اجرای محلی هوش مصنوعی روی گوشی (آیفون و اندروید)
برای اجرای محلی هوش مصنوعی روی گوشی هم دو گزینه در درسترس است. در هر دو گزینه، فقط برای اولین اجرا و دانلود مدل به اینترنت نیاز دارید؛ از آن به بعد، اپلیکیشن حتی در حالت هواپیما هم بدون هیچ مشکلی کار میکند.
گزینهی اول: Google AI Edge Gallery
این اپلیکیشن رسمی و رایگان گوگل، برای اندروید و آیفون در دسترس است و برای استفاده نیازی به ثبتنام ندارد. اپلیکیشن Google AI Edge Gallery از قابلیتهای زیر پشتیبانی میکند:
- AI Chat برای گفتوگوی چندمرحلهای با مدلهای متنباز، همراه با حالت Thinking Mode برای دیدن روند استدلال مدل
- Ask Image برای تحلیل و توصیف عکس
- Audio Scribe برای رونویسی و ترجمهی همزمان صدا به متن، کاملاً آفلاین
- Prompt Lab محیطی برای آزمایش پرامپتها با تنظیم دقیق پارامترها
- Agent Skills که مدل را از یک چتبات ساده به دستیاری فعالتر تبدیل میکند؛ با ابزارهای داخلی مثل جستوجوی ویکیپدیا، نقشهی تعاملی، تولید کد QR و حتی امکان بارگذاری مهارتهای سفارشی از یک آدرس اینترنتی یا انجمن گیتهاب
- Mobile Actions که با دستور صوتی یا متنی ساده، کارهایی مثل روشنکردن چراغقوه یا ساخت رویداد تقویمی را بدون اینترنت انجام میدهد.
برای نصب و استفاده از Google AI Edge Gallery طبق مراحل زیر پیش بروید:
- اپ Google AI Edge Gallery را نصب کنید.
- پس از باز کردن اپ، صفحهی اصلی یک شبکه از قابلیتها (مثل AI Chat، Ask Image، Prompt Lab) را نشان میدهد. روی یکی از آنها، مثلاً AI Chat، ضربه بزنید.


- فهرست مدلهای سازگار با آن قابلیت باز میشود. از خانوادهی Gemma، مدل موردنظر را انتخاب و دانلود کنید. بهطور مشخص، مدل سبکتر (E2B) با کمتر از ۱.۵ گیگابایت حافظه روی اکثر گوشیها اجرا میشود، اما برای تجربهی روان مدل قویتر (E4B) با هر سه ورودی متن، تصویر و صدا، بهتر است گوشیتان حداقل ۸ گیگابایت رم داشته باشد.
- پس از پایان دانلود، از صفحهی اصلی یکی از تسکها (مثلاً AI Chat) را انتخاب کنید، مدل دانلودشده را از فهرست انتخاب و شروع به گفتوگو کنید.
گزینهی دوم: Locally AI برای کاربران اپل
اگر دنبال محیطی سادهتر برای اجرای مدلهایی مثل Llama یا Qwen هستید، اپلیکیشن رایگان و بدون نیاز به ثبتنام Locally AI برای عملکرد بهتر روی تراشههای اپل سیلیکون بهینه شده و مخصوص آیفون، آیپد و مک است.
این اپلیکیشن تا اوایل ۲۰۲۶ توسط LM Studio خریداری و بهعنوان اپلیکیشن رسمی موبایل این شرکت بازعرضه شد؛ یعنی اگر روی مکبوکتان LM Studio نصب کرده باشید، این دو اپلیکیشن مکمل هم هستند.
Locally AI به دو روش عمل میکند:
- کاملاً آفلاین و بدون حساب کاربری: مدلهای کوچک با فرمت MLX مستقیم روی خود گوشی دانلود و اجرا میشوند.
- اتصال به مک از راه دور (LM Link): اگر مدل بزرگتری روی مکبوکتان در LM Studio نصب کرده باشید، میتوانید با لاگینکردن به یک حساب مشترک LM Studio روی هر دو دستگاه، از همان مدل روی آیفون هم استفاده کنید. این حالت هنوز داده را به سرور ابری نمیفرستد (ارتباط مستقیم و رمزنگاریشده بر پایهی Tailscale بین دو دستگاه شماست)، اما دیگر کاملاً آفلاین نیست؛ چون مکتان باید روشن و در دسترس باشد. این لاگین اختیاری است و فقط برای دسترسی به قابلیت ریموت لازم است؛ برای استفادهی معمولی و کاملاً آفلاین از Locally AI (بدون اتصال به مک) همچنان نیازی به حساب یا ثبتنام نیست.
برای نصب و استفاده از Locally AI طبق مراحل زیر پیش بروید:
- اپ Locally AI را نصب کنید.
- اپلیکیشن را باز کنید؛ نیازی به ساخت حساب کاربری یا ورود نیست.
- در همان ابتدا چند مدل برای دانلود پیشنهاد میشود. Skip کنید تا بعدا بتوانید از بین مدلهای بیشتری انتخاب کنید.
- بعد از گذراندن تنظیمات اولیه وقتی وارد حالت چت شدید، روی دکمه Try it در وسط صفحه بزنید. حالا از فهرست مدلهای موجود مدل موردنظر را انتخاب و دانلود کنید.
- پس از پایان دانلود، مدل بهصورت خودکار بارگذاری میشود و میتوانید مستقیماً چت را شروع کنید.
چون پردازندهی گوشی هنگام اجرای این مدلها با تمام توان کار میکند، ممکن است دستگاهتان کمی گرم شود که کاملاً طبیعی است.
اگر خواستید بعداً از قابلیت LM Link استفاده کنید، کافی است در اپلیکیشن با همان ایمیلی که روی LM Studio نصبشده روی مکبوکتان لاگین کردهاید، وارد شوید.
آیا اجرای آفلاین هوش مصنوعی ارزشش را دارد؟
همانطور که مشخص است، اجرای محلی هوش مصنوعی دیگر فرایندی پیچیده و منحصر به برنامهنویسان نیست. اکنون با استفاده از یک نرمافزار رسمی و رایگان روی لپتاپ یا گوشی همراه، میتوان مدلی را به کار گرفت که کاملاُ مستقل از اینترنت و بدون ارسال اطلاعات به هیچ سروری فعالیت میکند. در این میان، تنها پیشنیاز، شناخت توان سختافزاری دستگاه برای انتخاب مدل متناسب با آن است.
سرعت پاسخدهی مدلهای آفلاین معمولا کمی از حالت آنلاین کندتر است
هرچند این مدلهای کمحجم قادر به خطایابی کامل یک پروژه هزارخطی از ابتدا نیستند، اما در وظایفی مانند خلاصهسازی متنها، ایدهپردازی برای محتوا، نگارش نامههای رسمی و هر فرآیندی که حفظ محرمانگی اطلاعات در آن اهمیت دارد، عملکرد مناسبی دارند. علاوه بر این، به دلیل انجام مستقیم تمامی مراحل پردازش روی خود دستگاه، سرعت پاسخدهی آنها معمولا کمی از حالت آنلاین کندتر است.
سرعت بالای توسعه در این حوزه امیدوارکننده است؛ بنابراین مدلهای کنونی ممکن است ظرف چند ماه آینده، بدون نیاز به ارتقای سختافزاری، جای خود را به نسخههایی بهمراتب قدرتمندتر بدهند.
اگر بخواهید هوش مصنوعی آفلاینی را روی گوشی یا لپتاپتان نصب کنید، مهمترین دلیلتان چیست؛ قطعی مکرر اینترنت، حساسیت روی حریم خصوصی دادهها، یا صرفاً کنجکاوی برای امتحانکردن یک فناوری تازه؟ در بخش دیدگاهها برایمان بنویسید.