مایکروسافت دو هوش مصنوعی تصویرساز جدید با عملکرد تحسین‌برانگیز معرفی کرد

جمعه 2 مرداد 1405 - 12:41
مطالعه 2 دقیقه
نمای گرافیکی از هوش مصنوعی MAI-Image-2.5 Pro مایکروسافت
مایکروسافت دو هوش مصنوعی جدید را با هدف ارتقای کیفیت تولید تصاویر حرفه‌ای و کاهش تأخیر در مکالمات صوتی به پلتفرم فاندری خود افزود.

مایکروسافت از دو عضو جدید خانواده‌ی هوش مصنوعی خود با نام MAI-Image-2.5 Pro و MAI-Voice-2 Flash رونمایی کرد. مدل نخست برای ارائه‌ی بالاترین سطح از وفاداری بصری و کنترل خلاقانه در پروژه‌های حرفه‌ای طراحی شده و مدل دوم، پاسخی به نیاز روزافزون به برنامه‌های صوتی با کمترین میزان تاخیر است.

بر اساس بیانیه‌ی رسمی مایکروسافت، هدف از خلق مدل‌های جدید، ارائه‌ی حق انتخاب بیشتر به مشتریان بر اساس نیازهای خاص هر پروژه عنوان شده است. مایکروسافت تأکید کرد که بازخورد توسعه‌دهندگان و شرکت‌ها نشان می‌دهد برخی به دنبال بالاترین کیفیت ممکن برای تولیدات حرفه‌ای هستند و گروهی دیگر سرعت واکنش و مقرون‌به‌صرفه‌بودن را در اولویت قرار می‌دهند.

پخش از رسانه

MAI-Image-2.5 Pro به طور خاص برای سناریوهایی ساخته شده که دقت بصری، یکپارچگی اشیا و هم‌سویی دقیق با هدف در آن‌ها اهمیت حیاتی دارد. مدل یاددشده درک بصری و دانش جهانی را بهبود بخشیده تا برای مصارفی مانند تولید کمپین‌های تبلیغاتی بزرگ، عکاسی محصول برای کاتالوگ‌های تجارت الکترونیک و طراحی استوری‌بورد در صنایع فیلم و بازی به کار آید.

MAI-Image-2.5 Pro برای تولید محتوا در صنایع تحت نظارت مانند خدمات درمانی و مالی که به دقت بالایی در بازنمایی واقعیت نیاز دارند، گزینه‌ای ایدئال محسوب می‌شود.

در مقابل، MAI-Voice-2 Flash یک مدل تبدیل متن به گفتار با تأخیر بسیار کم است که از بیش از ۱۵ زبان پشتیبانی می‌کند. کاربرد اصلی این مدل در مراکز تماس، دستیارهای صوتی مکالمه‌ای و سیستم‌های پاسخگویی صوتی تعاملی (IVR) تعریف شده است؛ جاهایی که هر میلی‌ثانیه تأخیر می‌تواند تجربه‌ی کاربر را از مکالمه‌ی طبیعی دور کند. مایکروسافت می‌گوید این مدل با کاهش مکث‌های طولانی، تعاملات را روان‌تر و طبیعی‌تر می‌کند.

مایکروسافت برای راهنمایی مشتریان خود، مرز انتخاب میان این مدل‌ها و نمونه‌های پیشین را مشخص کرد. زمانی باید به سراغ MAI-Image-2.5 Pro رفت که وفاداری حداکثری تصویر، یکپارچگی اشیا در چندین تصویر و پایبندی دقیق به دستورالعمل‌های خلاقانه در اولویت باشد. در حوزه‌ی صدا اگر کاهش تأخیر و مقرون‌به‌صرفه‌بودن نسبت‌به هویت صوتی اولویت دارد، MAI-Voice-2 Flash انتخاب بهتری خواهد بود.

هزینه‌ی استفاده از MAI-Image-2.5 Pro برای ورودی متنی، ۵ دلار به ازای هر یک میلیون توکن و برای خروجی تصویر، ۱۰۶ دلار به ازای هر یک میلیون توکن است.

قیمت MAI-Voice-2 Flash از ۱۵ دلار به ازای هر یک میلیون کاراکتر آغاز می‌شود. مدل تصویری از طریق مایکروسافت فاندری و مدل صوتی از طریق سرویس Azure Speech در دسترس توسعه‌دهندگان قرار گرفته است.

نظرات

از دیگر اعضاء خانواده قلم