شرکت TypeSafe AI از مدل هوش مصنوعی جدیدی به نام Jev رونمایی کرده است؛ مدلی که برخلاف چتجیپیتی یا کلاد و دیگر چتباتهای امروزی برای نوشتن متن و گفتوگو با انسان طراحی نشده و قرار است تصمیمهای سریع، ارزان و قابلاستفاده برای نرمافزارها بگیرد.
TypeSafe از Jev بهعنوان اولین مدل عمومی از خانوادهای جدید با نام System One Models یاد میکند. این نام از مفهوم «سیستم ۱» در کتاب تفکر، سریع و کند دنیل کانمن الهام گرفته شده است؛ اصطلاحی که به شیوهی سریع و شهودی تفکر انسان اشاره دارد. TypeSafe نیز میخواهد مدلهای System One چنین نقشی را در نرمافزارها ایفا کنند.
Jev چه تفاوتی با چتجیپیتی و کلاد دارد؟
مدلهایی مانند چتجیپیتی و کلاد در دستهی LLM یا مدلهای زبانی بزرگ قرار میگیرند. این مدلها پاسخ را بهصورت متوالی و توکنبهتوکن تولید میکنند؛ «توکن» واحد کوچکی از متن است که میتواند یک کلمه، بخشی از یک کلمه یا حتی یک علامت باشد.
Jev مسیر متفاوتی دارد. این مدل اساساً برای تولید متن ساخته نشده است. در عوض، اطلاعات را دریافت میکند و به سؤالهای مشخصی دربارهی آن پاسخ میدهد؛ پاسخهایی که نرمافزار میتواند مستقیماً از آنها استفاده کند.
پخش از رسانه
برای مثال، یک فروشگاه اینترنتی میتواند اطلاعات یک سفارش را به Jev بدهد و از آن بپرسد احتمال تقلبیبودن سفارش چقدر است. سیستم پشتیبانی نیز میتواند از Jev بخواهد تشخیص دهد یک پیام مربوط به بخش فروش، پشتیبانی فنی یا امور مالی است.
به زبان ساده، Jev چیزی شبیه یک «اگر» هوشمند در برنامهنویسی است؛ با این تفاوت که بهجای قوانین ثابت، میتواند اطلاعات پیچیده و حتی متن را بررسی کند و دربارهی آن تصمیم بگیرد.
Jev چگونه تصمیم میگیرد؟
Jev دو چیز دریافت میکند: ابتدا State یا وضعیت که شامل اطلاعات موردنیاز برای تصمیمگیری است؛ مثلاً متن گفتوگوی یک مشتری، مشخصات حساب یا اطلاعات یک سفارش. سپس سؤالهایی که برنامهنویس میخواهد دربارهی این اطلاعات پاسخ داده شوند.
این سؤالها درحالحاضر میتوانند سه شکل اصلی داشته باشند: پاسخ به درست یا غلط بودن یک گزاره، انتخاب یکی از چند گزینهی ازپیشتعریفشده یا دادن امتیاز روی یک مقیاس مشخص. Jev علاوهبر پاسخ، احتمال و میزان اطمینان خود را نیز اعلام میکند.
نکتهی مهم این است که Jev میتواند چندین سؤال دربارهی اطلاعات یکسان را بهصورت موازی بررسی کند. مثلاً یک سیستم پشتیبانی میتواند با یک درخواست از Jev بخواهد موضوع پیام، میزان فوریت، احتمال عصبانیت مشتری و چند ویژگی دیگر را همزمان تشخیص دهد.
خروجی ساختاریافته یعنی چه؟
یکی از تفاوتهای مهم Jev با مدلهای زبانی معمولی، Structured Output یا خروجی ساختاریافته است.
فرض کنید از یک مدل زبانی بپرسیم «این تراکنش مشکوک است؟». مدل ممکن است چند پاراگراف توضیح تولید کند و نرمافزار بعداً مجبور شود از داخل آن متن پاسخ موردنظر را استخراج کند.
در Jev نوع پاسخ از قبل تعریف میشود. اگر گزینههای ممکن فقط «مشکوک» و «عادی» باشند، مدل نمیتواند گزینهی سومی بسازد یا بهجای جواب یک پاراگراف توضیح تحویل دهد.
این همان چیزی است که TypeSafe از آن با عنوان Type Safety یاد میکند؛ یعنی نوع و قالب خروجی از قبل مشخص است و مدل نمیتواند خروجیای خارج از آن ساختار ایجاد کند.
البته Type Safe بودن به معنی همیشه درست بودن Jev نیست. مدل ممکن است پاسخ را دقیقاً در قالب موردنظر نرمافزار تحویل دهد، اما گزینهی اشتباه را انتخاب کند. بنابراین ادعای TypeSafe مبنیبر اینکه Jev «توهم نمیزند» را باید با همین محدودیت در نظر گرفت: مدل نمیتواند خروجی خارج از ساختار تعریفشده تولید کند، اما همچنان احتمال تصمیم اشتباه وجود دارد.
Jev چقدر سریع است؟
بخش جذاب ماجرا ادعاهای TypeSafe دربارهی سرعت و هزینهی Jev است.
این شرکت زمان پاسخ Jev را حدود ۷۰ تا ۵۰۰ میلیثانیه اعلام کرده و میگوید مدل در وظایفی که برای آن طراحی شده میتواند حدود ۴۰ تا ۲۰۰ برابر سریعتر از مدلهای بزرگ هوش مصنوعی باشد.
هزینهی استفاده از Jev نیز ۰٫۰۴۲ دلار بهازای هر یک میلیون توکن ورودی یا ۴۲ دلار بهازای یک میلیارد توکن اعلام شده است. برای خروجی نیز هزینهای دریافت نمیشود، زیرا Jev مانند یک LLM معمولی متن طولانی تولید نمیکند.
TypeSafe در یکی از ارزیابیهای داخلی خود حتی از ۱۹۳٫۶ برابر سرعت بیشتر و ۴۴۴٫۶ برابر هزینهی کمتر نسبت به مدلهای زبانی مورد مقایسه خبر میدهد.
بااینحال، خود شرکت تأکید میکند این اعداد در محدودهی بالای بهبودهایی قرار دارند که میتوان در دنیای واقعی انتظار داشت. علاوهبراین، Workflowهای آزمایش را اعضای تیم خود TypeSafe ساختهاند؛ بنابراین شرکت احتمال وجود مقداری سوگیری در نتایج را رد نمیکند.
Workflow یا گردش کار به مجموعه مراحلی گفته میشود که یک نرمافزار برای انجام یک وظیفه طی میکند؛ مثلاً دریافت سفارش، بررسی احتمال تقلب و سپس تأیید سفارش یا ارسال آن برای بررسی انسانی.
یک آزمایش مستقل چه نتیجهای داشت؟
مقاله Axentia به آزمایش جالبی از Mike Taylor از Every نیز اشاره میکند که تصویر واقعبینانهتری از توانایی Jev ارائه میدهد.
در این آزمایش، ۲۱ سؤال دربارهی ۳۷ سند از Jev پرسیده شد؛ یعنی مدل درمجموع ۷۷۷ تصمیم را در کمتر از ۰٫۷ ثانیه تولید کرد و هزینهی تخمینی کل این پردازش حدود یکچهارم سنت بود.
در آزمایش کوچک دیگری، هفت ایراد عمداً در یک متن قرار داده شد. Jev موفق شد ۶ مورد از ۷ ایراد را پیدا کند، درحالیکه مدل زبانی بزرگتر مورد مقایسه هر هفت مورد را تشخیص داد. در همین آزمایش Jev حدود ۲۵ برابر سریعتر و ۵۸۰ برابر ارزانتر برآورد شد.
این نتیجه یکی از مهمترین نکات دربارهی Jev را نشان میدهد: سرعت و هزینهی بسیار پایین لزوماً به معنی عملکرد بهتر در همهی زمینهها نیست و ممکن است در برخی وظایف، مدلهای بزرگتر همچنان دقیقتر باشند.
Jev دقیقاً کجا کاربرد دارد؟
ایدهی TypeSafe این نیست که Jev جای تمام مدلهای زبانی را بگیرد. کاربرد اصلی آن تصمیمهای کوچک و پرتکراری است که امروز برای انجامشان از یک LLM بزرگ استفاده میشود.
برای مثال، یک سیستم پشتیبانی میتواند با Jev موضوع و فوریت درخواست مشتری را تشخیص دهد و سپس نرمافزار تصمیم بگیرد پیام به کدام بخش ارسال شود. یک سیستم جستوجوی مبتنیبر هوش مصنوعی نیز میتواند صدها سند را با Jev امتیازدهی کند و فقط چند سند مناسب را برای بررسی دقیقتر به یک مدل بزرگ بفرستد.
در چنین معماریای Jev تصمیمهای ساده و پرتعداد را میگیرد، کد برنامه قوانین قطعی را کنترل میکند و موارد پیچیده یا نامطمئن به انسان یا یک مدل قدرتمندتر ارجاع داده میشوند.
این رویکرد میتواند یکی از کاربردهای مهم Jev باشد: قرار نیست مدلهای بزرگی مثل چتجیپیتی یا کلاد حذف شوند؛ بلکه تعداد دفعاتی که مجبوریم برای تصمیمهای کوچک سراغ چنین مدلهای گرانتر و کندتری برویم، کاهش پیدا میکند.
Jev برای چه کارهایی مناسب نیست؟
Jev نمیتواند جواب مشتری را بنویسد، مقاله تولید کند، برنامهنویسی کند یا برای حل یک مسئلهی پیچیده برنامهای چندمرحلهای طراحی کند. برای چنین کارهایی همچنان به مدلهای مولد نیاز داریم.
حتی برای تصمیمهای ساده نیز همیشه استفاده از Jev منطقی نیست. اگر مسئله را بتوان با یک قانون قطعی حل کرد، استفاده از هوش مصنوعی فقط سیستم را پیچیدهتر میکند. مثلاً برای تشخیص اینکه مبلغ فاکتور از ۱۰۰۰ دلار بیشتر است یا خیر، یک خط کد معمولی کافی است.
Jev بیشتر زمانی معنی پیدا میکند که دادهها پیچیده و نامنظم باشند و تصمیم به درک معنای آنها نیاز داشته باشد.
Jev هنوز در ابتدای راه است
Jev درحالحاضر بهصورت Early Access ارائه میشود؛ یعنی محصول قابلاستفاده است، اما دسترسی به آن هنوز عمومی نشده و TypeSafe کاربران را بهتدریج از فهرست انتظار وارد سرویس میکند.
ابهامات مهمی نیز دربارهی مدل وجود دارد. براساس بررسی Axentia، TypeSafe هنوز جزئیاتی مانند اندازهی مدل، دادههای آموزشی، محدودیت تعداد درخواستها و برخی شاخصهای عملکرد سرویس در محیط واقعی را بهصورت عمومی منتشر نکرده است.
بنابراین فعلاً مهمترین ویژگی Jev نه ادعای «۲۰۰ برابر سریعتر بودن»، بلکه ایدهای است که پشت آن قرار دارد: شاید برای بسیاری از تصمیمهای کوچک داخل نرمافزار اصلاً نیازی به تولید متن توسط یک مدل زبانی بزرگ نداشته باشیم.
اگر این ایده در مقیاس واقعی جواب بدهد، مدلهایی مانند Jev میتوانند در کنار LLMها قرار بگیرند و بخش بزرگی از تصمیمهای سریع و پرتکرار نرمافزارها را با هزینه و تأخیر بسیار کمتری انجام دهند.