معرفی
نگاهی کلی به Jev، اولین مدل System One TypeSafe، و اینکه چرا برای تصمیمهایی که کد شما مصرف میکند مناسبتر از یک مدل زبانی معمولی است.
مدلهای زبانی بزرگ (LLM) برای تولید متنی طراحی شدهاند که انسان بخواند. وقتی به مدلی نیاز دارید که قضاوتی انجام دهد و کد شما آن را مصرف کند، ناهمخوانی پیش میآید: یک سامانهی تولید متن را مجبور میکنید تصمیم ساختاریافته بیرون بدهد و بعد نتیجه را دوباره به چیزی قابل اتکا برای کدتان parse میکنید.
Jev مدل پرچمدار TypeSafe و نخستین مدل System One است. مدلهای System One برای گرفتن تصمیمهای سریع و ساختاریافتهای ساخته شدهاند که نرمافزار مستقیماً از آنها استفاده کند. Jev پرسشهای تایپشده را در برابر یک state ارزیابی میکند و نتیجهی ساختاریافته را مستقیم برمیگرداند. بدون تولید متن و بدون parse. مقادیر تایپشده و توزیعهای احتمال میگیرید که کدتان میتواند روی آنها شاخهبندی، مرتبسازی و مسیریابی کند. Choice و Score همچنین اطمینان (confidence) برمیگردانند تا کدتان تصمیم بگیرد آیا و چگونه بر اساس پاسخ عمل کند.
پریمیتیوهای TypeSafe
TypeSafe سه پریمیتیو هوش مصنوعی ارائه میکند. این پریمیتیوها هم مانند پریمیتیوهای نرمافزاری ماژولار، ترکیبپذیر، ساختاریافته، قابل اعتماد و سریعاند. هرکدام نوع متفاوتی از پرسش را میپرسد و نوع متفاوتی از پاسخ برمیگرداند.
| نوع پرسش | هدف | خروجی |
|---|---|---|
| Choice | انتخاب یک گزینه از یک فهرست | choice، probabilities، confidence |
| Score | امتیازدادن به state روی یک روبریک | score، probabilities، confidence |
| Noul | آیا این گزاره درست است؟ | noul (۰ تا ۱) |
هر سه نوع پرسش را میتوان در یک فراخوانی API ترکیب کرد. هر پرسش بهصورت موازی و ایزوله در برابر همان state و یکجا ارزیابی میشود. افزودن پرسش تقریباً زمان پاسخ را تغییر نمیدهد. چون هر پرسش مستقل ارزیابی میشود، پرسشهای بیشتر باعث «پوسیدگی کانتکست» (context-rot) نمیشوند.
پرسشهای اتمی، ترکیبشده در کد
مدلهای System One وقتی بهترین عملکرد را دارند که هر پرسش یک چیز مشخص و خوشتعریف را بپرسد. هر پرسش را مثل یک تشخیص «حسِ درونی» در نظر بگیرید: قضاوتی که یک فرد بسیار آگاه، با داشتن کانتکست درست، در چند ثانیه انجام میدهد.
اگر پرسشی که میخواهید بپرسید به استدلال طولانی نیاز دارد یا چند عامل مستقل را میسنجد، آن را تجزیه کنید. هر عامل را جداگانه بپرسید و نتایج را با منطق کد خودتان ترکیب کنید. این کار هر ارزیابی را قابل اعتماد نگه میدارد و کنترل کامل وزندهی ابعاد را به شما میدهد.
برای نمونه، بهجای «این ارائهی استارتاپی را ارزیابی کن»، جداگانه دربارهی اندازهی بازار، امکانپذیری فنی و تمایز بپرسید. امتیازها را با فرمول خودتان ترکیب کنید. وقتی اولویتها عوض شد، بهجای بازنویسی پرامپت یک ضریب را در کد تغییر دهید.