محدودیتهای Jev 1.13 jaggedness
Jev بینقص نیست. اینها لبههای ناهمواری است که در jev-1.13 شناخته شده؛ بسیاری در نسخههای بعدی رفع میشوند.
مربوط به jev-1.13. آخرین بازبینی منبع: .
jev-1.13 سریع، کالیبره و در قضاوت عقل سلیم خوب است، اما بینقص نیست. بهترین عملکرد را در کارهای System One دارد. ممکن است در کارهایی که سطوح بیشتری از غیرمستقیمبودن دارند مشکل داشته باشد، میتواند بسیار تحتاللفظی باشد و در کارهای نیازمند دقت عددی ضعیف است.
| # | حالت شکست | بهجایش این کار را بکنید |
|---|---|---|
| ۱ | خواندن تحتاللفظی | شرط دقیق و معیار هر گزینه را بنویسید |
| ۲ | ریاضی و اعداد | محاسبات را در کد نگه دارید |
| ۳ | مقایسهی تاریخ و زمان | اجزا را استخراج و در کد مقایسه کنید |
| ۴ | غیرمستقیمبودن (indirection) | گامها را کم کنید؛ به بخش مرتبط state اشاره کنید |
| ۵ | state بزرگ پر از جزئیات نامرتبط | اول فیلتر کنید؛ فقط آنچه پرسش لازم دارد بفرستید |
| ۶ | محتوای خصمانه | پرامپت دقیق بنویسید و موارد مرزی را پیش از استقرار آزمایش کنید |
| ۷ | دستورالعمل و معیارهای متناقض | معیارها و دستورالعمل را همراستا کنید |
| ۸ | ناورداهای ساختاری عقل سلیم | هر تصمیم را یکجور بپرسید؛ اتحادها را در کد اعمال کنید |
| ۹ | تولید متن | از یک مدل مولد استفاده کنید |
۱. خواندن تحتاللفظی
jev-1.13 به پرسشی که نوشتهاید پاسخ میدهد، نه پرسشی که منظورتان بود. کلمات محدودکننده، نفیها و شرطهای ضمنی به همان شکل ظاهری خوانده میشوند. شرط دقیق را در instructions بنویسید و موارد مرزی را در criteria بگذارید. وقتی به پاسخ اشتباهی نگاه میکنید و میبینید در حال توضیح «منظور واقعیتان» هستید، آن توضیح نیمهی گمشدهی دستورالعمل است.
۲. ریاضی و اعداد
Jev ماشینحساب نیست. شمارش (حروف یک کلمه، تکرار یک عبارت، اقلام یک فهرست بلند) قابل اعتماد نیست؛ در کد بشمارید. برای شمردن اقلامی با یک ویژگی، در کد روی اقلام پیمایش کنید و برای هر کدام یک پرسش بپرسید:
نمایشهای معنایی بهتر از عددی کار میکنند: نام انگلیسی رنگ بهتر از کد hex. از score (امید ریاضی و احتمالها) برای بازسازی دقیق عددی بین دو سطح استفاده نکنید؛ فقط برای بررسی عبور از آستانه.
۳. مقایسهی تاریخ و زمان
تاریخها بهصورت متن خوانده میشوند، نه کمیتهای مرتب. کار را تقسیم کنید: استخراج یک قضاوت است، پس به مدل بدهید؛ حساب نیست، پس در کد بماند. هر جزء تاریخ مجموعهی بستهی کوچکی است (دوازده ماه، سیویک روز، بازهای از سالها)، پس استخراج به Choice روی گزینههای شمارششده تبدیل میشود، با گزینهی صریح «ذکر نشده». کد اجزا را به تاریخ واقعی تبدیل میکند و ترتیب، مدت و روز هفته را خودش حساب میکند.
۴. غیرمستقیمبودن
دستورالعملهای دارای نفی مضاعف یا چند گام استدلال کمتر قابل اعتمادند. دستورالعمل را تا حد ممکن مستقیم بنویسید و بخشهای مرتبط state را با نام مشخص کنید.
۵. state بزرگ پر از جزئیات نامرتبط
با بزرگشدن state با محتوای نامرتبط دقت افت میکند. اول در کد بازیابی و فیلتر کنید و فقط فیلدهای لازم را بفرستید. وقتی فیلتر ممکن نیست، از یک Noul برای سنجش ارتباط استفاده کنید.
۶. محتوای خصمانه
state داده است و jev-1.13 بهطور پیشفرض آن را خصمانه فرض نمیکند. محتوایی که برای هدایت مدل نوشته شده — دستور تزریقی، قاببندی گمراهکننده یا متنی که برای طبقهبندی خودش استدلال میکند — میتواند پاسخ را جابهجا کند. در معیارها صریح باشید و پیش از استقرار گسترده کامل آزمایش کنید.
۷. دستورالعمل و معیارهای متناقض
وقتی instructions و criteria چیزهای متفاوتی میخواهند، مدل ممکن است گیج شود. مثلاً Noulی که در آن true به «نه» و false به «بله» نگاشت شده بدتر عمل میکند. معیارها را امتداد دستورالعمل بدانید.
۸. ناورداهای ساختاری عقل سلیم
jev-1.13 بسیار سازگار است، اما بسیاری از ناورداهای ساختاری که ممکن است تصور کنید تضمین نمیشوند. مثلاً «آیا مشتری درخواست بازپرداخت دارد؟» بهصورت Noul و Choice بله/خیر:
Noul noul | Choice yes | Choice no | Choice confidence |
|---|---|---|---|
| 0.22 | 0.01 | 0.99 | 0.97 |
و یک پرسش و نقیضش بهصورت دو Noul میتوانند مجموعی غیر از ۱ داشته باشند (۰٫۷۲ + ۰٫۴۷ = ۱٫۱۹). آستانهای را که روی Noul تنظیم کردهاید به Choice منتقل نکنید و از مدل انتظار اتحادهای حسابی بین پرسشهای جداگانه نداشته باشید. Choice نسبی است («کدام گزینه»)، هر Noul مطلق است و میتواند برای همه پایین باشد.
۹. تولید متن
jev-1.13 برای تولید متن آموزش ندیده. برای استخراج داده بهتر است گزینههای ممکن را با regex یا یک مدل مولد استخراج کنید و بگذارید Jev درستترین را انتخاب کند؛ یعنی استخراج را به یک Choice روی گزینهها تبدیل کنید.
یادآوری؛ از اینها پرهیز کنید:
- پرسیدن چیزی که کد میتواند دقیق محاسبه کند.
- پنهانکردن چند قضاوت در یک پرسش.
- کارهای System Two: لایههای بیشتر غیرمستقیمبودن.
- دادن کانتکست بیشتر از نیاز پرسش در
state؛ محتوای نامرتبط دقت را کم میکند.