مدل‌ها › مستندات Jev

محدودیت‌های Jev 1.13 jaggedness

Jev بی‌نقص نیست. این‌ها لبه‌های ناهمواری است که در jev-1.13 شناخته شده؛ بسیاری در نسخه‌های بعدی رفع می‌شوند.

آخرین به‌روزرسانی: مدل: jev-1.13.0 منبع بازبینی‌شده در منبع انگلیسی

مربوط به jev-1.13. آخرین بازبینی منبع: .

jev-1.13 سریع، کالیبره و در قضاوت عقل سلیم خوب است، اما بی‌نقص نیست. بهترین عملکرد را در کارهای System One دارد. ممکن است در کارهایی که سطوح بیشتری از غیرمستقیم‌بودن دارند مشکل داشته باشد، می‌تواند بسیار تحت‌اللفظی باشد و در کارهای نیازمند دقت عددی ضعیف است.

#حالت شکستبه‌جایش این کار را بکنید
۱خواندن تحت‌اللفظیشرط دقیق و معیار هر گزینه را بنویسید
۲ریاضی و اعدادمحاسبات را در کد نگه دارید
۳مقایسه‌ی تاریخ و زماناجزا را استخراج و در کد مقایسه کنید
۴غیرمستقیم‌بودن (indirection)گام‌ها را کم کنید؛ به بخش مرتبط state اشاره کنید
۵state بزرگ پر از جزئیات نامرتبطاول فیلتر کنید؛ فقط آنچه پرسش لازم دارد بفرستید
۶محتوای خصمانهپرامپت دقیق بنویسید و موارد مرزی را پیش از استقرار آزمایش کنید
۷دستورالعمل و معیارهای متناقضمعیارها و دستورالعمل را هم‌راستا کنید
۸ناورداهای ساختاری عقل سلیمهر تصمیم را یک‌جور بپرسید؛ اتحادها را در کد اعمال کنید
۹تولید متناز یک مدل مولد استفاده کنید
۱. خواندن تحت‌اللفظی

jev-1.13 به پرسشی که نوشته‌اید پاسخ می‌دهد، نه پرسشی که منظورتان بود. کلمات محدودکننده، نفی‌ها و شرط‌های ضمنی به همان شکل ظاهری خوانده می‌شوند. شرط دقیق را در instructions بنویسید و موارد مرزی را در criteria بگذارید. وقتی به پاسخ اشتباهی نگاه می‌کنید و می‌بینید در حال توضیح «منظور واقعی‌تان» هستید، آن توضیح نیمه‌ی گم‌شده‌ی دستورالعمل است.

۲. ریاضی و اعداد

Jev ماشین‌حساب نیست. شمارش (حروف یک کلمه، تکرار یک عبارت، اقلام یک فهرست بلند) قابل اعتماد نیست؛ در کد بشمارید. برای شمردن اقلامی با یک ویژگی، در کد روی اقلام پیمایش کنید و برای هر کدام یک پرسش بپرسید:

نمایش‌های معنایی بهتر از عددی کار می‌کنند: نام انگلیسی رنگ بهتر از کد hex. از score (امید ریاضی و احتمال‌ها) برای بازسازی دقیق عددی بین دو سطح استفاده نکنید؛ فقط برای بررسی عبور از آستانه.

۳. مقایسه‌ی تاریخ و زمان

تاریخ‌ها به‌صورت متن خوانده می‌شوند، نه کمیت‌های مرتب. کار را تقسیم کنید: استخراج یک قضاوت است، پس به مدل بدهید؛ حساب نیست، پس در کد بماند. هر جزء تاریخ مجموعه‌ی بسته‌ی کوچکی است (دوازده ماه، سی‌ویک روز، بازه‌ای از سال‌ها)، پس استخراج به Choice روی گزینه‌های شمارش‌شده تبدیل می‌شود، با گزینه‌ی صریح «ذکر نشده». کد اجزا را به تاریخ واقعی تبدیل می‌کند و ترتیب، مدت و روز هفته را خودش حساب می‌کند.

۴. غیرمستقیم‌بودن

دستورالعمل‌های دارای نفی مضاعف یا چند گام استدلال کمتر قابل اعتمادند. دستورالعمل را تا حد ممکن مستقیم بنویسید و بخش‌های مرتبط state را با نام مشخص کنید.

۵. state بزرگ پر از جزئیات نامرتبط

با بزرگ‌شدن state با محتوای نامرتبط دقت افت می‌کند. اول در کد بازیابی و فیلتر کنید و فقط فیلدهای لازم را بفرستید. وقتی فیلتر ممکن نیست، از یک Noul برای سنجش ارتباط استفاده کنید.

۶. محتوای خصمانه

state داده است و jev-1.13 به‌طور پیش‌فرض آن را خصمانه فرض نمی‌کند. محتوایی که برای هدایت مدل نوشته شده — دستور تزریقی، قاب‌بندی گمراه‌کننده یا متنی که برای طبقه‌بندی خودش استدلال می‌کند — می‌تواند پاسخ را جابه‌جا کند. در معیارها صریح باشید و پیش از استقرار گسترده کامل آزمایش کنید.

۷. دستورالعمل و معیارهای متناقض

وقتی instructions و criteria چیزهای متفاوتی می‌خواهند، مدل ممکن است گیج شود. مثلاً Noulی که در آن true به «نه» و false به «بله» نگاشت شده بدتر عمل می‌کند. معیارها را امتداد دستورالعمل بدانید.

۸. ناورداهای ساختاری عقل سلیم

jev-1.13 بسیار سازگار است، اما بسیاری از ناورداهای ساختاری که ممکن است تصور کنید تضمین نمی‌شوند. مثلاً «آیا مشتری درخواست بازپرداخت دارد؟» به‌صورت Noul و Choice بله/خیر:

Noul noulChoice yesChoice noChoice confidence
0.220.010.990.97

و یک پرسش و نقیضش به‌صورت دو Noul می‌توانند مجموعی غیر از ۱ داشته باشند (۰٫۷۲ + ۰٫۴۷ = ۱٫۱۹). آستانه‌ای را که روی Noul تنظیم کرده‌اید به Choice منتقل نکنید و از مدل انتظار اتحادهای حسابی بین پرسش‌های جداگانه نداشته باشید. Choice نسبی است («کدام گزینه»)، هر Noul مطلق است و می‌تواند برای همه پایین باشد.

۹. تولید متن

jev-1.13 برای تولید متن آموزش ندیده. برای استخراج داده بهتر است گزینه‌های ممکن را با regex یا یک مدل مولد استخراج کنید و بگذارید Jev درست‌ترین را انتخاب کند؛ یعنی استخراج را به یک Choice روی گزینه‌ها تبدیل کنید.

یادآوری؛ از این‌ها پرهیز کنید:

  • پرسیدن چیزی که کد می‌تواند دقیق محاسبه کند.
  • پنهان‌کردن چند قضاوت در یک پرسش.
  • کارهای System Two: لایه‌های بیشتر غیرمستقیم‌بودن.
  • دادن کانتکست بیشتر از نیاز پرسش در state؛ محتوای نامرتبط دقت را کم می‌کند.