مفاهیم › مستندات Jev

مقدمه‌ای بر هوش مصنوعی

چرا TypeSafe مدل‌های تصمیم‌گیر با احتمال‌های کالیبره آموزش می‌دهد، نه مدل‌هایی بهینه برای تولید متن.

آخرین به‌روزرسانی: مدل: jev-1.13.0 منبع بازبینی‌شده در منبع انگلیسی

بیشتر محصولات هوش مصنوعی حول گفت‌وگوی مدل و انسان ساخته شده‌اند. TypeSafe از شرط دیگری شروع می‌کند: خودکارسازی در مقیاس بزرگ را تعاملات هوش مصنوعی‌به‌هوش مصنوعی و هوش مصنوعی‌به‌نرم‌افزار در اختیار خواهند داشت؛ پس رابط ماشینی مهم‌تر از رابط چت است.

ما این را «هوش بومی ماشین» (Machine Native Intelligence) می‌نامیم: هوش مصنوعی با ویژگی‌های نرم‌افزاری مانند ساختار، قابلیت اعتماد، مشاهده‌پذیری، آزمون‌پذیری، سرعت، سازگاری و هزینه‌ی پایین.

ساختن برای production، نه ساختن خدا

TypeSafe قصد ساختن مدلی که همه کار بکند را ندارد. برای سامانه‌های production طراحی شده که کد در آن‌ها به یک تصمیم محدود نیاز دارد تا بررسی و بر اساسش عمل کند. انتظار ما این است که خودکارسازی هوش مصنوعی در مقیاس بزرگ به ۹۹٪ تعامل ماشین‌با‌ماشین و ۱٪ تعامل انسانی نزدیک‌تر باشد.

سه رویکرد پس‌آموزش

RLHF

یادگیری تقویتی از بازخورد انسانی مدل‌های پیش‌آموزش‌دیده را به چت‌بات تبدیل کرد و به مدل یاد می‌دهد پاسخ‌هایی تولید کند که انسان‌ها ترجیح می‌دهند.

RLVR

یادگیری تقویتی با پاداش‌های قابل‌راستی‌آزمایی مدل‌های استدلالی را ساخت که در کارهایی مثل ریاضی قوی‌اند، اما کندتر و گران‌ترند.

RLCD

یادگیری تقویتی برای تصمیم‌های کالیبره TypeSafe را آموزش می‌دهد تا به‌جای متن تولیدشده، تصمیم و احتمال کالیبره برگرداند.

RLHF برای آموزش InstructGPT و ChatGPT استفاده شد و دیوگو آلمیدا (Diogo Almeida)، هم‌بنیان‌گذار TypeSafe، از هم‌مخترعان آن است.

RLCD و تصمیم‌های کالیبره

  • مدل متن تولید نمی‌کند.
  • تصمیم و احتمال برمی‌گرداند.
  • احتمال بالاتر باید با شانس بیشتر درستی پاسخ متناظر باشد.

کالیبراسیون عدم قطعیت را برای نرم‌افزار قابل استفاده می‌کند. در میان تعداد زیادی پیش‌بینی از یک مدل خوب‌کالیبره، رخدادهایی با احتمال 0.2 باید حدود ۲۰٪ مواقع، با 0.8 حدود ۸۰٪ و با 1.0 ۱۰۰٪ مواقع رخ دهند. این نرخ‌ها گروهی از پیش‌بینی‌ها را توصیف می‌کنند، نه تضمینی درباره‌ی یک پاسخ منفرد.

مشکلات RLHF

RLHF به مدل یاد می‌دهد چیزهایی بگوید که مردم ترجیح می‌دهند. این هدف برای چت‌بات‌ها خوب است، اما می‌تواند چاپلوسی و توهم‌های با لحن مطمئن را هم پاداش دهد. بهینه‌سازی ترجیحات همچنین باعث حذف مُدها (mode dropping) می‌شود: مدل یاد می‌گیرد سبک خاصی را ترجیح دهد و احتمال دیگر خروجی‌های ممکن را کاهش دهد؛ نسخه‌ی ملایم‌تری از فروپاشی مُد (mode collapse) در شبکه‌های GAN.

یک خروجی می‌تواند برای انسان قانع‌کننده باشد بی‌آنکه برای خودکارسازی بدون نظارت به‌اندازه‌ی کافی قابل اعتماد باشد. ترجیح انسانی و قابلیت اعتماد ماشینی دو هدف بهینه‌سازی متفاوت‌اند.