مقدمهای بر هوش مصنوعی
چرا TypeSafe مدلهای تصمیمگیر با احتمالهای کالیبره آموزش میدهد، نه مدلهایی بهینه برای تولید متن.
بیشتر محصولات هوش مصنوعی حول گفتوگوی مدل و انسان ساخته شدهاند. TypeSafe از شرط دیگری شروع میکند: خودکارسازی در مقیاس بزرگ را تعاملات هوش مصنوعیبههوش مصنوعی و هوش مصنوعیبهنرمافزار در اختیار خواهند داشت؛ پس رابط ماشینی مهمتر از رابط چت است.
ما این را «هوش بومی ماشین» (Machine Native Intelligence) مینامیم: هوش مصنوعی با ویژگیهای نرمافزاری مانند ساختار، قابلیت اعتماد، مشاهدهپذیری، آزمونپذیری، سرعت، سازگاری و هزینهی پایین.
ساختن برای production، نه ساختن خدا
TypeSafe قصد ساختن مدلی که همه کار بکند را ندارد. برای سامانههای production طراحی شده که کد در آنها به یک تصمیم محدود نیاز دارد تا بررسی و بر اساسش عمل کند. انتظار ما این است که خودکارسازی هوش مصنوعی در مقیاس بزرگ به ۹۹٪ تعامل ماشینباماشین و ۱٪ تعامل انسانی نزدیکتر باشد.
سه رویکرد پسآموزش
RLHF
یادگیری تقویتی از بازخورد انسانی مدلهای پیشآموزشدیده را به چتبات تبدیل کرد و به مدل یاد میدهد پاسخهایی تولید کند که انسانها ترجیح میدهند.
RLVR
یادگیری تقویتی با پاداشهای قابلراستیآزمایی مدلهای استدلالی را ساخت که در کارهایی مثل ریاضی قویاند، اما کندتر و گرانترند.
RLCD
یادگیری تقویتی برای تصمیمهای کالیبره TypeSafe را آموزش میدهد تا بهجای متن تولیدشده، تصمیم و احتمال کالیبره برگرداند.
RLHF برای آموزش InstructGPT و ChatGPT استفاده شد و دیوگو آلمیدا (Diogo Almeida)، همبنیانگذار TypeSafe، از هممخترعان آن است.
RLCD و تصمیمهای کالیبره
- مدل متن تولید نمیکند.
- تصمیم و احتمال برمیگرداند.
- احتمال بالاتر باید با شانس بیشتر درستی پاسخ متناظر باشد.
کالیبراسیون عدم قطعیت را برای نرمافزار قابل استفاده میکند. در میان تعداد زیادی پیشبینی از یک مدل خوبکالیبره، رخدادهایی با احتمال 0.2 باید حدود ۲۰٪ مواقع، با 0.8 حدود ۸۰٪ و با 1.0 ۱۰۰٪ مواقع رخ دهند. این نرخها گروهی از پیشبینیها را توصیف میکنند، نه تضمینی دربارهی یک پاسخ منفرد.
مشکلات RLHF
RLHF به مدل یاد میدهد چیزهایی بگوید که مردم ترجیح میدهند. این هدف برای چتباتها خوب است، اما میتواند چاپلوسی و توهمهای با لحن مطمئن را هم پاداش دهد. بهینهسازی ترجیحات همچنین باعث حذف مُدها (mode dropping) میشود: مدل یاد میگیرد سبک خاصی را ترجیح دهد و احتمال دیگر خروجیهای ممکن را کاهش دهد؛ نسخهی ملایمتری از فروپاشی مُد (mode collapse) در شبکههای GAN.
یک خروجی میتواند برای انسان قانعکننده باشد بیآنکه برای خودکارسازی بدون نظارت بهاندازهی کافی قابل اعتماد باشد. ترجیح انسانی و قابلیت اعتماد ماشینی دو هدف بهینهسازی متفاوتاند.