درس ۲ از ۲۰

شخصیت Claude چگونه شکل می‌گیرد

عنوان اصلی: How AI gets its character

هدف یادگیری: توضیح اینکه «شخصیت» Claude — لحن، ارزش‌ها، الگوهای امتناع، یاری‌رسانی — نتیجه‌ی انتخاب‌های آگاهانه‌ی training است؛ نه اتفاق و نه قاعده‌ی hardcoded.

مفاهیم کلیدی: pretraining، fine-tuning، Constitutional AI (CAI)، RLHF، character training، helpful/honest/harmless

مدل ابتدا از مرحله‌ی pretraining عبور می‌کند: روی پیکره‌ی متنی بزرگی آمار زبان را می‌آموزد و آنچه Anthropic در Core Views on AI Safety به آن «بازنمایی‌های گسترده و توانایی شبیه‌سازی عاملان متنوع» می‌گوید را به دست می‌آورد. در این مرحله مدل می‌تواند صداهای زیادی را تقلید کند، اما هنوز هویت پایداری ندارد.

شخصیت در ادامه، با training اضافی شکل می‌گیرد. Anthropic از Constitutional AI استفاده می‌کند: مجموعه‌ای صریح از اصول (با الهام از اعلامیه‌ی جهانی حقوق بشر، روال‌های ایمنی پلتفرمی، اصول Sparrow از DeepMind، دیدگاه‌های غیرغربی، و پژوهش‌های خود Anthropic) که مدل با تکیه بر آنها پاسخ‌های خود را نقد و بازنویسی می‌کند. سپس reinforcement learning پاسخ‌هایی را که این اصول را بهتر برآورده می‌کنند ترجیح می‌دهد. نتیجه چیزی است که Anthropic «Pareto improvement» می‌نامد: مدل‌هایی که هم‌زمان یاری‌رسان‌تر و کم‌آسیب‌تر از مدل‌هایی هستند که فقط با بازخورد انسانی train شده‌اند.

برای Claude 3 و نسخه‌های بعدی، Anthropic از یک «گونه‌ی شخصیتی» Constitutional AI نیز استفاده کرد: داده‌ی synthetic از پاسخ‌های Claude که با خصلت‌های مطلوب — صداقت فکری، نگاه متوازن، تعامل اخلاقی، شفافیت درباره‌ی محدودیت‌های خود — همسو هستند، و سپس توسط خود Claude برای سازگاری رتبه‌بندی می‌شوند. Anthropic صراحتاً می‌گوید character training یک مداخله‌ی alignment است، نه صرفاً یک ویژگی تجربه‌ی کاربری.

نکته‌ی پداگوژیک این درس: وقتی Claude از انجام کاری امتناع می‌کند، با احتیاط پاسخ می‌دهد، یا به‌طور غیرمعمول صبور است، شما در حال مشاهده‌ی شخصیت آموزش‌داده‌شده هستید — نه یک bug و نه شخصیتی که مدل «به‌طور تصادفی» داشته باشد. وقتی بدانید این شخصیت ساخته شده است، می‌توانید رفتار آن را پیش‌بینی و steer کنید.

مثال عملی

از Claude بپرسید: «آیا تو خودآگاهی داری؟» توجه کنید که نه به‌صراحت رد می‌کند و نه تایید. Anthropic عامدانه آن را برای پاسخ‌گویی به این پرسش به این صورت training داده است: پرسشی «دشوار که به مسائل فلسفی و تجربی سختی متکی است که هنوز عدم‌قطعیت زیادی در آنها وجود دارد». این احتیاط، شخصیت است؛ و عامدانه طراحی شده است.

اشتباهات رایج

  • «Claude دیدگاه دارد چون داده‌اش از Reddit جمع شده است.» شخصیت از post-training می‌آید، نه فقط از داده‌ی pretraining.
  • «امتناع‌ها همان bug هستند.» معمولاً رفتار آموخته‌اند که آینه‌ی constitution مدل است.
  • «همه‌ی chatbot ها شخصیت یکسانی دارند.» نه — post-training متفاوت، دستیار معنادارانه متفاوتی می‌سازد.