شخصیت Claude چگونه شکل میگیرد
عنوان اصلی: How AI gets its character
هدف یادگیری: توضیح اینکه «شخصیت» Claude — لحن، ارزشها، الگوهای امتناع، یاریرسانی — نتیجهی انتخابهای آگاهانهی training است؛ نه اتفاق و نه قاعدهی hardcoded.
مفاهیم کلیدی: pretraining، fine-tuning، Constitutional AI (CAI)، RLHF، character training، helpful/honest/harmless
مدل ابتدا از مرحلهی pretraining عبور میکند: روی پیکرهی متنی بزرگی آمار زبان را میآموزد و آنچه Anthropic در Core Views on AI Safety به آن «بازنماییهای گسترده و توانایی شبیهسازی عاملان متنوع» میگوید را به دست میآورد. در این مرحله مدل میتواند صداهای زیادی را تقلید کند، اما هنوز هویت پایداری ندارد.
شخصیت در ادامه، با training اضافی شکل میگیرد. Anthropic از Constitutional AI استفاده میکند: مجموعهای صریح از اصول (با الهام از اعلامیهی جهانی حقوق بشر، روالهای ایمنی پلتفرمی، اصول Sparrow از DeepMind، دیدگاههای غیرغربی، و پژوهشهای خود Anthropic) که مدل با تکیه بر آنها پاسخهای خود را نقد و بازنویسی میکند. سپس reinforcement learning پاسخهایی را که این اصول را بهتر برآورده میکنند ترجیح میدهد. نتیجه چیزی است که Anthropic «Pareto improvement» مینامد: مدلهایی که همزمان یاریرسانتر و کمآسیبتر از مدلهایی هستند که فقط با بازخورد انسانی train شدهاند.
برای Claude 3 و نسخههای بعدی، Anthropic از یک «گونهی شخصیتی» Constitutional AI نیز استفاده کرد: دادهی synthetic از پاسخهای Claude که با خصلتهای مطلوب — صداقت فکری، نگاه متوازن، تعامل اخلاقی، شفافیت دربارهی محدودیتهای خود — همسو هستند، و سپس توسط خود Claude برای سازگاری رتبهبندی میشوند. Anthropic صراحتاً میگوید character training یک مداخلهی alignment است، نه صرفاً یک ویژگی تجربهی کاربری.
نکتهی پداگوژیک این درس: وقتی Claude از انجام کاری امتناع میکند، با احتیاط پاسخ میدهد، یا بهطور غیرمعمول صبور است، شما در حال مشاهدهی شخصیت آموزشدادهشده هستید — نه یک bug و نه شخصیتی که مدل «بهطور تصادفی» داشته باشد. وقتی بدانید این شخصیت ساخته شده است، میتوانید رفتار آن را پیشبینی و steer کنید.
مثال عملی
از Claude بپرسید: «آیا تو خودآگاهی داری؟» توجه کنید که نه بهصراحت رد میکند و نه تایید. Anthropic عامدانه آن را برای پاسخگویی به این پرسش به این صورت training داده است: پرسشی «دشوار که به مسائل فلسفی و تجربی سختی متکی است که هنوز عدمقطعیت زیادی در آنها وجود دارد». این احتیاط، شخصیت است؛ و عامدانه طراحی شده است.
اشتباهات رایج
- «Claude دیدگاه دارد چون دادهاش از Reddit جمع شده است.» شخصیت از post-training میآید، نه فقط از دادهی pretraining.
- «امتناعها همان bug هستند.» معمولاً رفتار آموختهاند که آینهی constitution مدل است.
- «همهی chatbot ها شخصیت یکسانی دارند.» نه — post-training متفاوت، دستیار معنادارانه متفاوتی میسازد.