درس ۶ از ۲۰

Steerability

عنوان اصلی: Steerability

هدف یادگیری: توضیح اینکه دستورهای کاربر تا چه اندازه — و تا چه اندازه نمی‌توانند — رفتار مدل را شکل دهند؛ و معرفی prompting به‌عنوان اهرم اصلی.

مفاهیم کلیدی: steerability، system prompt در برابر user prompt، context engineering، گرایش‌های آموخته‌شده‌ای که در برابر steering مقاومت می‌کنند، iteration

Steerability یعنی «دستورهای شما در عمل چقدر کنترل به شما می‌دهد». Anthropic پرسش مهندسی را این‌گونه صورت‌بندی می‌کند: چه پیکربندی‌ای از context بیشترین احتمال را دارد رفتار مطلوب مدل را تولید کند؟ این صورت‌بندی مهم است، چون کنترل را در یک «جمله‌ی جادویی» قرار نمی‌دهد، بلکه در حالت کلی prompt — system instructions، examples، format hints، نوبت‌های پیشین، tools متصل.

بسیاری از رفتارها صراحتاً قابل‌steer هستند. یادداشت‌های انتشار خود Anthropic توصیف می‌کند که می‌توان trigger تفکر تطبیقی Claude را steer کرد («اگر مدل بیش از حد لازم فکر می‌کند، می‌توان با راهنمایی آن را steer کرد»)، گرایش Opus 4.7 به spawn کردن subagent ها را steer کرد، و اجرای policy را با زبان policy صریح‌تر steer کرد. به‌طور خلاصه: دستور صریح معمولاً مدل را حرکت می‌دهد.

برخی رفتارها عامدانه کم‌تر steerable هستند. امتناع در برابر نقض ایمنی صریح، گرایش به صداقت فکری، و برخی افشاگری‌ها محصول character training و Constitutional training هستند و عامدانه در برابر override مقاومت می‌کنند. این یک ویژگی است، نه یک bug — و فراگیران باید بدانند «prompt من کار نکرد» گاهی یعنی «من تلاش کردم از یک guardrail عبور کنم.»

پیام پداگوژیک: steerability واقعی و قدرتمند است، اما مطلق نیست. استفاده‌ی موثر از Claude iterative است: prompt بنویسید، خروجی را مشاهده کنید، prompt را تنظیم کنید، دوباره اجرا کنید. این حلقه‌ی iteration همان چیزی است که در دوره‌ی AI Fluency رسماً به‌عنوان Description-Discernment loop معرفی می‌شود.

مثال عملی

از Claude بخواهید: «فتوسنتز را توضیح بده.» سپس بنویسید: «فتوسنتز را برای یک کودک کنجکاو ۸ساله در ۴ جمله‌ی کوتاه و با یک تشبیه از آشپزی توضیح بده.» تفاوت قابل‌ملاحظه‌ی خروجی، خود steerability در عمل است.

اشتباهات رایج

  • «یک prompt جادویی هست که قفل مدل را باز می‌کند.» نیست — steering iterative و contextual است.
  • «اگر prompt کار نکرد، مدل خراب است.» اغلب prompt کم‌توصیف بوده.
  • «می‌توانم با prompt از safety training عبور کنم.» معمولاً نه — این مقاومت عامدانه است.