Steerability
عنوان اصلی: Steerability
هدف یادگیری: توضیح اینکه دستورهای کاربر تا چه اندازه — و تا چه اندازه نمیتوانند — رفتار مدل را شکل دهند؛ و معرفی prompting بهعنوان اهرم اصلی.
مفاهیم کلیدی: steerability، system prompt در برابر user prompt، context engineering، گرایشهای آموختهشدهای که در برابر steering مقاومت میکنند، iteration
Steerability یعنی «دستورهای شما در عمل چقدر کنترل به شما میدهد». Anthropic پرسش مهندسی را اینگونه صورتبندی میکند: چه پیکربندیای از context بیشترین احتمال را دارد رفتار مطلوب مدل را تولید کند؟ این صورتبندی مهم است، چون کنترل را در یک «جملهی جادویی» قرار نمیدهد، بلکه در حالت کلی prompt — system instructions، examples، format hints، نوبتهای پیشین، tools متصل.
بسیاری از رفتارها صراحتاً قابلsteer هستند. یادداشتهای انتشار خود Anthropic توصیف میکند که میتوان trigger تفکر تطبیقی Claude را steer کرد («اگر مدل بیش از حد لازم فکر میکند، میتوان با راهنمایی آن را steer کرد»)، گرایش Opus 4.7 به spawn کردن subagent ها را steer کرد، و اجرای policy را با زبان policy صریحتر steer کرد. بهطور خلاصه: دستور صریح معمولاً مدل را حرکت میدهد.
برخی رفتارها عامدانه کمتر steerable هستند. امتناع در برابر نقض ایمنی صریح، گرایش به صداقت فکری، و برخی افشاگریها محصول character training و Constitutional training هستند و عامدانه در برابر override مقاومت میکنند. این یک ویژگی است، نه یک bug — و فراگیران باید بدانند «prompt من کار نکرد» گاهی یعنی «من تلاش کردم از یک guardrail عبور کنم.»
پیام پداگوژیک: steerability واقعی و قدرتمند است، اما مطلق نیست. استفادهی موثر از Claude iterative است: prompt بنویسید، خروجی را مشاهده کنید، prompt را تنظیم کنید، دوباره اجرا کنید. این حلقهی iteration همان چیزی است که در دورهی AI Fluency رسماً بهعنوان Description-Discernment loop معرفی میشود.
مثال عملی
از Claude بخواهید: «فتوسنتز را توضیح بده.» سپس بنویسید: «فتوسنتز را برای یک کودک کنجکاو ۸ساله در ۴ جملهی کوتاه و با یک تشبیه از آشپزی توضیح بده.» تفاوت قابلملاحظهی خروجی، خود steerability در عمل است.
اشتباهات رایج
- «یک prompt جادویی هست که قفل مدل را باز میکند.» نیست — steering iterative و contextual است.
- «اگر prompt کار نکرد، مدل خراب است.» اغلب prompt کمتوصیف بوده.
- «میتوانم با prompt از safety training عبور کنم.» معمولاً نه — این مقاومت عامدانه است.