درس ۳ از ۲۰

Next Token Prediction

عنوان اصلی: Next Token Prediction

هدف یادگیری: توضیح اینکه هر خروجی Claude، توکن به توکن، با پیش‌بینی محتمل‌ترین توکن بعدی در context تولید می‌شود؛ و استفاده از این مدل ذهنی برای فهم هم‌زمان نقاط قوت و حالت‌های شکست مدل.

مفاهیم کلیدی: token (واحد زیر‌واژه که tokenizer می‌سازد، معمولاً واژگان ۳۰ تا ۱۰۰ هزار)، probability distribution، autoregressive generation، hallucination در سطح ظاهر، planning ahead

Claude یک مدل autoregressive است: یک توزیع احتمال روی توکن بعدی تولید می‌کند، از آن نمونه می‌گیرد، توکن انتخاب‌شده را به context می‌افزاید و این چرخه را تکرار می‌کند. token یک واحد زیر‌واژه است — برای مثال «playing» ممکن است در یک tokenizer یک توکن باشد و در tokenizer دیگری به «play» + «ing» شکسته شود. tokenization واژگان مدل را قابل‌مدیریت نگه می‌دارد (حدود ۳۰ تا ۱۰۰ هزار مدخل) در حالی که هنوز زبان‌های متعدد را پوشش می‌دهد.

این مکانیزم ساده، بسیاری از رفتارها را توضیح می‌دهد. مدل در مسیرهای پر‌تردد فوق‌العاده است — خلاصه‌سازی، تغییر فرمت، ترجمه، تکمیل الگوهای رایج — چون توکن بعدی در آن نقاط، توسط context به‌خوبی تعیین شده است. مدل در قلمروهایی که توکن بعدی توسط داده‌ی training تعیین نشده، شکننده است؛ چون باز هم چیزی روان و مطمئن تولید می‌کند. این همان مکانیزم سطحی hallucination است: مدل دروغ نمی‌گوید، بلکه ادامه‌ای محتمل‌به‌نظر در ناحیه‌ای تولید می‌کند که در آن «به‌نظر محتمل» و «درست» از هم جدا شده‌اند.

پژوهش‌های interpretability خود Anthropic نکته‌ی ظریفی اضافه می‌کنند: هرچند Claude در سطح خروجی توکن به توکن پیش‌بینی می‌کند، در داخل خود اغلب planning ahead انجام می‌دهد. در مقاله‌ی Tracing the Thoughts of a Large Language Model، پژوهشگران نشان دادند که هنگام نوشتن شعر هم‌قافیه، Claude ابتدا تصمیم می‌گیرد چه واژه‌ای باید در پایان مصراع بیاید و سپس واژه‌های قبل‌تر را به‌گونه‌ای تولید می‌کند که به آن پایان منتهی شوند. پس «next token predictor» تنها رابط خروجی را توصیف می‌کند، نه کل محاسبه‌ی درونی را.

پیام پداگوژیک: مدل را همچون یک «حدس‌زن بسیار خوب» در نظر بگیرید که از روی همه‌ی متن قبلی، حدس می‌زند چه چیزی باید بعد بیاید. هرچه context شما بهتر باشد، حدس آن بهتر است. هرچه کار شما بیشتر در ناحیه‌ی کم‌احتمال (رویدادهای جدید، حقایق کم‌سابقه، زنجیره‌های استدلال نو) قرار بگیرد، باید با دقت بیشتری راستی‌آزمایی کنید.

مثال عملی

به Claude نیمه‌جمله‌ی «پایتخت فرانسه ...» را بدهید — توکن بعدی تقریباً قطعی است. سپس بنویسید «پایتخت [نام یک کشور خیالی] ...» — توجه کنید مدل باز هم چیزی روان و موقر تولید می‌کند، چون شکل پاسخ بسیار محتمل است، حتی وقتی محتوای آن نمی‌تواند باشد. این تمرین، تفاوت بین «اطمینان لحن» و «درستی واقعی» را به شما نشان می‌دهد.

اشتباهات رایج

  • «next token prediction چیزی فراتر از autocomplete نیست.» مکانیزم یکی است، اما در مقیاسی به‌مراتب بزرگ‌تر و با بازنمایی‌های درونی بسیار انتزاعی‌تر.
  • «اگر مطمئن به‌نظر می‌رسد، درست است.» اطمینانِ لحن هیچ ربطی به دقتِ واقعی ندارد؛ هر دو از یک مکانیزم می‌آیند.
  • «مدل برنامه‌ای ندارد، فقط به‌سرعت چیزی می‌گوید.» planning درونی روی افق چندتوکنی مشاهده شده است.