Next Token Prediction
عنوان اصلی: Next Token Prediction
هدف یادگیری: توضیح اینکه هر خروجی Claude، توکن به توکن، با پیشبینی محتملترین توکن بعدی در context تولید میشود؛ و استفاده از این مدل ذهنی برای فهم همزمان نقاط قوت و حالتهای شکست مدل.
مفاهیم کلیدی: token (واحد زیرواژه که tokenizer میسازد، معمولاً واژگان ۳۰ تا ۱۰۰ هزار)، probability distribution، autoregressive generation، hallucination در سطح ظاهر، planning ahead
Claude یک مدل autoregressive است: یک توزیع احتمال روی توکن بعدی تولید میکند، از آن نمونه میگیرد، توکن انتخابشده را به context میافزاید و این چرخه را تکرار میکند. token یک واحد زیرواژه است — برای مثال «playing» ممکن است در یک tokenizer یک توکن باشد و در tokenizer دیگری به «play» + «ing» شکسته شود. tokenization واژگان مدل را قابلمدیریت نگه میدارد (حدود ۳۰ تا ۱۰۰ هزار مدخل) در حالی که هنوز زبانهای متعدد را پوشش میدهد.
این مکانیزم ساده، بسیاری از رفتارها را توضیح میدهد. مدل در مسیرهای پرتردد فوقالعاده است — خلاصهسازی، تغییر فرمت، ترجمه، تکمیل الگوهای رایج — چون توکن بعدی در آن نقاط، توسط context بهخوبی تعیین شده است. مدل در قلمروهایی که توکن بعدی توسط دادهی training تعیین نشده، شکننده است؛ چون باز هم چیزی روان و مطمئن تولید میکند. این همان مکانیزم سطحی hallucination است: مدل دروغ نمیگوید، بلکه ادامهای محتملبهنظر در ناحیهای تولید میکند که در آن «بهنظر محتمل» و «درست» از هم جدا شدهاند.
پژوهشهای interpretability خود Anthropic نکتهی ظریفی اضافه میکنند: هرچند Claude در سطح خروجی توکن به توکن پیشبینی میکند، در داخل خود اغلب planning ahead انجام میدهد. در مقالهی Tracing the Thoughts of a Large Language Model، پژوهشگران نشان دادند که هنگام نوشتن شعر همقافیه، Claude ابتدا تصمیم میگیرد چه واژهای باید در پایان مصراع بیاید و سپس واژههای قبلتر را بهگونهای تولید میکند که به آن پایان منتهی شوند. پس «next token predictor» تنها رابط خروجی را توصیف میکند، نه کل محاسبهی درونی را.
پیام پداگوژیک: مدل را همچون یک «حدسزن بسیار خوب» در نظر بگیرید که از روی همهی متن قبلی، حدس میزند چه چیزی باید بعد بیاید. هرچه context شما بهتر باشد، حدس آن بهتر است. هرچه کار شما بیشتر در ناحیهی کماحتمال (رویدادهای جدید، حقایق کمسابقه، زنجیرههای استدلال نو) قرار بگیرد، باید با دقت بیشتری راستیآزمایی کنید.
مثال عملی
به Claude نیمهجملهی «پایتخت فرانسه ...» را بدهید — توکن بعدی تقریباً قطعی است. سپس بنویسید «پایتخت [نام یک کشور خیالی] ...» — توجه کنید مدل باز هم چیزی روان و موقر تولید میکند، چون شکل پاسخ بسیار محتمل است، حتی وقتی محتوای آن نمیتواند باشد. این تمرین، تفاوت بین «اطمینان لحن» و «درستی واقعی» را به شما نشان میدهد.
اشتباهات رایج
- «next token prediction چیزی فراتر از autocomplete نیست.» مکانیزم یکی است، اما در مقیاسی بهمراتب بزرگتر و با بازنماییهای درونی بسیار انتزاعیتر.
- «اگر مطمئن بهنظر میرسد، درست است.» اطمینانِ لحن هیچ ربطی به دقتِ واقعی ندارد؛ هر دو از یک مکانیزم میآیند.
- «مدل برنامهای ندارد، فقط بهسرعت چیزی میگوید.» planning درونی روی افق چندتوکنی مشاهده شده است.