[{"data":1,"prerenderedAt":221},["ShallowReactive",2],{"lesson:t4-s01-training-deep":3,"course:hamhoosh":59},{"meta":4,"prev":11,"next":17,"sections":21},{"free_preview":5,"order":6,"slug":7,"source":8,"term":9,"title_fa":10},true,1,"t4-s01-training-deep","book",4,"فصل ۰۱ — آموزش، عمیق‌تر (بدون ریاضی)",{"free_preview":12,"order":13,"slug":14,"source":8,"term":15,"title_fa":16},false,9,"t3-s09-workflow-project",3,"فصل ۰۹ — پروژه: یک جریانِ کاریِ واقعی",{"free_preview":12,"order":18,"slug":19,"source":8,"term":9,"title_fa":20},2,"t4-s02-embeddings","فصل ۰۲ — از توکن تا معنا: embedding",[22,26,29,34,37,40,43,46,49,52,56],{"kind":23,"heading":24,"html":25},"normal","در این فصل چه یاد می‌گیری","\u003Ch2 id=\"در-این-فصل-چه-یاد-می‌گیری\">در این فصل چه یاد می‌گیری\u003Ca class=\"head-anchor\" href=\"#%D8%AF%D8%B1-%D8%A7%DB%8C%D9%86-%D9%81%D8%B5%D9%84-%DA%86%D9%87-%DB%8C%D8%A7%D8%AF-%D9%85%DB%8C%E2%80%8C%DA%AF%DB%8C%D8%B1%DB%8C\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>در ترم ۱ یاد گرفتی مدل روی حجمِ عظیمی از متن «آموزش» می‌بیند و یاد می‌گیرد کلمهٔ بعدی را حدس بزند. آن حرف درست بود، ولی ساده‌شده. آموزش یک مرحله نیست؛ چند مرحله است و هر مرحله چیزِ متفاوتی به مدل می‌دهد. در این فصل، بدونِ یک خط ریاضی، می‌فهمی چطور یک ماشینِ خامِ متن‌کامل‌کن تبدیل به همان دستیارِ مؤدب و کمک‌کننده‌ای می‌شود که با آن حرف می‌زنی — و می‌فهمی همین مؤدب‌بودن یک روی پنهان دارد که باید مراقبش باشی. آخرش هم می‌فهمی چرا نه مقدارِ داده، که \u003Cstrong>کیفیتِ\u003C\u002Fstrong> داده سرنوشتِ مدل را تعیین می‌کند.\u003C\u002Fp>\n\u003Cp>\u003Cpicture>\u003Csource type=\"image\u002Fwebp\" srcset=\"\u002F_img\u002F01-image-three-stages.9bfeabc9a8.160.webp 160w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.320.webp 320w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.480.webp 480w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.640.webp 640w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.768.webp 768w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.960.webp 960w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.1280.webp 1280w\" sizes=\"(max-width: 900px) 100vw, 800px\">\u003Cimg src=\"\u002F_img\u002F01-image-three-stages.9bfeabc9a8.1280.jpg\" srcset=\"\u002F_img\u002F01-image-three-stages.9bfeabc9a8.160.jpg 160w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.320.jpg 320w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.480.jpg 480w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.640.jpg 640w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.768.jpg 768w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.960.jpg 960w, \u002F_img\u002F01-image-three-stages.9bfeabc9a8.1280.jpg 1280w\" sizes=\"(max-width: 900px) 100vw, 800px\" alt=\"یک برشِ آموزشی که یک موتورِ یادگیری را در سه اتاقِ پشتِ‌هم نشان می‌دهد: اتاقِ اولِ بزرگ که سیلی از کتاب و صفحه به آن می‌ریزد، اتاقِ کوچک‌ترِ کارآموزی با کارت‌های جفتِ سؤال-جواب، و ترازویی که دستی آن را به‌سمتِ جوابِ بهتر می‌چرخاند\" width=\"1376\" height=\"768\" loading=\"lazy\" decoding=\"async\">\u003C\u002Fpicture>\u003C\u002Fp>\n\u003Cp>آخر این فصل می‌توانی:\u003C\u002Fp>\n\u003Cul>\n\u003Cli>تفاوتِ \u003Ccode>pretraining\u003C\u002Fcode> و \u003Ccode>fine-tuning\u003C\u002Fcode> را به زبانِ ساده بگویی\u003C\u002Fli>\n\u003Cli>توضیح بدهی \u003Ccode>RLHF\u003C\u002Fcode> چیست و چرا مدل مؤدب و کمک‌کننده است\u003C\u002Fli>\n\u003Cli>بگویی چرا همین مؤدب‌بودن گاهی باعث می‌شود مدل مطمئن ولی غلط جواب بدهد\u003C\u002Fli>\n\u003Cli>توضیح بدهی چرا کیفیتِ داده، نه فقط مقدارش، همه‌چیز را تعیین می‌کند\u003C\u002Fli>\n\u003C\u002Ful>\n",{"kind":23,"heading":27,"html":28},"قبل از شروع","\u003Ch2 id=\"قبل-از-شروع\">قبل از شروع\u003Ca class=\"head-anchor\" href=\"#%D9%82%D8%A8%D9%84-%D8%A7%D8%B2-%D8%B4%D8%B1%D9%88%D8%B9\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cul>\n\u003Cli>\u003Cstrong>از فصل ۲ ترم ۱:\u003C\u002Fstrong> \u003Ccode>training\u003C\u002Fcode> یعنی مدل روی حجمِ عظیمی از متن تمرین می‌کند تا کلمهٔ بعدی را حدس بزند؛ آنچه می‌ماند «الگو»ست نه «حافظه».\u003C\u002Fli>\n\u003Cli>\u003Cstrong>از فصل ۴ ترم ۱:\u003C\u002Fstrong> مدل گاهی با اطمینانِ کامل چیزی می‌سازد که پایه‌ای در واقعیت ندارد (\u003Ccode>hallucination\u003C\u002Fcode>).\u003C\u002Fli>\n\u003Cli>\u003Cstrong>از فصل ۴ ترم ۲:\u003C\u002Fstrong> عادتِ وارسی — خروجی را با یک منبعِ مستقل بسنج، نه با خودِ مدل.\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>مثلِ همیشه فقط یک مرورگر و دستیارِ هوش مصنوعی‌ات (با کلیدِ رایگانِ خودت) لازم داری.\u003C\u002Fp>\n",{"kind":30,"heading":31,"html":32,"embed":33},"lab","","و همان گفت‌وگوهایی را که در این فصل می‌بینی امتحان کن — به‌ویژه آنجا که مدل زیرِ فشار عقب می‌کشد","\u002Flab\u002Fembed\u002Fhamhoosh\u002Fterm-4-under-the-hood\u002Fsession-01-training-deep",{"kind":23,"heading":35,"html":36},"۱. آموزش یک مرحله نیست","\u003Ch2 id=\"۱-آموزش-یک-مرحله-نیست\">۱. آموزش یک مرحله نیست\u003Ca class=\"head-anchor\" href=\"#%DB%B1-%D8%A2%D9%85%D9%88%D8%B2%D8%B4-%DB%8C%DA%A9-%D9%85%D8%B1%D8%AD%D9%84%D9%87-%D9%86%DB%8C%D8%B3%D8%AA\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>یک نفر را تصور کن که قرار است یک مشاورِ کاربلد و کمک‌کننده شود. این آدم در یک مرحله ساخته نمی‌شود. اول سال‌ها همه‌چیز می‌خواند تا کلی بداند. بعد یک دورهٔ کارآموزیِ متمرکز می‌بیند و یاد می‌گیرد چطور واقعاً به کسی که سؤال دارد کمک کند. و آخرش، سرِ کار، بازخوردِ آدم‌ها کم‌کم رفتار و ادبش را صیقل می‌دهد.\u003C\u002Fp>\n\u003Cp>مدل هم دقیقاً همین سه مرحله را دارد. آن «آموزش»ی که در ترم ۱ دیدی، در واقع فقط مرحلهٔ \u003Cstrong>اول\u003C\u002Fstrong> بود. حالا هر سه را باز می‌کنیم، چون تنها با دیدنِ هر سه می‌فهمی چرا مدل این‌طور که هست رفتار می‌کند.\u003C\u002Fp>\n",{"kind":23,"heading":38,"html":39},"۲. مرحلهٔ اول: pretraining — خواندنِ همه‌چیز","\u003Ch2 id=\"۲-مرحلهٔ-اول-pretraining-—-خواندنِ-همه‌چیز\">۲. مرحلهٔ اول: pretraining — خواندنِ همه‌چیز\u003Ca class=\"head-anchor\" href=\"#%DB%B2-%D9%85%D8%B1%D8%AD%D9%84%D9%87%D9%94-%D8%A7%D9%88%D9%84-pretraining-%E2%80%94-%D8%AE%D9%88%D8%A7%D9%86%D8%AF%D9%86%D9%90-%D9%87%D9%85%D9%87%E2%80%8C%DA%86%DB%8C%D8%B2\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>این همان مرحله‌ای است که در ترم ۱ دیدی. مدل حجمِ سرسام‌آوری از متن می‌بیند — و در مدل‌های امروز، متن و تصویر و صدا را از همان اول \u003Cstrong>با هم\u003C\u002Fstrong> — و میلیاردها بار تمرین می‌کند که حدس بزند بعدی چه می‌آید. آخرِ این مرحله یک مدل داری که کلی می‌داند و می‌تواند \u003Cstrong>ادامهٔ هر متنی\u003C\u002Fstrong> را بسازد. به این مرحلهٔ بزرگ و یک‌بارهٔ خواندن می‌گویند \u003Ccode>pretraining\u003C\u002Fcode>.\u003C\u002Fp>\n\u003Cp>ولی یک چیزِ عجیب: مدلی که تازه \u003Ccode>pretraining\u003C\u002Fcode> دیده هنوز یک دستیار \u003Cstrong>نیست\u003C\u002Fstrong>. فقط بلد است متن را \u003Cstrong>ادامه بدهد\u003C\u002Fstrong>. اگر یک سؤال بنویسی، ممکن است اصلاً جواب ندهد؛ ممکن است با چند سؤالِ دیگر ادامه‌اش بدهد، چون در آنچه خوانده، سؤال‌ها اغلب پشتِ سؤال‌های دیگر می‌آمدند (برگهٔ امتحان، فهرستِ تمرین). مثلاً می‌پرسی «پایتختِ فرانسه کجاست؟» و به‌جای «پاریس» می‌نویسد «پایتختِ آلمان کجاست؟ پایتختِ اسپانیا کجاست؟» — دارد یک برگهٔ سؤال را کامل می‌کند. این بدجنسی نیست؛ ادامه‌دادنِ الگو تنها کاری است که یاد گرفته. پس دانشِ تنها، یک دستیار نمی‌سازد.\u003C\u002Fp>\n\u003Cp>\u003Cstrong>قبل از ادامه، جواب بده:\u003C\u002Fstrong> اگر مدلی فقط \u003Ccode>pretraining\u003C\u002Fcode> دیده باشد و تو یک سؤالِ ساده بپرسی، چرا ممکن است به‌جای جواب، چند سؤالِ دیگر بنویسد؟\u003C\u002Fp>\n",{"kind":23,"heading":41,"html":42},"۳. مرحلهٔ دوم: fine-tuning — یاد گرفتنِ شغلِ دستیاری","\u003Ch2 id=\"۳-مرحلهٔ-دوم-fine-tuning-—-یاد-گرفتنِ-شغلِ-دستیاری\">۳. مرحلهٔ دوم: fine-tuning — یاد گرفتنِ شغلِ دستیاری\u003Ca class=\"head-anchor\" href=\"#%DB%B3-%D9%85%D8%B1%D8%AD%D9%84%D9%87%D9%94-%D8%AF%D9%88%D9%85-fine-tuning-%E2%80%94-%DB%8C%D8%A7%D8%AF-%DA%AF%D8%B1%D9%81%D8%AA%D9%86%D9%90-%D8%B4%D8%BA%D9%84%D9%90-%D8%AF%D8%B3%D8%AA%DB%8C%D8%A7%D8%B1%DB%8C\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>حالا همان مدلِ پُردانش ولی خام را برمی‌داری و \u003Cstrong>بیشتر\u003C\u002Fstrong> آموزشش می‌دهی، این‌بار روی مجموعهٔ خیلی کوچک‌تری از نمونه‌های با دقت انتخاب‌شده: یک سؤال کنارِ یک جوابِ خوب، یک درخواست کنارِ یک پاسخِ کمک‌کننده، بارها و بارها. این به مدل \u003Cstrong>شغلش\u003C\u002Fstrong> را یاد می‌دهد: وقتی کسی می‌پرسد، جواب بده؛ دستور را دنبال کن؛ به‌دردبخور باش. به این مرحله می‌گویند \u003Ccode>fine-tuning\u003C\u002Fcode>.\u003C\u002Fp>\n\u003Cp>دو نکتهٔ مهم: اول اینکه \u003Ccode>fine-tuning\u003C\u002Fcode> تقریباً دانشِ تازه‌ای اضافه نمی‌کند — دانش از \u003Ccode>pretraining\u003C\u002Fcode> آمده؛ این مرحله \u003Cstrong>رفتار\u003C\u002Fstrong> را شکل می‌دهد. دوم اینکه نمونه‌هایش کم‌اند ولی باکیفیت — یک دسته نمونهٔ عالی، رفتار را بیشتر از کوهی از متنِ معمولی عوض می‌کند. برگرد به همان تشبیه: آن آدم کلِ کتابخانه را در مرحلهٔ خواندن بلعیده بود؛ دورهٔ کارآموزی حقیقتِ تازه‌ای یادش نمی‌دهد، فقط یادش می‌دهد با آنچه می‌داند چطور کمک‌کننده باشد.\u003C\u002Fp>\n",{"kind":23,"heading":44,"html":45},"۴. مرحلهٔ سوم: RLHF — چرا مؤدب و کمک‌کننده است","\u003Ch2 id=\"۴-مرحلهٔ-سوم-rlhf-—-چرا-مؤدب-و-کمک‌کننده-است\">۴. مرحلهٔ سوم: RLHF — چرا مؤدب و کمک‌کننده است\u003Ca class=\"head-anchor\" href=\"#%DB%B4-%D9%85%D8%B1%D8%AD%D9%84%D9%87%D9%94-%D8%B3%D9%88%D9%85-rlhf-%E2%80%94-%DA%86%D8%B1%D8%A7-%D9%85%D8%A4%D8%AF%D8%A8-%D9%88-%DA%A9%D9%85%DA%A9%E2%80%8C%DA%A9%D9%86%D9%86%D8%AF%D9%87-%D8%A7%D8%B3%D8%AA\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>چرا دستیارت مؤدب است؟ چرا معمولاً از کمک به کارِ آسیب‌زننده سر باز می‌زند؟ چرا از بینِ دو جواب، روشن‌ترش را می‌دهد؟ جواب در مرحلهٔ سوم است. بعد از \u003Ccode>fine-tuning\u003C\u002Fcode>، مدل جواب تولید می‌کند و \u003Cstrong>آدم‌ها\u003C\u002Fstrong> آن‌ها را رتبه می‌دهند: از دو جواب به یک سؤال، کدام بهتر است — روشن‌تر، صادق‌تر، کمک‌کننده‌تر، کم‌آسیب‌تر؟ هزاران و هزاران بار از این ترجیح‌های انسانی، مدل را آرام‌آرام به‌سمتِ همان جوابی هل می‌دهند که آدم‌ها بیشتر پسندیدند. این مرحله — یاد گرفتن از بازخوردِ انسانی که کدام جواب «بهتر» است — همان \u003Ccode>RLHF\u003C\u002Fcode> است. اینجاست که مدل «ادب» پیدا می‌کند. بدونِ هیچ فرمولی: مثلِ مربی‌ای که مدتِ طولانی می‌گوید «این جواب، نه آن یکی»، تا حسِ کارآموز با آنچه مردم می‌خواستند یکی شود.\u003C\u002Fp>\n\u003Cp>حالا روی پنهانش — و این مستقیم به نخِ وارسیِ ما وصل است. \u003Ccode>RLHF\u003C\u002Fcode> مدل را طوری تربیت می‌کند که جوابی بدهد که مردم \u003Cstrong>دوست دارند\u003C\u002Fstrong>. و مردم جوابی را دوست دارند که مطمئن، موافق و همراه به‌نظر برسد. پس مدل به‌سمتِ مطمئن‌جلوه‌کردن — حتی وقتی نباید مطمئن باشد — و به‌سمتِ \u003Cstrong>موافقت با تو\u003C\u002Fstrong> متمایل می‌شود. بگذار خرابی‌اش را ببینی. یک چیزِ متوسط بنویس، بگو مالِ خودت است، و صادقانه نظر بخواه:\u003C\u002Fp>\n\u003Cpre class=\"code-block\" dir=\"ltr\">\u003Ccode>این شعر را خودم نوشته‌ام. صادقانه نظرت را بگو:\n\nدرختِ سبز کنارِ خانه\nسبز است و بزرگ است\nپرنده رویش می‌نشیند\nو من نگاهش می‌کنم\nخیلی قشنگ است\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>تقریباً همیشه چیزی شبیهِ این می‌گیری (خروجیِ تو ممکن است فرق کند):\u003C\u002Fp>\n\u003Cpre class=\"code-block\" dir=\"ltr\">\u003Ccode>شعری که نوشتید بسیار زیبا و دلنشین است. حسِ سادگی و آرامش در آن موج می‌زند.\nسادگی و بی‌آلایشی نقطهٔ قوتِ شماست، تصویرسازی‌تان واضح است و پایان‌بندی‌اش\nاحساسی و از دل برآمده است. آفرین که شعر می‌نویسید!\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>حالا خودت داور باش: این متن واقعاً «بسیار زیبا» است، یا چند جملهٔ ساده که «سبز است و بزرگ است» و «خیلی قشنگ است» را کنارِ هم گذاشته؟ مدل تعریف کرد، نه چون شعر خوب بود، بلکه چون تو گفتی \u003Cstrong>مالِ خودت\u003C\u002Fstrong> است — و \u003Ccode>RLHF\u003C\u002Fcode> یادش داده که تعریف‌کردن از کارِ آدم‌ها همان چیزی است که مردم پاداشش می‌دهند. این همان «موافقتِ آموخته‌شده» است: مدل به‌سمتِ چیزی خم می‌شود که تو دوست داری بشنوی، نه چیزی که هست.\u003C\u002Fp>\n\u003Cp>یک آزمایشِ تکمیلی که پرده را کامل کنار می‌زند: همان متن را در یک گفت‌وگوی \u003Cstrong>تازه\u003C\u002Fstrong> بفرست، ولی این‌بار بنویس «این را یک نفرِ دیگر نوشته و من باید نقدش کنم؛ ضعف‌هایش را بگو». معمولاً همان متن، این‌بار نقدِ به‌مراتب تیزتری می‌گیرد. \u003Cstrong>متن عوض نشد؛ فقط اینکه مالِ کیست عوض شد.\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Cblockquote>\n\u003Cp>✅ \u003Cstrong>وارسی:\u003C\u002Fstrong> دقیقاً به همین دلیل است که \u003Cstrong>مدل مطمئن است؛ دلیل نمی‌شود درست باشد\u003C\u002Fstrong> — هم لحنِ مطمئنش و هم همراهی‌اش با تو از \u003Ccode>RLHF\u003C\u002Fcode> می‌آیند، نه از داوریِ بی‌طرف. سه قانونِ ثابتِ این دوره: \u003Cstrong>«اول خودت فکر کن» — «وارسی کن، خط به خط» — «مدل مطمئن است؛ دلیل نمی‌شود درست باشد».\u003C\u002Fstrong> وقتی نظرِ صادقانه می‌خواهی، مالکیتِ کار را نگو، یا صریح بخواه که فقط ضعف‌ها را بنویسد.\u003C\u002Fp>\n\u003C\u002Fblockquote>\n\u003Cblockquote>\n\u003Cp>💡 \u003Cstrong>نکته:\u003C\u002Fstrong> یک نسخهٔ قدیمی‌ترِ همین آزمایش این بود: از مدل یک واقعیتِ ساده بپرس (مثلاً خورشید از کدام سمت طلوع می‌کند)، جوابِ درست بگیر، و بعد با اطمینان خلافش را بگو. سال‌ها مدل‌ها عقب می‌کشیدند و می‌گفتند «حق با شماست». امروز روی واقعیت‌های محکم معمولاً \u003Cstrong>دیگر عقب نمی‌کشند\u003C\u002Fstrong> — سرِ حرفشان می‌مانند و حتی توضیح می‌دهند چرا اشتباه می‌کنی. حتماً خودت هم امتحانش کن؛ اگر مدلت سرِ حرفش ماند، یک پیشرفتِ واقعی را به چشم دیده‌ای. ولی نتیجه نگیر که موافقتِ آموخته‌شده تمام شده: فقط از حوزهٔ \u003Cstrong>واقعیتِ محکم\u003C\u002Fstrong> عقب‌نشینی کرده و به حوزهٔ \u003Cstrong>قضاوت و سلیقه\u003C\u002Fstrong> رفته — همان‌جا که هیچ جوابِ درستِ قاطعی نیست و مدل راحت‌تر به‌سمتِ تو خم می‌شود. و متأسفانه بیشترِ سؤال‌های واقعیِ زندگی از همان جنسِ دوم‌اند.\u003C\u002Fp>\n\u003C\u002Fblockquote>\n\u003Cp>\u003Cstrong>قبل از ادامه، جواب بده:\u003C\u002Fstrong> اگر مدل کارِ تو را تعریف کرد، این نشانهٔ چیست — اینکه کارت خوب است، یا اینکه مدل طوری تربیت شده که همراه باشد؟ چطور می‌توانی این دو را از هم جدا کنی؟\u003C\u002Fp>\n",{"kind":23,"heading":47,"html":48},"۵. چرا کیفیتِ داده همه‌چیز است","\u003Ch2 id=\"۵-چرا-کیفیتِ-داده-همه‌چیز-است\">۵. چرا کیفیتِ داده همه‌چیز است\u003Ca class=\"head-anchor\" href=\"#%DB%B5-%DA%86%D8%B1%D8%A7-%DA%A9%DB%8C%D9%81%DB%8C%D8%AA%D9%90-%D8%AF%D8%A7%D8%AF%D9%87-%D9%87%D9%85%D9%87%E2%80%8C%DA%86%DB%8C%D8%B2-%D8%A7%D8%B3%D8%AA\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>در ترم ۱ فهمیدی مدل فقط به‌اندازهٔ داده‌هایش خوب است. حالا در هر سه مرحله تیزترش کن: مسئله فقط \u003Cstrong>چقدر\u003C\u002Fstrong> داده نیست، \u003Cstrong>چه‌جور\u003C\u002Fstrong> داده است.\u003C\u002Fp>\n\u003Cp>در \u003Ccode>pretraining\u003C\u002Fcode>، اگر متنی پر از یک افسانهٔ پرتکرار باشد، مدل همان افسانه را به‌عنوان یک الگو یاد می‌گیرد — چون فرقِ درست و غلط را نمی‌فهمد، فقط \u003Cstrong>تکرار\u003C\u002Fstrong> را می‌بیند. در \u003Ccode>fine-tuning\u003C\u002Fcode> و \u003Ccode>RLHF\u003C\u002Fcode>، یک دستهٔ کوچکِ نمونه‌های دقیق رفتار را خیلی بیشتر از سیلی متنِ معمولی شکل می‌دهد — پس هر کسی که آن نمونه‌ها را انتخاب می‌کند و آدم‌هایی که بازخورد می‌دهند، بی‌سروصدا ارزش‌ها، لحن و نقاطِ کورِ مدل را می‌سازند. سوگیری در داده، یعنی سوگیری در مدل. کیفیتِ داده کلِ بازی است.\u003C\u002Fp>\n\u003Cblockquote>\n\u003Cp>⚠️ \u003Cstrong>مواظب باش:\u003C\u002Fstrong> دادهٔ مدل فقط «اینترنت» نیست — ردهٔ رایگان ممکن است پرامپت و پاسخِ \u003Cstrong>تو\u003C\u002Fstrong> را هم به دادهٔ آموزشیِ آینده اضافه کند. پس چیزی خصوصی به ردهٔ رایگان نده؛ یادت باشد دادهٔ تو می‌تواند دادهٔ آموزشیِ یک مدل شود.\u003C\u002Fp>\n\u003C\u002Fblockquote>\n",{"kind":23,"heading":50,"html":51},"واژه‌های تازهٔ این فصل","\u003Ch2 id=\"واژه‌های-تازهٔ-این-فصل\">واژه‌های تازهٔ این فصل\u003Ca class=\"head-anchor\" href=\"#%D9%88%D8%A7%DA%98%D9%87%E2%80%8C%D9%87%D8%A7%DB%8C-%D8%AA%D8%A7%D8%B2%D9%87%D9%94-%D8%A7%DB%8C%D9%86-%D9%81%D8%B5%D9%84\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cdiv class=\"table-wrap\">\u003Ctable>\u003Cthead>\n\u003Ctr>\n\u003Cth>کلمه\u003C\u002Fth>\n\u003Cth>تلفظ به حروف فارسی\u003C\u002Fth>\n\u003Cth>یعنی چه\u003C\u002Fth>\n\u003C\u002Ftr>\n\u003C\u002Fthead>\n\u003Ctbody>\n\u003Ctr>\n\u003Ctd>pretraining\u003C\u002Ftd>\n\u003Ctd>پری‌تِرِینینگ\u003C\u002Ftd>\n\u003Ctd>مرحلهٔ اول و بزرگِ آموزش؛ مدل روی حجمِ عظیمی از داده تمرین می‌کند تا ادامهٔ هر متن را حدس بزند\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>fine-tuning\u003C\u002Ftd>\n\u003Ctd>فاین‌تیونینگ\u003C\u002Ftd>\n\u003Ctd>مرحلهٔ دومِ آموزش روی نمونه‌های کم ولی باکیفیت که «شغلِ دستیاری» را به مدل یاد می‌دهد\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>RLHF\u003C\u002Ftd>\n\u003Ctd>آر‌اِل‌اِیچ‌اف\u003C\u002Ftd>\n\u003Ctd>آموزش از بازخوردِ انسانی؛ آدم‌ها جواب‌ها را رتبه می‌دهند و مدل به‌سمتِ جوابِ محبوب‌تر هل داده می‌شود\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\n\u003C\u002Ftable>\u003C\u002Fdiv>",{"kind":53,"heading":54,"html":55},"checkpoint","تمرین‌ها","\u003Ch2 id=\"تمرین‌ها\">تمرین‌ها\u003Ca class=\"head-anchor\" href=\"#%D8%AA%D9%85%D8%B1%DB%8C%D9%86%E2%80%8C%D9%87%D8%A7\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>\u003Cstrong>تمرین اجباری:\u003C\u002Fstrong> یک متنِ کوتاهِ متوسط (یک پاراگراف یا چند خط شعر) بردار و دو بار نظر بخواه: بارِ اول بگو «خودم نوشته‌ام»، بارِ دوم در یک گفت‌وگوی تازه بگو «کسِ دیگری نوشته و باید نقدش کنم». دو جواب را کنارِ هم بگذار و در یک جمله بنویس: چه چیزی عوض شد، در حالی که متن عوض نشده بود؟ (اگر خواستی، نسخهٔ قدیمیِ آزمایش را هم امتحان کن: یک واقعیتِ ساده بپرس و بعد با اطمینان خلافش را بگو — ببین عقب می‌کشد یا سرِ حرفش می‌ماند، و نتیجه را یادداشت کن.)\u003C\u002Fp>\n\u003Cp>\u003Cstrong>تمرین ستاره‌دار ⭐:\u003C\u002Fstrong> از مدل بخواه به زبانِ ساده فرقِ \u003Ccode>pretraining\u003C\u002Fcode> و \u003Ccode>fine-tuning\u003C\u002Fcode> را توضیح بدهد. جوابش را با این فصل مقابله کن و یک جا پیدا کن که مبهم‌تر یا کمی نادرست گفته، و خودت درستش کن. این خودش یک تمرینِ وارسی است: مدل دربارهٔ خودش هم می‌تواند لغزنده باشد.\u003C\u002Fp>\n",{"kind":23,"heading":57,"html":58},"در فصل بعد","\u003Ch2 id=\"در-فصل-بعد\">در فصل بعد\u003Ca class=\"head-anchor\" href=\"#%D8%AF%D8%B1-%D9%81%D8%B5%D9%84-%D8%A8%D8%B9%D8%AF\" aria-label=\"پیوند به این بخش\">#\u003C\u002Fa>\u003C\u002Fh2>\n\u003Cp>فهمیدی مدل چطور آموزش می‌بیند و کلمهٔ بعدی را حدس می‌زند. ولی «کلمه» چطور به \u003Cstrong>معنا\u003C\u002Fstrong> تبدیل می‌شود؟ فصلِ بعد سراغِ \u003Ccode>embedding\u003C\u002Fcode> می‌رویم: می‌بینی مدل هر \u003Ccode>token\u003C\u002Fcode> را به یک \u003Cstrong>جا روی یک نقشهٔ معنا\u003C\u002Fstrong> نسبت می‌دهد، جایی که «نزدیکی» یعنی «شباهتِ معنا» — و همین است که توضیح می‌دهد چطور می‌فهمد «خودرو» و «ماشین» تقریباً یک چیزند.\u003C\u002Fp>\n",{"course":60,"entitled":12,"lessons":68,"payments_enabled":12,"terms":220,"live":5},{"active_window":61,"effective_price_toman":62,"free":5,"lesson_count":63,"price_toman":64,"slug":65,"summary_fa":66,"title_fa":67},null,0,51,2500000,"hamhoosh","از «هوش مصنوعی واقعاً چیست» تا ساختن ابزار واقعی با آن — بدون دیوار ریاضی و بدون پیش‌نیاز برنامه‌نویسی. هوش مصنوعی همکارِ هوشمندی است که وارسی‌اش می‌کنی، نه اوراکلی که چشم‌بسته باور کنی.","هم‌هوش — خودآموز هوش مصنوعی",[69,72,75,78,81,85,89,93,97,100,103,106,109,112,115,118,121,124,127,130,133,136,139,142,145,148,149,150,151,154,157,160,163,166,169,172,175,178,181,184,187,190,193,196,199,202,205,208,211,214,217],{"free_preview":5,"order":6,"slug":70,"source":8,"term":6,"title_fa":71},"t1-s01-first-conversation","فصل ۰۱ — با چه چیزی حرف می‌زنی؟ اولین گفت‌وگو",{"free_preview":5,"order":18,"slug":73,"source":8,"term":6,"title_fa":74},"t1-s02-how-it-learns","فصل ۰۲ — چطور یاد گرفت",{"free_preview":5,"order":15,"slug":76,"source":8,"term":6,"title_fa":77},"t1-s03-tokens","فصل ۰۳ — توکن: واحدِ کارِ مدل",{"free_preview":5,"order":9,"slug":79,"source":8,"term":6,"title_fa":80},"t1-s04-hallucination","فصل ۰۴ — چرا مطمئن ولی غلط: توهم",{"free_preview":5,"order":82,"slug":83,"source":8,"term":6,"title_fa":84},5,"t1-s05-limits","فصل ۰۵ — مرزها: چه نمی‌داند و چه نباید ازش خواست",{"free_preview":5,"order":86,"slug":87,"source":8,"term":6,"title_fa":88},6,"t1-s06-types","فصل ۰۶ — گونه‌های هوش مصنوعی",{"free_preview":5,"order":90,"slug":91,"source":8,"term":6,"title_fa":92},7,"t1-s07-responsible-start","فصل ۰۷ — از همین حالا مسئولانه",{"free_preview":5,"order":94,"slug":95,"source":8,"term":6,"title_fa":96},8,"t1-s08-interrogate-project","فصل ۰۸ — پروژه: یک مدل را بازجویی کن",{"free_preview":5,"order":6,"slug":98,"source":8,"term":18,"title_fa":99},"t2-s01-intent","فصل ۰۱ — نیت، نه جادو",{"free_preview":5,"order":18,"slug":101,"source":8,"term":18,"title_fa":102},"t2-s02-context","فصل ۰۲ — زمینه‌دادن",{"free_preview":5,"order":15,"slug":104,"source":8,"term":18,"title_fa":105},"t2-s03-iterate","فصل ۰۳ — حلقهٔ تکرار",{"free_preview":5,"order":9,"slug":107,"source":8,"term":18,"title_fa":108},"t2-s04-verify","فصل ۰۴ — وارسی: مهم‌ترین مهارت",{"free_preview":5,"order":82,"slug":110,"source":8,"term":18,"title_fa":111},"t2-s05-system","فصل ۰۵ — لحنِ ثابت و دستورِ سیستمی",{"free_preview":5,"order":86,"slug":113,"source":8,"term":18,"title_fa":114},"t2-s06-tune","فصل ۰۶ — کنترلِ خلاقیت، دقت و عمق",{"free_preview":5,"order":90,"slug":116,"source":8,"term":18,"title_fa":117},"t2-s07-structured","فصل ۰۷ — پرامپتِ ساختارمند و قابلِ‌استفادهٔ مجدد",{"free_preview":5,"order":94,"slug":119,"source":8,"term":18,"title_fa":120},"t2-s08-antipatterns","فصل ۰۸ — دام‌ها و افسانه‌ها",{"free_preview":5,"order":13,"slug":122,"source":8,"term":18,"title_fa":123},"t2-s09-assistant-project","فصل ۰۹ — پروژه: یک دستیارِ شخصی بساز",{"free_preview":5,"order":6,"slug":125,"source":8,"term":15,"title_fa":126},"t3-s01-images","فصل ۰۱ — ساختِ تصویر با هوش مصنوعی",{"free_preview":12,"order":18,"slug":128,"source":8,"term":15,"title_fa":129},"t3-s02-image-understanding","فصل ۰۲ — فهمِ تصویر",{"free_preview":12,"order":15,"slug":131,"source":8,"term":15,"title_fa":132},"t3-s03-audio-video","فصل ۰۳ — صدا و ویدیو",{"free_preview":12,"order":9,"slug":134,"source":8,"term":15,"title_fa":135},"t3-s04-research","فصل ۰۴ — پژوهش با هوش مصنوعی",{"free_preview":12,"order":82,"slug":137,"source":8,"term":15,"title_fa":138},"t3-s05-writing","فصل ۰۵ — نوشتن و بازنویسی",{"free_preview":12,"order":86,"slug":140,"source":8,"term":15,"title_fa":141},"t3-s06-study","فصل ۰۶ — یادگیری و درس‌خواندن",{"free_preview":12,"order":90,"slug":143,"source":8,"term":15,"title_fa":144},"t3-s07-work","فصل ۰۷ — کارِ حرفه‌ای",{"free_preview":12,"order":94,"slug":146,"source":8,"term":15,"title_fa":147},"t3-s08-coding-help","فصل ۰۸ — کمکِ کدنویسی (بی‌آنکه برنامه‌نویس باشی)",{"free_preview":12,"order":13,"slug":14,"source":8,"term":15,"title_fa":16},{"free_preview":5,"order":6,"slug":7,"source":8,"term":9,"title_fa":10},{"free_preview":12,"order":18,"slug":19,"source":8,"term":9,"title_fa":20},{"free_preview":12,"order":15,"slug":152,"source":8,"term":9,"title_fa":153},"t4-s03-context-memory","فصل ۰۳ — حافظه و پنجرهٔ زمینه",{"free_preview":12,"order":9,"slug":155,"source":8,"term":9,"title_fa":156},"t4-s04-rag","فصل ۰۴ — RAG: دادنِ دانشِ تازه به مدل",{"free_preview":12,"order":82,"slug":158,"source":8,"term":9,"title_fa":159},"t4-s05-agents","فصل ۰۵ — عامل‌ها و ابزارها",{"free_preview":12,"order":86,"slug":161,"source":8,"term":9,"title_fa":162},"t4-s06-local-vs-cloud","فصل ۰۶ — مدلِ محلی در برابر ابری",{"free_preview":12,"order":90,"slug":164,"source":8,"term":9,"title_fa":165},"t4-s07-persian-gap","فصل ۰۷ — شکافِ فارسی-انگلیسی",{"free_preview":12,"order":94,"slug":167,"source":8,"term":9,"title_fa":168},"t4-s08-mental-model-project","فصل ۰۸ — پروژه: نقشهٔ ذهنیِ یک پاسخ",{"free_preview":5,"order":6,"slug":170,"source":8,"term":82,"title_fa":171},"t5-s01-api-idea","فصل ۰۱ — API چیست: حرف‌زدنِ برنامه با مدل",{"free_preview":12,"order":18,"slug":173,"source":8,"term":82,"title_fa":174},"t5-s02-first-call","فصل ۰۲ — اولین فراخوانی",{"free_preview":12,"order":15,"slug":176,"source":8,"term":82,"title_fa":177},"t5-s03-from-js","فصل ۰۳ — از JavaScript صدا بزن",{"free_preview":12,"order":9,"slug":179,"source":8,"term":82,"title_fa":180},"t5-s04-system-in-code","فصل ۰۴ — نقش و پارامتر در کد",{"free_preview":12,"order":82,"slug":182,"source":8,"term":82,"title_fa":183},"t5-s05-structured-output","فصل ۰۵ — خروجیِ ساختارمند",{"free_preview":12,"order":86,"slug":185,"source":8,"term":82,"title_fa":186},"t5-s06-build-app","فصل ۰۶ — یک وب‌اپِ کوچکِ هوش‌مصنوعی‌دار",{"free_preview":12,"order":90,"slug":188,"source":8,"term":82,"title_fa":189},"t5-s07-cost-limits","فصل ۰۷ — هزینه، سهمیه و مرزها",{"free_preview":12,"order":94,"slug":191,"source":8,"term":82,"title_fa":192},"t5-s08-ship-project","فصل ۰۸ — پروژه: ابزارِ هوش‌مصنوعیِ خودت را منتشر کن",{"free_preview":5,"order":6,"slug":194,"source":8,"term":86,"title_fa":195},"t6-s01-deepfakes","فصل ۰۱ — دیپ‌فیک و رسانهٔ جعلی",{"free_preview":12,"order":18,"slug":197,"source":8,"term":86,"title_fa":198},"t6-s02-misinformation","فصل ۰۲ — دفاع در برابر بدْاطلاعات",{"free_preview":12,"order":15,"slug":200,"source":8,"term":86,"title_fa":201},"t6-s03-detection-myth","فصل ۰۳ — افسانهٔ «تشخیصِ هوش مصنوعی»",{"free_preview":12,"order":9,"slug":203,"source":8,"term":86,"title_fa":204},"t6-s04-bias","فصل ۰۴ — سوگیری و انصاف",{"free_preview":12,"order":82,"slug":206,"source":8,"term":86,"title_fa":207},"t6-s05-privacy-data","فصل ۰۵ — حریم خصوصی و دادهٔ تو",{"free_preview":12,"order":86,"slug":209,"source":8,"term":86,"title_fa":210},"t6-s06-ownership","فصل ۰۶ — مالکیت و کپی‌رایتِ خروجی",{"free_preview":12,"order":90,"slug":212,"source":8,"term":86,"title_fa":213},"t6-s07-work-future","فصل ۰۷ — کار، مهارت و مرزهای سالم",{"free_preview":12,"order":94,"slug":215,"source":8,"term":86,"title_fa":216},"t6-s08-safety-ethics","فصل ۰۸ — ایمنی و اخلاق، بدونِ موعظه",{"free_preview":12,"order":13,"slug":218,"source":8,"term":86,"title_fa":219},"t6-s09-capstone","فصل ۰۹ — پروژهٔ نهایی: چیزی مسئولانه بساز و منتشر کن",[],1784990546290]