• لازم به ذکر هست کلیه مطالب قرار داده شده در تالار ( اخبار و حقوق) و چه در مواردی که در تالار (دانلود نرم افزار های کامپیوتر) از دیگر منابع بوده و کاربران یک رمان جهت راحتی دیگر افراد موجود در انجمن اقدام به قرار دادن اخبار و نرم افزار نموده اند و اگر شما صاحب امتیاز این نرم افزار هستید کافی هست با ما تماس بگیرید

هوش مصنوعی چطور کار می‌کند؟ طرز کار مدل‌های زبانی بزرگ به زبان ساده

  • نویسنده موضوع نویسنده موضوع MOON ୨ৎ
  • تاریخ شروع تاریخ شروع
  • پاسخ‌ها پاسخ‌ها 19
  • بازدیدها بازدیدها 20
  • کاربران تگ شده هیچ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #11
مکانیزم پیش‌خور

پس از اینکه سرهای توجه اطلاعات را بین بردارهای کلمه منتقل کردند، شبکه‌ی پیش‌خور (Feed-Forward) درمورد هر بردار کلمه «فکر می‌کند» و سعی می‌کند کلمه‌ی بعدی را پیش‌بینی کند. در این مرحله، هیچ اطلاعاتی بین کلمات ردوبدل نمی‌شود و لایه‌ی پیش‌خور هر کلمه را به‌صورت مجزا تجزیه‌وتحلیل می‌کند. بااین‌حال، این لایه به‌تمامی اطلاعاتی که قبلاً توسط یک سر توجه کپی شده، دسترسی دارد.

تصویر زیر، ساختار لایه پیش‌خور را در بزرگترین نسخه GPT-3 نشان می‌دهد:

1775993348893.webp

طرز کار لایه پیشخور در بزرگترین نسخه GPT-3
نورون‌ها که در تصویر با دایره‌های سبز و بنفش نمایش داده شده‌اند، در واقع توابع ریاضی هستند که مجموع وزنی ورودی لایه‌ها را محاسبه...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #12
در مرحله پیشخور هیچ اطلاعاتی بین کلمات ردوبدل نمی‌شود و هر کلمه به‌صورت مجزا تجزیه‌و تحلیل می‌شود

چیزی که لایه پیش‌خور یا فید فوروارد را قدرتمند می‌کند، تعداد زیاد اتصالات آن است. ما برای ساده‌سازی این شبکه را با سه نورون در لایه خروجی و شش نورون در لایه پنهان ترسیم کرده‌ایم. مدل GPT-3 شامل ۱۲,۲۸۸ نورون در لایه خروجی (مطابق با تعداد بردارهای کلماتی) و ۴۹,۱۵۲ نورون در لایه پنهان است.

پس در لایه‌ی پنهان، ۴۹,۱۵۲ نورون با ۱۲,۲۸۸ ورودی (و طبیعتا ۱۲,۲۸۸ پارامتر وزنی) وجود دارد. همچنین ۱۲,۲۸۸ نورون خروجی با ۴۹,۱۵۲ مقدار ورودی (و ۴۹,۱۵۲ پارامتر وزنی) برای هر نورون وجود دارد. بنابراین هر لایه پیش‌خور دارای ۱٫۲ میلیارد پارامتر وزنی خواهد بود:

۱۲,۲۸۸ x ۴۹,۱۵۲ + ۴۹,۱۵۲ x ۱۲,۲۸۸ = ۱٫۲...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #13
شبکه‌های پیش‌خور با بردارهای ریاضیاتی استدلال می‌کنند

تحقیقات اخیر دانشگاه براون، مثال جالبی از نحوه‌ی کمک لایه‌های پیش‌خور به پیش‌بینی کلمات بعدی ارائه می‌کند. در بخش‌های قبل به تحقیق word2vec گوگل اشاره کردیم که برای استدلال قیاسی از محاسبات برداری استفاده می‌کرد. مثلاً با محاسبه‌ی نسبت برلین به آلمان، پاریس را به فرانسه نسبت می‌داد. به نظر می‌رسد که لایه‌های فید فوروارد دقیقاً از همین روش برای پیش‌بینی کلمه‌ی بعدی استفاده می‌کنند. محققان سؤالی را از یک مدل ۲۴ لایه‌ای GPT-2 پرسیدند و سپس عملکرد لایه‌ها را مورد مطالعه قرار دادند.

سوال: پایتخت فرانسه کجا است؟ جواب: پاریس. سوال: پایتخت لهستان کجا است؟ جواب:؟

در ۱۵ لایه‌ی اول، بهترین حدس مدل زبانی، واژه‌ای تصادفی بود. بین...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #14
لایه‌های توجه و پیش‌خور وظایف مختلفی دارند

تا اینجا ما دو نمونه‌ی واقعی از پیش‌بینی کلمات توسط GPT-2 را بررسی کرده‌ایم: تکمیل جمله‌ی جان به مری نوشیدنی داد، به کمک سرهای توجه و نقش لایه‌ی پیش‌خور در اینکه ورشو پایتخت لهستان است.

در مثال اول، واژه‌ی مری از پرامپت یا دستور متنی ارائه شده توسط کاربر استخراج می‌شد، اما در مثال دوم واژه‌ی ورشو در دستور متنی نیامده بود. مدل زبانی باید این واقعیت را «به یاد می‌آورد» که ورشو پایتخت لهستان است، یعنی از اطلاعاتی که از داده‌های آموزشی به دست آورده بود.

زمانی‌که محققان دانشگاه براون لایه‌ی پیش‌خوری که ورشو را به لهستان متصل می‌کرد، غیرفعال کردند، دیگر مدل زبانی واژه ورشو را به‌عنوان کلمه‌ی بعدی پیش‌بینی نمی‌کرد. اما وقتی جمله‌ی «ورشو...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #15
مکانیزم «توجه» با کپی کردن کلمات از دستور متنی پیش می‌رود، اما مکانیزم پیشخور اطلاعاتی را که در دستور متنی نیست به یاد می‌آورد

ما می‌توانیم لایه‌های پیش‌خور را به‌عنوان پایگاه داده‌ای تصور کنیم که اطلاعات موجود در آن، از داده‌های آموزشی قبلی مدل زبانی جمع‌آوری شده است. به‌احتمال‌زیاد لایه‌های ابتدایی پیش‌خور حقایق ساده‌ی مرتبط با کلمات خاص را رمزگذاری می‌کنند، مثلا «جابز بعد از استیو می‌آید» و لایه‌های بالاتر روابط پیچیده‌تری را مدیریت می‌کنند؛ مانند اضافه‌کردن یک بردار برای تبدیل یک کشور به پایتخت آن.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #16
نحوه آموزش مدل‌های زبانی

بسیاری از الگوریتم‌های اولیه‌ی یادگیری ماشین به نمونه‌های آموزشی با برچسب‌گذاری انسانی نیاز داشتند. برای مثال داده‌های آموزشی می‌توانست عکس‌هایی از سگ‌ یا گربه‌ با برچسب‌های «سگ» و «گربه» برای هر عکس باشد. یکی از دلایلی که ایجاد مجموعه‌های داده‌های بزرگ برای آموزش الگوریتم‌های قدرتمند را پرهزینه و دشوار می‌کرد، همین نیاز به برچسب‌گذاری داده‌ها توسط نیروی انسانی بود.

یکی از نوآوری‌های کلیدی LLMها این است که به داده‌های مشخصا برچسب‌گذاری شده نیاز ندارند. آن‌ها با تلاش برای پیش‌بینی کلمه‌ی بعد آموزش می‌بینند یا به اصطلاح، «ترین» (train) می‌شوند. تقریباً هر مطلب نوشتاری، از صفحات ویکی‌پدیا گرفته تا مقاله‌های خبری و کدهای رایانه‌ای، برای آموزش این مدل‌ها...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #17
جادوی LLM در این است که به داده‌های برچسب‌گذاری شده نیاز ندارد

برای درک بهتر این موضوع، تصور کنید می‌خواهید با آب ولرم دوش بگیرید. شما قبلاً با این شیر آب کار نکرده‌اید و علامتی هم روی آن مشاهده نمی‌کنید. پس دستگیره را به طور تصادفی به یک سمت می‌چرخانید و دما را احساس می‌کنید. اگر آب خیلی داغ بود، آن را به یک طرف و اگر آب خیلی سرد بود آن را به‌طرف دیگر می‌چرخانید. هرچه به دمای مناسب نزدیک‌تر شوید، تغییرات کوچک‌تری می‌دهید.

حالا بیایید چند تغییر در این مثال به‌وجود آوریم. ابتدا تصور کنید که به جای یک شیر، ۵۰,۲۵۷ شیر آب وجود دارد. هر شیر آب به کلمه‌ی متفاوتی نظیر «خامه»، «قهوه» یا «شکر» مربوط می‌شود و هدف شما این است که آب به طور متوالی از سردوش‌های مرتبط با کلمات بعدی خارج شود...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #18
عملکرد شگفت‌انگیز مدل‌های زبانی بزرگ

شاید برای شما سوال باشد که چطور فرایند آموزش‌ مدل‌های هوش مصنوعی با وجود محاسبات بی‌شمار تا این حد خوب کار می‌کند. این روزها هوش مصنوعی مولد کارهای مختلفی را برای ما انجام می‌دهد، مانند نوشتن مقاله، تولید عکس یا کدنویسی. چگونه این مکانیزم یادگیری می‌تواند چنین مدل‌های قدرتمندی خلق کند؟

یکی از مهم‌ترین دلایل این امر گستره‌ی داده‌های آموزشی است. ما به‌سختی می‌توانیم تعداد نمونه‌ها یا نرخ داده‌هایی را که مدل‌های زبانی بزرگ به‌عنوان ورودی آموزشی دریافت می‌کنند، در ذهنمان تجسم کنیم. دو سال پیش GPT-3 روی مجموعه‌ای شامل ۵۰۰ میلیارد کلمه آموزش داده شد. در ذهن داشته باشید که کودکان تا سن ۱۰ سالگی تقریباً با ۱۰۰ میلیون کلمه مواجه می‌شوند.

در طول شش...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #19
آخرین نسخه GPT-3 در مواجهه با مسائل «تئوری ذهن» مثل یک کودک ۷ ساله عمل می‌کرد

مایکل کوسینسکی روانشناس استنفورد سال گذشته تحقیقی را منتشر کرد که در آن توانایی مدل‌های زبانی مختلف را در حل مسائلی با محوریت نظریه ذهن مورد بررسی قرار داده بود. او متن‌هایی مانند داستان بالا را به LLMها داده بود و از آن‌ها خواسته بود جمله‌ی «او فکر می‌کند کیسه پر از ... است» را کامل کنند. ما می‌دانیم پاسخ صحیح شکلات است، ولی احتمال دارد مدل‌های زبانی ساده‌تر جمله را با «پاپ‌کورن» کامل کنند.

مدل‌های زبانی GPT-1 و GPT-2 در این آزمایش شکست خوردند، اما نخستین نسخه‌ی GPT-3 چهل درصد از سؤال‌ها را به‌درستی پاسخ داده بود. آخرین نسخه‌ی GPT-3 این نرخ را به ۹۰ درصد ارتقا داد، یعنی مثل یک کودک ۷ ساله. GPT-4 حدود...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ

MOON ୨ৎ

پرسنل مدیریت
سرپرست دانشکده
سطح
27
 
تاریخ ثبت‌نام
11/1/23
ارسالی‌ها
7,272
پسندها
19,406
امتیازها
69,773
مدال‌ها
33
  • نویسنده موضوع
  • مدیر
  • #20
مدل‌های زبانی با درک روابط بین کلمات، مسائلی را نیز در مورد روابط موجود در جهان هستی یاد می‌گیرند

یکی دیگر از دلایل احتمالی که باعث می‌شود آموزش با روش پیش‌بینی توکن‌های بعدی بسیار خوب عمل ‌کند، این است که خود زبان قابل‌پیش‌بینی است. قاعده‌مندی‌ها در زبان اغلب (اگرچه نه همیشه) با قاعده‌مندی‌های دنیای فیزیکی مرتبط هستند. به‌همین‌دلیل هنگامی که یک مدل زبانی روابط بین کلمات را می‌آموزد، به‌طور ضمنی مسائلی را نیز در مورد روابط موجود در جهان هستی یاد می‌گیرد.

علاوه بر این، شاید پیش‌بینی برای هوش بیولوژیکی و همچنین هوش مصنوعی پایه‌ای اساسی باشد. به عقیده‌ی فیلسوفانی مانند اندی کلارک مغز انسان را می‌توان به‌عنوان یک «ماشین پیش‌بینی» در نظر گرفت که وظیفه‌ی اصلی آن درک و پیش‌بینی محیط...
لطفا برای مشاهده کامل مطالب در انجمن ثبت نام کنید.
 
امضا : MOON ୨ৎ
عقب
بالا