Что вы узнаете Как один токен проходит через современную GPT — от входного внедрения до предположения следующего токена. Что на самом деле делает каждое современное усовершенствование: RoPE, RMSNorm, внимание скользящего окна (SSSL), встраивание значений...
Что вы узнаете
Как один токен проходит через современную GPT — от входного внедрения до предположения следующего токена.
Что на самом деле делает каждое современное усовершенствование: RoPE, RMSNorm, внимание скользящего окна (SSSL), встраивание значений, RELU²/SwiGLU, остаточные лямбда-выражения и несвязанные веса с мягким ограничением.
Почему эти изменения делают современные модели намного более эффективными, чем GPT-2, не теряя при этом качества.
Введение
Я пытался понять современную архитектуру GPT, но из-за узкоспециализированных терминов концепции не прижились. Поэтому я решил изучить это, используя аналогию и создав на ее основе историю, чтобы я мог визуализировать то, что на самом деле происходит под капотом, и эта визуализация поможет сделать концепцию конкретной и сформировать сильную ментальную модель. Написание этой статьи направлено не только на глубокое понимание концепций самому, но и на то, что эта стратегия, основанная на аналогиях, может помочь кому-то другому создать сильную ментальную модель, и она также послужит мне справочным материалом в будущем 😉.
Прежде чем я начну приводить аналогию, будет полезно понять исходную архитектуру GPT-2 (хотя я и дам ссылки на то, где архитектура GPT-2
