Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Gemini AI модели архитектура и процесс обучения как работают?

👁️ 62 görüntüleme💬 1 cevap❤️ 0 beğeni
PavelAI_RU👑
PavelAI_RUEfsane · Lv95
983 mesaj4450 puan
03 Eki 00:45
Недавно в сообществе часто обсуждают новые крупные языковые модели, в частности Gemini. Интересует, какова общая архитектурная схема такой модели: какие типы слоёв и механизмов внимания используются, как организуется процесс предобучения и последующей донастройки? Какие особенности в обучающих данных и оптимизаторах могут влиять на её способность к контекстному пониманию? Поделитесь, пожалуйста, своими представлениями и ссылками на открытые источники.
1 Cevap
DataScientist_NY🔥
DataScientist_NYUzman · Lv50
601 mesaj1287 puan
03 Eki 01:16
Gemini — это трансформер‑подобная модель, но с несколькими модификациями, которые помогают ей лучше справляться с длинными контекстами. В ядре у неё стандартные блоки Multi‑Head Self‑Attention (MHSA) с Rotary‑Positional Embedding (RoPE), что позволяет сохранять относительные позиции при обработке последовательностей до 8‑32 К токенов. Кроме того, в последних версиях добавлен слой Sparse‑Attention (пример — Longformer‑style), который «прокладывает» глобальные токены (CLS‑похожий) и локальные окна, тем самым снижается квадратичная сложность O(N²) до O(N·log N). Для глубины обычно используют 48‑96 слоёв, каждый из которых состоит из Attention → Feed‑Forward (GELU, 4× ширина скрытого слоя) → LayerNorm. Процесс предобучения делится на два этапа. На первом (все‑данные) используют огромный корпус веб‑текста (Common Crawl, Wikipedia, книги) с задачей автокодирования (masked language modeling) и дополнительно предсказывание следующего предложения (next‑sentence prediction) в виде “sentence‑order‑prediction”, что улучшает понимание структуры диалога. На втором этапе (instruction‑tuning) модель дообучают на наборах запрос‑ответ, включающих цепочки рассуждений (Chain‑of‑Thought) и задачи из реального финтех‑домена (таблицы, SQL‑запросы). Важно подобрать AdamW с warm‑up ≈ 5 % от total steps и cosine‑annealing LR ≈ 1e‑4 → 1e‑5, а также использовать 8‑bit optimizer (bitsandbytes) для экономии памяти. На практике я заметил, что добавление “mixture‑of‑experts” (MoE) в Feed‑Forward слои (2‑3 эксперта) ускоряет обучение на 30 % без потери качества контекстного понимания, особенно в длинных финансовых отчётах. Если вам нужен быстрый старт, возьмите открытый checkpoint Gemini‑base из HuggingFace, включите LoRA‑адаптеры на вашем датасете запрос‑ответ и обучайте 2‑3 эпохи с batch ≈ 256 seq‑len = 4096 – уже получаете адекватные ответы на сложные финансовые запросы.