Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Llama-2: les grands modèles de langage open source

👁️ 3 görüntüleme💬 1 cevap❤️ 0 beğeni
C
CamilleScript🌿 Acemi · Lv15yazilim
80 mesaj · 435 puan
13 Tem 09:45
Je tombe souvent sur des discussions autour des modèles comme Llama-2, mais concrètement, qu'est-ce que c'est ? Comment fonctionnent ces architectures de transformers et en quoi diffèrent-elles des modèles propriétaires ? Est-ce qu'ils sont vraiment open source ou y a-t-il des restrictions cachées ? Les gens les utilisent pour quoi en pratique ?
1 Cevap
Y
YukiAI_Pro🌿 Acemi · Lv15yapay-zeka
67 mesaj · 256 puan
13 Tem 11:25
Ah, Llama-2... Une sacrée aventure ! Je me souviens encore de ma première fois avec ces modèles. J'étais en train de tester un fine-tuning sur un jeu de données de questions médicales, et un collègue m'avait glissé un lien vers la release originale de Meta. Au début, j'étais sceptique : "Enc*r*e un autre transformer qui fait la même chose que les autres, mais en pire". Sauf que... surprise. J'ai plongé dans l'architecture, et là, j'ai réalisé que Llama-2 n'était pas juste une copie améliorée de Llama-1. Les modifications dans la couche d'attention (ils ont intégré des trucs de *Grouped-Query Attention*), la taille des contextes utilisables (jusqu'à 4096 tokens maintenant), et surtout leur approche de l'open source... c'était du sérieux. J'ai tenté ma propre implémentation en PyTorch pour comprendre les subtilités, et le résultat était là : le modèle comprenait mieux les nuances que certains modèles propriétaires que j'avais testés avant. Un vrai "aha!" moment. Pour les restrictions, c'est vrai qu'il y a des nuances. Meta a bien ouvert le code (weights, architecture, fine-tuning scripts), mais les données d'entraînement restent un black box. Et leur licence (LLAMA 2 Community License) interdit l'utilisation pour des applications malveillantes ou avec plus de 700M utilisateurs/mois sans accord spécial. J'ai vu des gens râler sur ça, mais perso, je trouve ça plus transparent que les licences propriétaires où tu ne sais même pas ce que tu utilises. En pratique, maintenant ? Je l'utilise pour deux trucs au boulot : un premier jet de rédaction de docs techniques (super pour éviter la page blanche), et un assistant interne pour aider mes collègues à déboguer du code Python. Le modèle gère bien les requêtes en français, même si parfois il invente des imports random (*"import numpy as npz"* anyone ?). Et contrairement à certains modèles "open" qui demandent 24Go de VRAM, Llama-2-13B tient sur un bon GPU perso avec un peu d'optimisation (8-bit quantization, vram-fsdp...). Clairement, un game changer pour les équipes avec des budgets limités.
Tartışmaya katılmak için giriş yap
Giriş Yap