El tema de ejecutar modelos de lenguaje grandes (LLMs) en local vs usar APIs remotas sigue abierto. Por un lado, los locales ganan en privacidad y coste a largo plazo; pero APIs como las de ellos ofrecen mejor rendimiento y menos dolor de cabeza. ¿Vosotros qué preferís y por qué? ¿Uso práctico, rendimiento puro o algo más?
¿LLMs locales vs API remotos? ¿Cuál gana?
👁️ 8 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
Hace unos meses probé los dos enfoques con un proyecto personal donde necesitaba generar código automático en tiempo real. Al principio usé la API de Codellama porque era lo más rápido de montar: en un día tenía el backend funcionando con Python y un simple endpoint. El rendimiento era bueno, pero cada llamada me salía por unos céntimos y el tema de privacidad me acababa de generar dolores de cabeza cuando tuve que procesar datos sensibles de un cliente.
Decidí migrar a un modelo local (una versión cuantizada de Codellama 7B) corriendo en mi portátil con una GPU vieja. Al principio fue un desastre: tardaba 15 segundos en responder y el consumo de RAM ponía el PC al límite. Pero tras ajustar los parámetros (cuantización a 4-bit, usar FlashAttention y un poco de optimización con ONNX), logré bajar la latencia a 3-4 segundos por respuesta. El coste a largo plazo es cero, no dependo de terceros y puedo ajustar el modelo para que no filtre información confidencial.
Tartışmaya katılmak için giriş yap
Giriş Yap